llama.cpp
llama.cpp 0.5.0 يجعل الخادم يستمع على أكثر من عنوان ويقرأ إعدادات التوليد من متغيّرات البيئة
فُحص آلياً على صفحة llama.cpp في · لم يؤكّده شخص.
يركّز الإصدار llama.cpp 0.5.0 على أداء المنصّات الخلفية وصحّتها، وعلى تغطية أوسع للنماذج، وعلى تشغيل أمتن للخادم والموجِّه. ويعدّد ملخّص المشروع نفسه ما يعنيه ذلك: دعم HRM-Text (DFM Mimir 1B)، وتحويل MiMo-V2.6 وHunyuanOCR، وggml 0.25.0، والاستماع على أكثر من عنوان HTTP، ومخرجات صور من استدعاءات الدوالّ، وإصلاحات لمحلّل المحادثة والواجهة. وتؤرّخه صفحة الإصدار في 23 أيلول الساعة 20:50. إن كنت تشغّل الخادم المدمج، فتغييران من هذه يغيّران طريقة تشغيلك له — وإن كنت تشغّل النماذج على Mac أو على بطاقة NVIDIA، فتغييران آخران يغيّران ما يجري تحته.
ما الذي تغيّر
صار الخادم قادراً على الاستماع على أكثر من عنوان. وعملياً هذا هو الخيار--host: صار يقبل عناوين TCP مفصولة بفواصل، ويقبل مقابس UNIX أيضاً. وإعدادات التوليد التي كنت تمرّرها خيارات في سطر الأوامر صار ممكناً أن تأتي من متغيّرات البيئة: درجة الحرارة وtop-p وmin-p والعقوبات. وصار خرج استدعاء الدالّة الذي يعود إلى الخادم قادراً على أن يحملinput_image.
وفي النماذج، يضيف الإصدار دعم HRM-Text / DFM Mimir 1B ودعم تحويل MiMo-V2.6. وفي الصور، أُصلح تجاوز في مخزن SigLIP المؤقّت كان يقع مع الصور الطويلة جدّاً أو العريضة جدّاً.
وتحت النماذج، تسارعت عمليّة conv2d على CUDA باستخدام implicit GEMM ، وحصلت Metal على تحسينات دمج لعمليّات MoE وSSM_CONV. وانتقلت ggml إلى v0.25.0 ، وهو إصدار تصفه الصفحة بأنّه يوسّع دعم hyper-connection وflash-attention ودمج MoE/SSM عبر المنصّات الخلفية، مع تحسينات في المتانة والتكميم وتخطيط البيانات وRPC. ومن تغييرات واجهته البرمجية أنّ الإصدار الرئيسي لبروتوكول RPC صار 7.
أمّا الموجِّه — الجزء من الخادم الذي يطلق عمليّة فرعية لكلّ نموذج — فنال إصلاحين: أُصلحت حالات التسابق عند إخلاء النماذج وإدارة دورة حياة العمليّات الفرعية ، ولم يعد ملفّ السجلّ ولا ملفّ مفتاح الواجهة البرمجية يُمرَّران إلى العمليّات التي يطلقها.
ما كان قبل ذلك
تعرض الصفحة كلّ ما سبق على أنّه التغييرات منذ v0.4.1. وفي ذلك الإصدار انتقلت ggml من v0.23.0 إلى v0.24.0 ؛ وهذا الإصدار ينقلها إلى v0.25.0.
ما معناه لك
إن كنت تصل إلى الخادم من أكثر من مكان — من جهازك نفسه ومن شبكتك المحلّية مثلاً، أو من أداة محلّية عبر مقبس UNIX — فلم تعد بحاجة إلى خادمين أو إلى وسيط أمام خادم واحد: أعطِ --hostالعناوين مفصولة بفواصل.
وإن كنت تشغّل الخادم خدمةً في الخلفية أو داخل حاوية، حيث ضبط البيئة أسهل من تعديل سطر الأوامر، فصار بإمكان إعدادات التوليد أن تسكن هناك. ملاحظة الإصدار تسمّي الإعدادات لا أسماء المتغيّرات، فتأكّد من الأسماء الدقيقة قبل أن تعتمد عليها، وتذكّر أنّ متغيّر البيئة والخيار في سطر الأوامر صار بإمكان كليهما ضبط الشيء نفسه.
وإن كنت تقدّم عدّة نماذج عبر الموجِّه وتحفظ مفتاح الواجهة البرمجية في ملفّ، فذلك الملفّ لم يعد يُسلَّم لكلّ عمليّة فرعية. هذا مكان أقلّ يُنسخ إليه مفتاحك، وسبب للتحديث إن كنت تشغّل الموجِّه على جهاز مشترك.
وإن كنت تشغّل نموذج رؤية، فحدّث قبل أن تعطيه صوراً طويلة جدّاً أو عريضة جدّاً: هذه هي الحالة التي يعالجها إصلاح SigLIP. وإن كنت تستخدم منصّة RPC في llama.cpp عبر أكثر من جهاز، فحدّث الأجهزة كلّها معاً — فالإصدار الرئيسي للبروتوكول صار 7.
وعلى Mac أو على بطاقة NVIDIA قد يغيّر العمل على المنصّات الخلفية سرعتك، لكنّ الصفحة لا تعطي أرقاماً. قِس على جهازك أنت، قبل التحديث وبعده؛ وما يحدّد النتيجة يشرحه دليلناأيّ جهاز يشغّل نموذجاً محلّيّاً.
المصدر
صفحة الإصدار على GitHub: llama.cpp v0.5.0، ضمن منظّمة ggml-org.