قام أحد مطوري المجتمع، GnLOLot، بنشر نموذج 1B الذي يعمل بشكل كامل على الأجهزة المحلية. النموذج هو MiniCPM5-1B-كلود-Opus-Fable5-التفكير، مع تصميمات GGUF لأوقات التشغيل المتوافقة مع llama.cpp. لا يحتاج إلى مفتاح API ولا يقوم بإجراء مكالمات سحابية.
النموذج المقترح
النموذج مبني على openbmb/MiniCPM5-1B. هذه القاعدة هي إصدار حقيقي وموثق من OpenBMB. إنه نموذج كثيف بمعلمة 1.08B باستخدام معيار LlamaForCausalLM بنيان. يحتوي على 24 طبقة، واهتمام بالاستعلام المجمع، وطول سياق مكون من 131.072 رمزًا مميزًا. يُبلغ OpenBMB عن SOTA مفتوح المصدر من فئة 1B ضمن مجموعة المقارنة الخاصة به.
تقوم القاعدة بالفعل بشحن قالب تفكير أصلي. يتم تبديل المنطق من خلال enable_thinking، مما يوفر وضعي “التفكير” و”عدم التفكير”. يحتفظ النموذج المشتق بهذا القالب وتنسيق استدعاء الأدوات الخاص بـ MiniCPM5.
علاوة على تلك القاعدة، قام المطور بتطبيق ضبط دقيق. تنص البطاقة على أن النموذج “تم ضبطه بشكل أكبر على بيانات Fable 5” لتحسين الترميز ومتابعة التعليمات. تكرر بطاقة GGUF هذا على أنه “بعد التدريب على بيانات Fable 5.”
كيف تم بناؤه في الواقع
الطريقة الموصوفة ليست التقطير الكلاسيكي. لا يمكنك تقليص النموذج الأصلي. وبدلاً من ذلك، يمكنك إنشاء العديد من المحادثات باستخدام نموذج المعلم. يمكنك التقاط ردودها وخطوط الاستدلال كنص. يمكنك بعد ذلك الإشراف على ضبط نموذج أساسي أصغر على تلك الخطوط.
هذا التمييز مهم للدقة. التقطير الكلاسيكي ينقل الإشارة من سجلات المعلم أو أوزانه. لا أحد يستطيع الوصول إلى أوزان أو سجلات كلود. لذلك يتم الإشراف على الضبط الدقيق للمخرجات المولدة، وليس التقطير على مستوى الوزن. على النقيض من ذلك، يستخدم النموذج الأساسي الخاص بـ OpenBMB مرحلة التقطير الموثقة على مستوى السياسة بين نقاط تفتيش المعلم والطلاب الخاصة به.
التأثير العملي هو أن نموذج 1B يتعلم تقليد تنسيق وأسلوب الاستجابة. ولا يمتص القدرة الأساسية للمعلم. لا يمكن لميزانية المعلمة 1B أن تحمل منطقًا حدوديًا.
المواصفات التي تحقق
نافذة السياق عبارة عن 128 ألف رمزًا، موروثة من القاعدة config.json (131,072). يشحن مستودع GGUF أربع عمليات تكميم. يبلغ حجم Q4_K_M حوالي 657 ميجابايت ويتم تصنيفه على أنه أصغر حجم. Q5_K_M يبلغ حجمه 751 ميجابايت تقريبًا. يبلغ حجم Q8_0 حوالي 1.1 غيغابايت وهو الإعداد الافتراضي الموصى به من قبل المشرف. F16 مساحته 2.1 جيجا تقريبا
إن “مساحة 657 ميجابايت” هي أصغر كمية، وليست النسخة الافتراضية. يتم تحميل النموذج مباشرة في llama.cpp، وOllama، وLM Studio، وjan، وKoboldCpp.
تفاعلية: كيف يعمل البناء
يشرح الشرح أدناه مسار البناء، ومقايضات البصمة، والتقسيم الصادق لما يمكن وما لا يمكن للضبط الدقيق تحقيقه.
اكتشاف المزيد من كحيل | أخبار التقنية
اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.
