تم إصدار PrismML للتو بونساي 27 ب. إنه تمثيل منخفض البت لـ Qwen3.6-27B، وليس قطارًا مسبقًا جديدًا. الهندسة المعمارية لم تتغير.
يتم شحن نسختين تحت Apache 2.0. الثلاثي بونساي 27B يستخدم أوزان {−1, 0, +1} بمعدل 1.71 بت حقيقي لكل وزن. حجمه المثالي هو 5.9 جيجابايت. 1 بت بونساي 27 ب يستخدم الأوزان الثنائية {−1, +1} عند 1.125 بت لكل وزن، مقابل 3.9 جيجابايت.
كلاهما متعدد الوسائط. يبلغ التقسيم حوالي 24.8 مليار أوزان لغة، وبرج رؤية 0.46 مليار، و2.5 مليار في التضمينات ورأس LM. يتم الاحتفاظ ببرج الرؤية بشكل منفصل عند 4 بت (HQQ). السياق عبارة عن 262 ألف رمز مميز، ويتم الحفاظ عليه عمليًا لأن 75% تقريبًا من انتباه Qwen3.6-27B خطي.
كيف يعمل الضغط
كل وزن عبارة عن رمز، بمقياس FP16 مشترك لكل مجموعة مكونة من 128. الوزن الفعال هو w_i = s_g · t_i.
تحمل قيمة ثلاثية log2(3) ≈ 1.585 أجزاء. يضيف مقياس FP16 واحد لكل 128 وزنًا 16/128، مما يعطي ≈1.71 بت لكل وزن. هذا تخفيض ~ 9.4 × مقابل FP16. التكاليف الثنائية 1 + 16/128 = 1.125 بت، تخفيض ~14.2×.
يتم تشغيل التمثيل من النهاية إلى النهاية عبر المكونات الثقيلة للمصفوفة. هذه هي التضمينات، وإسقاطات الانتباه، وإسقاطات MLP، ورأس LM. يبقى فقط ذيل ضئيل من معلمات التطبيع والقياس دقة أعلى.
تم قياس Qwen3.6-27B “4 بت” (Q4_K_XL) كمتوسط حقيقي، وهو 5.2 بت لكل وزن. الإصدار “2 بت” (IQ2_XXS) هو 2.8. تبتعد Bonsai أيضًا عن BitNet، التي تتجنب الانهيار فقط من خلال التدريب المسبق من الصفر.
السؤال الواضح هو ما هي تكلفة الضغط من حيث الدقة.
أداء
قام PrismML بتقييم 15 معيارًا في وضع التفكير، باستخدام EvalScope مع vLLM على وحدات معالجة الرسومات H100. يحتفظ Ternary Bonsai 27B بـ 94.6% من خط الأساس FP16، ويحتفظ 1-bit Bonsai 27B بـ 89.5%.
| البديل | صحيح بي بي دبليو | البصمة | متوسط التفكير | الكثافة (1/جيجابايت) |
|---|---|---|---|---|
| Qwen3.6-27B FP16 | 16.0 | 54 جيجابايت | 85.07 | 0.051 |
| Qwen3.6-27B Q4_K_XL (“4 بت”) | 5.2 | 17.6 جيجابايت | 84.99 | 0.155 |
| Qwen3.6-27B IQ2_XXS (“2 بت”) | 2.8 | 9.4 جيجابايت | 72.73 | 0.199 |
| الثلاثي بونساي 27B | 1.71 | 5.9 جيجابايت | 80.49 | 0.400 |
| 1 بت بونساي 27 ب | 1.125 | 3.9 جيجابايت | 76.11 | 0.530 |
| فئة | FP16 | الثلاثي | 1 بت |
|---|---|---|---|
| الرياضيات | 95.33 | 93.40 | 91.66 |
| الترميز | 88.74 | 85.96 | 81.88 |
| المعرفة والعقل | 83.15 | 76.96 | 73.39 |
| استدعاء الوكيل والأداة | 80.00 | 74.01 | 66.03 |
| التعليمات التالية | 78.47 | 71.77 | 65.74 |
| رؤية | 72.61 | 65.19 | 59.57 |
تفشل الإصدارات التقليدية ذات 4 بتات فرعية بشكل مختلف. IQ2_XXS ينخفض إلى 57.5 على AIME26 و56.4 على LiveCodeBench. لا يزال يسجل 88.93 على MMLU-Redux، لذا فإن المعايير القصيرة تخفي الانهيار. يكرر Gemma-4-31B Q2_K_XL هذا النمط في النموذج الأساسي الثاني.
لكن النتائج وحدها لا تفسر إطلاق سراحهم. الذاكرة تفعل ذلك.
الذاكرة هي القيد الملزم
يعد تركيب الهاتف أكثر صرامة مما تقترحه أرقام التخزين. يحد نظام iOS من تطبيق واحد إلى ما يقرب من نصف الذاكرة الفعلية. وبالتالي فإن جهاز iPhone بسعة 12 جيجابايت يعرض حوالي 6 جيجابايت.
ذاكرة التخزين المؤقت KV هي الميزانية الثانية. تحتوي 16 طبقة فقط من أصل 64 على ذاكرة تخزين مؤقت كاملة الاهتمام، لذا فإن تكلفة FP16 تبلغ ≈64 كيلو بايت/الرمز المميز. تبلغ تكلفة النافذة 262 كيلو بايت 17.2 جيجا بايت، وذاكرة التخزين المؤقت 4 بت كيلو فولت تخفض ذلك إلى 4.3 جيجا بايت.
يتم قياس التسامح. مقابل خط الأساس FP16-KV الخاص به، يُظهر Ternary Bonsai 0.0011 ناتس من الإنتاج للأمام-KL على MATH-500. يظهر Q4_K_XL 0.0146.
تتبع القمم. عند 100 ألف رمز مميز مع ذاكرة تخزين مؤقت FP16، يصل الحد الأقصى للبت الواحد إلى 11.6 جيجابايت والثالث إلى 14.7 جيجابايت. يحتاج صف Q4_K_XL المشتق إلى ≈25.6 جيجابايت.
بمجرد ملاءمة النموذج، تصبح الإنتاجية هي السؤال التالي.
الإنتاجية وفك التشفير التخميني DSpark
| منصة | البديل | tg128 | ص512 |
|---|---|---|---|
| M5 ماكس | ثنائي | 66.4 | 874 |
| ام 5 برو | الثلاثي | 26.2 | 393 |
| ايفون 17 برو ماكس | ثنائي | 11.0 | 111 |
| H100 (كودا) | ثنائي | 104.8 | 2755 |
يرتبط الإنشاء بعرض النطاق الترددي للذاكرة، لذا فإن عدد البايتات الأقل في كل خطوة يعني المزيد من الرموز المميزة في الثانية. التعبئة المسبقة مرتبطة بالحساب ومكاسب أقل.
تقوم PrismML أيضًا بشحن أداة صياغة DSpark المدربة ضد هدف Bonsai 27B. على H100 عند عمق السحب k=4، يصل الهدف الثنائي إلى الطول المقبول τ=3.6. أي 143.8 tok/s، أي 1.37× تسريع. لا يتم التحقق من فقدان البيانات، لذا يظل الإخراج متطابقًا مع التوزيع. في Apple Silicon، يتم إيقاف تشغيل أداة الصياغة بشكل افتراضي عند حجم الدُفعة 1.
تشغيله
Ternary 27B هو الريبو التجريبي الافتراضي. ابدأ تشغيل الخادم أو أنشئ مباشرة:
./scripts/start_llama_server.sh # OpenAI-compatible API + chat/vision UI on :8080
./llama-cli -m ./Ternary-Bonsai-27B-gguf/Ternary-Bonsai-27B-Q2_0.gguf \
--mmproj ./Ternary-Bonsai-27B-gguf/mmproj.gguf -c 0 \
-p "Explain KV cache growth."
mlx_lm.generate --model prism-ml/Ternary-Bonsai-27B-mlx-2bit \
--prompt "Explain KV cache growth."
يستخدم استدعاء الأدوات أسلوب OpenAI القياسي tools صفيف:
curl http://localhost:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"messages": [{"role": "user", "content": "What is the weather in Lisbon?"}],
"tools": [{
"type": "function",
"function": {
"name": "get_weather",
"parameters": {"type": "object", "properties": {"city": {"type": "string"}}, "required": ["city"]}
}
}]
}'
تعود المكالمة choices[0].message.tool_calls. يتم تشغيل وضع التفكير بشكل افتراضي؛ thinking_budget_tokens تبديله لكل طلب.
وهذا يعين أربعة أنماط نشر.
حالات الاستخدام
يقوم وكلاء الكمبيوتر المحمول المحليون بتشغيل البنية الثلاثية لرمز المستودع الكامل الذي يعمل على أكثر من 262 ألف رمز مميز. يعمل المنطق المحلي عبر الهاتف على تشغيل البنية ذات 1 بت؛ يقيس التقرير التقني 672 رمزًا لكل 1% من بطارية iPhone. تحافظ مسارات العمل الحساسة للخصوصية وغير المتصلة بالإنترنت على المطالبات على الجهاز من خلال الإنشاء. بالاشتراك مع ذاكرة التخزين المؤقت KV 4 بت، تتناسب خدمة وحدة معالجة الرسومات المفردة مع جودة فئة 27B على بطاقة سعة 24 جيجابايت.
الوجبات السريعة الرئيسية
- ينقل Bonsai 27B Qwen3.6-27B إلى أوزان ثنائية أو ثلاثية، وليس إلى قطار مسبق جديد.
- يحتفظ Ternary بنسبة 94.6% من FP16 بسعة 5.9 جيجابايت؛ 1 بت يحتفظ بنسبة 89.5% عند 3.9 جيجابايت.
- تدعي PrismML أن الإصدار 1 بت هو أول طراز من فئة 27B يناسب الهاتف.
- تنهار الإصدارات التقليدية ذات 4 بتات فرعية بشكل انتقائي على AIME وLiveCodeBench والمهام الوكيلة.
- يتم شحن كل شيء ضمن Apache 2.0، على llama.cpp (CUDA، Metal) وMLX.
تحقق من التفاصيل الفنية, جيثب الريبو و وزن النموذج. أيضا، لا تتردد في متابعتنا على تغريد ولا تنسى الانضمام إلينا 150 ألف + مل والاشتراك في النشرة الإخبارية لدينا. انتظر! هل أنت على برقية؟ الآن يمكنك الانضمام إلينا على التليجرام أيضًا.
هل تحتاج إلى الشراكة معنا للترويج لصفحة GitHub Repo أو صفحة الوجه المعانقة أو إصدار المنتج أو الندوة عبر الويب وما إلى ذلك؟ تواصل معنا
اكتشاف المزيد من كحيل | أخبار التقنية
اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.
