أصدرت Cohere للتو Command A+، كنموذج مفتوح المصدر يستهدف سير العمل الوكيل للمؤسسات. يتوفر Command A+ بموجب ترخيص Apache 2.0، وهو عبارة عن نموذج خليط من الخبراء (MoE) تم تصميمه للمهام الوكيلة عالية الأداء مع الحد الأدنى من الحمل الحسابي. تم تحسين النموذج للاستدلال وسير العمل الوكيل وRAG ومعالجة المستندات متعددة اللغات ومتعددة الوسائط. فهو يوحد القدرات من أربعة نماذج سابقة – الأمر أ، والأمر أ، والأمر أ، والرؤية، والأمر أ للترجمة – في نموذج واحد قابل للتطوير.

بنيان

الأمر A+ عبارة عن محول متفرق من الخبراء لوحدة فك التشفير فقط مع إجمالي 218B من المعلمات و25B من المعلمات النشطة. لديها 128 خبيرًا، 8 منهم نشطون لكل رمز مميز، ويتم تطبيق خبير مشترك واحد على جميع الرموز المميزة. في نموذج MoE، يتم توجيه كل رمز عبر مجموعة فرعية فقط من الشبكات الفرعية المتخصصة بدلاً من مجموعة المعلمات الكاملة، مما يحافظ على الحوسبة النشطة عند مقياس 25B من المعلمات في وقت الاستدلال.

تتداخل طبقات الانتباه مع طبقات انتباه النافذة المنزلقة مع التضمينات الموضعية الدورانية وطبقات الاهتمام الشاملة بدون التضمينات الموضعية بنسبة 3:1. يتم تدريب طبقة MoE المتفرقة بطريقة غير متساقطة تمامًا وتستخدم جهاز توجيه لاختيار الرمز المميز، مع سيني مقيس فوق سجلات الخبراء top-k لكل رمز مميز.

طرق الإدخال هي النص والصورة واستخدام الأداة. طرائق الإخراج هي النص، والمنطق، واستخدام الأداة. يدعم النموذج طول سياق الإدخال 128 كيلو بايت وطول الجيل الأقصى 64 كيلو بايت.

متطلبات الأجهزة والتكميم

تتوفر ثلاثة متغيرات للتكميم مع الحد الأدنى من متطلبات وحدة معالجة الرسومات: يتطلب BF16 (16 بت) 4 × B200 أو 8 × H100 وحدات معالجة الرسومات؛ يتطلب FP8 (8 بت) وحدات معالجة رسومات 2× B200 أو 4× H100؛ يعمل W4A4 (4 بت) على وحدة معالجة رسومات واحدة B200 أو 2×H100. تظهر جميع الكميات الثلاثة اختلافات ضئيلة في الجودة القياسية. توصي Cohere بـ W4A4 لمعظم عمليات النشر.

W4A4 منهجية التكميم

تطبق Cohere تكميم NVFP4 W4A4 وأوزان 4 بت وعمليات التنشيط مع مقياس على مستويين، على خبراء وزارة التعليم فقط. يتم الاحتفاظ بمسار الانتباه، بما في ذلك إسقاطات Q/K/V/O، وذاكرة التخزين المؤقت KV، وحساب الانتباه، بدقة كاملة.

لسد فجوات الجودة المتبقية، تستخدم Cohere تقنية التقطير الكمي (QAD) في مرحلة ما بعد التدريب: يتم تدريب نموذج الطالب الكمي ليتوافق مع توزيع مخرجات المعلم بدقة كاملة، وذلك باستخدام عوامل التكميم المزيفة في التمريرة الأمامية والمقدرات المباشرة في التمريرة الخلفية.

https://cohere.com/blog/command-a-plus

نماذج الأداء مقابل الأوامر المسبقة أ

في شركة τ²-Bench Telecom، تحسنت النتائج من 37% إلى 85% مقارنة بالاستدلال بالأمر أ، ووصل أداء التشفير الوكيل الثابت لـ Terminal-Bench إلى 25% من 3%.

في التقييمات الداخلية لمنصة North، تم تسجيل جميع النقاط باستخدام تقنيات LLM-as-a-قاضي، وتحسنت دقة الإجابة على أسئلة الوكيل بنسبة 20% مقارنة بالاستدلال المنطقي. يقيس Agentic QA مدى نجاح النموذج في الإجابة على أسئلة المؤسسة باستخدام أنظمة الملفات السحابية المتصلة بـ MCP. تحسنت جودة تحليل جداول البيانات بنسبة 32%، وسجلت جودة استخدام الذاكرة – قياس مدى نجاح الوكيل في الاستفادة من المعلومات من جلسة سابقة للإجابة على الأسئلة في جلسة لاحقة – 54% مع الأمر A+ مقارنة بنسبة 39% مع الأمر A Reasoning.

يعد Command A+ أول نموذج تفكير متعدد الوسائط لشركة Cohere. لقد حققت 63% في MMMU Pro و75.1% في MMMU، مقارنة بـ 65.3% في Command A Vision على الأخير. تحسنت نتائج MathVista من 73.5% إلى 80.6%، وتحسن منطق CharXiv من 46.9% إلى 52.7%.

يعمل Command A+ على توسيع التغطية متعددة اللغات من 23 إلى 48 لغة، مع تحقيق مكاسب في الترجمة الآلية والتفكير متعدد اللغات.

حصل Command A+ على 37 نقطة في مؤشر ذكاء التحليل الاصطناعي، متفوقًا على النماذج المفتوحة الرائدة الأخرى.

https://cohere.com/blog/command-a-plus
https://cohere.com/blog/command-a-plus

السرعة والكمون

عند نفس مستويات التكميم والتزامن، يوفر Command A+ رموز إخراج أعلى بنسبة تصل إلى 63% في الثانية (TOPS) ويقلل وقت ظهور أول رمز مميز (TTFT) بنسبة تصل إلى 17% مقارنةً باستدلال الأمر A. يساهم تكميم W4A4 في زيادة إضافية في السرعة بنسبة 47% وتقليل زمن الوصول بنسبة 13%. يوفر فك التشفير التخميني، الذي تم تحسينه خصيصًا لبنية MoE، تسريعًا إضافيًا للاستدلال بمقدار 1.5–1.6× لكل من المدخلات النصية ومتعددة الوسائط.

رمز مميز

يعد Command A+ هو النموذج الأول الذي يستخدم أحدث رمز مميز من Cohere، مما يقلل من عدد الرموز المميزة المطلوبة لإنشاء نفس الاستجابة. تحسنت كفاءة الترميز بنسبة 20% للغة العربية، و16% للغة الكورية، و18% للغة اليابانية.

ابدء

النموذج مدعوم بواسطة vLLM وTransformers. تتم معالجة استخدام الأداة من خلال قوالب الدردشة في Transformers باستخدام مخطط JSON لأوصاف الأداة. عند تمكين الاستدلال، يقوم النموذج بإنشاء آثار تفكير بين <|START_THINKING|> و <|END_THINKING|> العلامات قبل إنتاج الإجابة النهائية.

يتطلب متغير W4A4 vLLM ≥0.21.0 و cohere_melody>=0.9.0 لتحليل استجابة دقيقة. توصي Cohere بمعلمات أخذ العينات التالية: temperature=0.9, top_p=0.95، و repetition_penalty=1.04.

الوجبات السريعة الرئيسية

  • يحتوي الأمر A+ على 218 مليارًا إجماليًا / 25 مليار معلمة نشطة في بنية Sparse MoE، والتي تم إصدارها ضمن Apache 2.0.
  • تطبق W4A4 تقدير كمية NVFP4 على خبراء وزارة التربية فقط مع التدريب اللاحق لـ QAD، والذي يعمل على 2 × H100s.
  • τ²-تحسنت شركة Bench Telecom من 37% إلى 85%؛ قوة المقعد الطرفي من 3% إلى 25% مقابل التفكير المنطقي للأمر.
  • زادت TOPS بما يصل إلى 63% وانخفضت TTFT بما يصل إلى 17% مقابل استدلال الأمر A عند مطابقة التكميم.
  • يعد Command A+ أول نموذج استدلال متعدد الوسائط من Cohere، مما يؤدي إلى توسيع دعم اللغة من 23 إلى 48 لغة.

تحقق من الأوزان النموذجية و التفاصيل الفنية. أيضا، لا تتردد في متابعتنا على تغريد ولا تنسى الانضمام إلينا 150 ألف+ مل من SubReddit والاشتراك في النشرة الإخبارية لدينا. انتظر! هل أنت على برقية؟ الآن يمكنك الانضمام إلينا على التليجرام أيضًا.

هل تحتاج إلى الشراكة معنا للترويج لصفحة GitHub Repo أو صفحة الوجه المعانقة أو إصدار المنتج أو الندوة عبر الويب وما إلى ذلك؟ تواصل معنا


ميشال سوتر متخصص في علوم البيانات وحاصل على درجة الماجستير في علوم البيانات من جامعة بادوفا. بفضل أساس متين في التحليل الإحصائي والتعلم الآلي وهندسة البيانات، تتفوق ميشال في تحويل مجموعات البيانات المعقدة إلى رؤى قابلة للتنفيذ.


اكتشاف المزيد من كحيل | أخبار التقنية

اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.

شاركها.
اترك تعليقاً

اكتشاف المزيد من كحيل | أخبار التقنية

اشترك الآن للاستمرار في القراءة والحصول على حق الوصول إلى الأرشيف الكامل.

متابعة القراءة