أطلق فريق Tencent’s Hy Hy3. Hy3 هو نموذج خليط من الخبراء (MoE) ذو معلمة 295B. يقوم بتنشيط 21B معلمة فقط لكل رمز مميز. يتم شحن الأوزان تحت ترخيص أباتشي 2.0. يهدف Hy3 إلى التفكير وسير العمل الوكيل والمهام ذات السياق الطويل.

ما هو Hy3؟

تحتوي بنية Hy3 على وزارة تعليم متفرقة تضم 192 خبيرًا وتوجيهًا من أعلى 8. يقوم 8 خبراء فقط بإطلاق كل رمز مميز، لذلك تظل الحوسبة منخفضة.

يستخدم النموذج أيضًا طبقة التنبؤ بالرموز المتعددة (MTP). تتوقع MTP عدة رموز مميزة في وقت واحد لفك التشفير بشكل أسرع. يقوم كل من vLLM وSGLang بتمكينه من خلال فك التشفير التخميني.

ملكية قيمة
بنيان خليط من الخبراء (وزارة التربية والتعليم)
مجموع المعلمات 295 ب
المعلمات المنشطه 21 ب
معلمات طبقة MTP 3.8 ب
الطبقات (باستثناء الخطة المتوسطة الأجل) 80
طبقات الخطة المتوسطة الأجل 1
رؤساء الاهتمام 64 (GQA، رؤوس 8 كيلو فولت، رأس خافت 128)
حجم مخفي 4096
حجم متوسط 13312
طول السياق 256 ألف
حجم المفردات 120832
الخبراء 192 خبيرًا، تم تفعيل المراكز الثمانية الأولى
الدقة المدعومة BF16

منفصل Hy3-FP8 تم تحرير نقطة التفتيش أيضًا. يعمل FP8 على تقليل مساحة الذاكرة لتقديم خدمة أرخص.

المعيار والأداء

نشر فريق البحث النتائج عبر البرمجة والوكلاء والعلوم والتكنولوجيا والهندسة والرياضيات (STEM). فيما يتعلق بالترميز، سجلت Hy3 78.0 في اختبار SWE-Bench. كما سجل أيضًا 57.9 على SWE-Bench Pro و75.8 على SWE-Bench Multilingual. يهبط Terminal-Bench 2.1 عند 71.7، وDeepSWE عند 28.0.

في مجالات العلوم والتكنولوجيا والهندسة والرياضيات (STEM) والاستدلال، ترتفع الأرقام. سجلت Hy3 90.4 في GPQA Diamond و 72.0 في USAMO 2026. وصل IMOAnswerBench إلى 90.0، وHLE (مع الأدوات) يصل إلى 53.2.

أجرى فريق البحث اختبارًا أعمى مع 270 خبيرًا. جمع هذا الاختبار 312 مقارنة صالحة لسير العمل الحقيقي. سجلت Hy3 2.67 من 4، متقدمة على GLM-5.1 عند 2.51. وكانت الميزة أوضح في تطوير الواجهة الأمامية، وCI/CD، والبيانات والتخزين.

https://hy.tencent.com/research/hy3

الموثوقية وسلوك الإنتاج

ركز فريق البحث الكثير من هذا الإصدار على موثوقية الإنتاج. حظيت ثلاثة أوضاع فشل باهتمام مباشر، مدعومة بأرقام داخلية.

  • استدعاء الأداة وتنسيق الإخراج: قام الفريق بإصلاح مشكلات استقرار خط الأساس التي أدت إلى تعطل العملاء. تم إسقاط المكالمات غير الصالحة التي تؤدي إلى تكرار حلقات لا نهائية. يتم تعميم Hy3 أيضًا عبر سقالات الوكيل. في حالة التحقق من SWE-Bench، يظل تباين الدقة عبر CodeBuddy وCline وKiloCode في حدود 4%.
  • المعرفة العالمية ومكافحة الهلوسة: السلوك المستهدف بسيط: أجب عند إيقافك، ضع علامة عند عدم وجود دليل. وفي التقييمات الداخلية انخفضت نسبة الهلوسة من 12.5% ​​إلى 5.4%. وانخفضت معدلات الخطأ المنطقي من 25.4% إلى 12.7%.
  • تتبع النوايا المتعددة المنعطفات: قام SFT و RL المشتركان بتحسين المرجع الأساسي وتتبع القيد. وانخفض معدل الإصدار الداخلي من 17.4% إلى 7.9%. وفي مؤشر الحوار الطويل MRCR، ارتفعت النتائج من 42.9% إلى 75.1%.

كيفية الاتصال بـ Hy3

يعرض Hy3 واجهة برمجة التطبيقات المتوافقة مع OpenAI. يمكنك نشره باستخدام vLLM أو SGLang، ثم الاتصال بنقطة النهاية. علم واحد، reasoning_effort، يتحكم في مدى تفكير النموذج.

from openai import OpenAI

client = OpenAI(base_url="http://127.0.0.1:8000/v1", api_key="EMPTY")

response = client.chat.completions.create(
    model="hy3",
    messages=[
        {"role": "user", "content": "Refactor this function and explain the change."},
    ],
    temperature=0.9,
    top_p=1.0,
    # reasoning_effort: "no_think" (default), "low", "high" (deep chain-of-thought)
    extra_body={"chat_template_kwargs": {"reasoning_effort": "high"}},
)
print(response.choices[0].message.content)

يستخدم no_think للحصول على إجابات مباشرة، و high للرياضيات أو البرمجة أو المهام متعددة الخطوات. يوصي فريق البحث تينسنت temperature=0.9 و top_p=1.0. يمكنك أيضًا تجربة Hy3 بدون أجهزة محلية. يسرد OpenRouter أ tencent/hy3:free الطريق بسعر 0 دولار لكل رمز. ومن المقرر أن تنتهي هذه الطبقة المجانية في 21 يوليو 2026.

حيث يناسب Hy3: حالات الاستخدام

تم تصميم Hy3 حول العمل طويل السياق بأسلوب الوكيل. بعض الأمثلة الملموسة:

  • وكلاء الترميز: قم بتغذية مستودع كامل في نافذة 256 كيلو بايت. اطلب من Hy3 إصلاح الاختبار الفاشل باستخدام reasoning_effort="high". تساعد مكالمات الأدوات الثابتة على إجراء التعديلات عبر العديد من الملفات.
  • معالجة المستندات: تمرير عقد طويل أو تقديم كسياق. يقلل التدريب على مكافحة الهلوسة من الجمل الملفقة والاقتباسات الخاطئة.
  • التحليل المالي: الجمع بين الجداول والنثر في موجه واحد. اطلب ملخصًا مرتكزًا يشير إلى البيانات المفقودة بدلاً من التخمين.
  • تطوير الواجهة واللعبة: قم بإنشاء مكون React أو حلقة لعبة صغيرة. أظهر الاختبار الأعمى ميزة الواجهة الأمامية على GLM-5.1.

Hy3 مقابل GLM-5.2

قام فريق البحث في Tencent بقياس Hy3 مقابل GLM-5.2 في الملحق الخاص به. GLM-5.2 هو تقريبًا 744B MoE مع حوالي 40B من المعلمات النشطة. Hy3 أقل من نصف هذا الحجم الإجمالي، مع 21B نشط. فيما يتعلق بالبرمجة، يقود GLM-5.2 المجموعة بأكملها.

المعيار Hy3 (21B نشط) GLM-5.2 (حوالي 40 مليار نشط)
تم التحقق من مقعد SWE 78.0 84.2
SWE-مقعد متعدد اللغات 75.8 83.0
المحطة الطرفية 2.1 71.7 81.0
DeepSWE 28.0 46.2
المجموع / المعلمات النشطة 295 ب / 21 ب ~744ب / ~40ب
رخصة أباتشي 2.0 الأوزان المفتوحة

التركيز هنا على الحجم وليس النتيجة فقط. تستبدل Hy3 بعض دقة الترميز ببصمة نشطة أصغر بكثير. هذه البصمة مهمة عندما تستضيف نفسك وتدفع مقابل وحدات معالجة الرسومات.

ملاحظات النشر

يحتوي Hy3 على 295B من المعلمات الإجمالية، لذا فإن التقديم يحتاج إلى ذاكرة حقيقية. يوصي فريق البحث في Tencent باستخدام 8 وحدات معالجة رسوميات، مثل H20-3e أو البطاقات ذات الذاكرة الأكبر. يقوم كل من vLLM وSGLang بشحن الوصفات مع تمكين MTP. يبدو الحد الأدنى من إطلاق vLLM كما يلي:

vllm serve tencent/Hy3 \
  --tensor-parallel-size 8 \
  --speculative-config.method mtp \
  --speculative-config.num_speculative_tokens 2 \
  --tool-call-parser hy_v3 \
  --reasoning-parser hy_v3 \
  --enable-auto-tool-choice \
  --port 8000 \
  --served-model-name hy3

بالنسبة للضغط، يشير فريق البحث إلى ذلك AngelSlim مجموعة الأدوات. يغطي AngelSlim القياس الكمي، وطرق البت المنخفض، وأخذ العينات التأملية. توفر Tencent أيضًا خط أنابيب ضبط كامل لـ Hy3.

جربه: المستكشف التفاعلي

العرض التوضيحي أدناه عبارة عن مستكشف تفاعلي لـ Hy3. وهو يتصور توجيه وزارة التربية، وأوضاع الاستدلال، والمعايير، والكفاءة المتفرقة.