في حين أن الإنجازات الأخيرة في استدلال الذكاء الاصطناعي كانت مدفوعة إلى حد كبير بنطاق واسع، حيث تم ضخ مليارات من المعلمات لعبور العتبات المعرفية المعقدة.فيبي ثينكر-3B يرسم مسارًا مختلفًا تمامًا.

يثبت هذا النموذج الذي يحتوي على 3 مليارات معلمة، والذي ابتكره باحثون من شركة Sina Weibo Inc (الصين)، أن الكفاءة يمكن أن تتجاوز فئة وزنها بكثير. تم إصدار VibeThinker-3B بموجب ترخيص مفتوح المصدر من معهد ماساتشوستس للتكنولوجيا (MIT)، وهو يطابق أداء النماذج مئات أضعاف حجمه في مهام يمكن التحقق منها مثل الرياضيات والبرمجة وتخصصات العلوم والتكنولوجيا والهندسة والرياضيات (STEM).

ما هو فيبي ثينكر-3B

VibeThinker-3B هو نموذج كثيف مدمج مبني على قاعدة Qwen2.5-Coder-3B. يتم تدريبه بعد التدريب، وليس تدريبًا مسبقًا من الصفر. يطبق فريق البحث الضبط الدقيق الخاضع للإشراف، والتعلم المعزز، والتقطير الذاتي في الأعلى.

يواصل إطار التدريب مبدأ الطيف إلى الإشارة (SSP) من VibeThinker-1.5B السابق. يبني SFT (الضبط الدقيق الخاضع للإشراف) مساحة واسعة من مسارات التفكير الصحيحة، “الطيف”. ثم يقوم RL بتضخيم المسارات الصحيحة، “الإشارة”.

يستهدف النموذج وظيفة واحدة: الاستدلال حيث يمكن للمدقق تأكيد الإجابة. يوصي فريق البحث بنماذج عامة أكبر للمهام المعرفية ذات المجال المفتوح. VibeThinker-3B متخصص في التصميم.

يتم تشغيله على مداخن القياسية. تتطلب الأوزان النموذجية transformers>=4.54.0. للاستدلال بشكل أسرع فإنه يوصي vLLM==0.10.1 أو SGLang>=0.4.9.post6. تبلغ أوزان BF16 حوالي 6 جيجابايت، وهي صغيرة بما يكفي لوحدة معالجة رسومات واحدة.

https://arxiv.org/pdf/2606.16140v1

المعيار

في AIME26، حصل VibeThinker-3B على 94.3. وفقًا لورقة البحث، فإن هذا مشابه لـ DeepSeek V3.2 (671B) وKimi K2.5 (1T).

في LiveCodeBench v6، يصل إلى 80.2 Pass@1. في OJBench، وهو معيار آخر للكود، حصل على 38.6، وهو أقل من أكبر النماذج. على HMMT25 حصل على 89.3، وعلى BruMO25 وصل إلى 93.8. في IMO-AnswerBench، مجموعة مستوى IMO المكونة من 400 مشكلة، حصلت على 76.4.

ويقارن الجدول أدناه بنماذج الاستدلال الأكبر بكثير. يستخدم الصف “+CLR” مقياس وقت الاختبار. إنه يعني تقييم الموثوقية على مستوى المطالبة

نموذج بارامس AIME26 همت25 المنظمة البحرية الدولية-الإجابة LCBv6 GPQA-D
فيبي ثينكر-3B 3 ب 94.3 89.3 76.4 80.2 70.2
فيبي ثينكر-3B +CLR 3 ب 97.1 95.4 80.6 72.9
GPT-OSS (عالي) 120 ب 93.2 90.0 75.6 81.9 80.1
ديب سيك V3.2 671 ب 94.2 90.2 78.3 80.8 82.4
جي إل إم-5 744 ب 95.8 97.9 82.5 85.5 86.0
كيمي K2.5 1 ت 93.3 95.4 81.8 85.0 87.6
المصدر: التقرير الفني لـ VibeThinker-3B، الجدول 2. GPQA-D هو GPQA-Diamond.

النمط متسق. وفقًا للرياضيات والتعليمات البرمجية التي يمكن التحقق منها، يقع النموذج 3B بالقرب من المجموعة العلوية. في معيار GPQA-Diamond، وهو معيار كثيف المعرفة، تظل الفجوة في النماذج الكبيرة واضحة.

أجرى فريق البحث أيضًا اختبارًا للترميز خارج التوزيع. واستخدمت مسابقات LeetCode الأسبوعية ونصف الأسبوعية الأخيرة، في الفترة من 25 أبريل إلى 31 مايو 2026. وقد اجتاز النموذج 123 من أصل 128 محاولة إرسال بايثون الأولى. هذا هو معدل قبول 96.1٪ للمشاكل غير المرئية.

داخل خط أنابيب الطيف إلى الإشارة

يمر خط أنابيب ما بعد التدريب بأربع مراحل. يستهدف كل واحد نقطة ضعف مختلفة في نماذج الاستدلال الصغيرة.

يأتي أولا SFT القائم على المناهج الدراسية على مرحلتين. تغطي المرحلة الأولى الرياضيات والتعليمات البرمجية والعلوم والتكنولوجيا والهندسة والرياضيات (STEM) والحوار والتعليمات التالية على نطاق واسع. تنتقل المرحلة الثانية إلى العينات الأصعب والأطول التي تمت تصفيتها حسب طول التفكير والصعوبة. تحافظ عملية التقطير المستكشفة للتنوع على مسارات حل صالحة متعددة خلال كلتا المرحلتين.

يأتي الثاني المنطق متعدد المجالات RL. يقوم فريق البحث بإعادة استخدام تحسين السياسة الموجهة بواسطة MaxEnt (MGPO). تطالب أوزان MGPO بالقرب من حدود القدرة الحالية للنموذج، حيث تتعايش عمليات الطرح الصحيحة وغير الصحيحة. يتم التدريب بالتسلسل عبر الرياضيات والبرمجة والعلوم والتكنولوجيا والهندسة والرياضيات (STEM).

تفاصيل ملحوظة: يقوم VibeThinker-3B بإسقاط توسيع السياق التدريجي. وجد فريق البحث أن عمليات الإحماء عالية القطع تؤذي التفكير الطويل على هذا النطاق. لذلك يستخدم RL نافذة واحدة ذات سياق طويل بطول 64 كيلو بايت طوال الوقت.

يضيف Math RL مرحلة Long2Short. فهو يعيد توزيع المكافأة بين المسارات الصحيحة حسب الطول. تحصل الإجابات الصحيحة الأقصر على مكافأة أعلى، بينما تحصل الإجابات الأطول على مكافأة أقل، مع عدم تغيير متوسط ​​المجموعة. الهدف هو عدد أقل من الرموز المميزة دون فقدان الدقة.

ثالث، يقوم التقطير الذاتي دون اتصال بدمج نقاط تفتيش RL مرة أخرى في نموذج طالب واحد. الرابع، يعمل Instruct RL على تحسين الالتزام بالتعليمات. تشرح هذه المرحلة درجات 93.4 IFEval و74.5 IFBench. كلاهما يظهر أن ضبط المنطق لم يكسر إمكانية التحكم.

CLR: القياس في وقت الاختبار، وليس عدد المعلمات

تقييم الموثوقية على مستوى المطالبة (CLR) هو أسلوب قياس وقت الاختبار الخاص بالتقرير. يتم تشغيله على مهام يمكن التحقق من الإجابة عليها ولا يضيف أي معلمات.

يتكون الإجراء من خطوتين. يقوم النموذج أولاً بإنشاء K = 32 مسارًا لكل مشكلة. ويستخرج من كل منها M = 5 مطالبات ذات صلة بالقرار بالإضافة إلى الإجابة النهائية.

ثم يعمل النموذج بمثابة أداة التحقق الخاصة به. فهو يتحقق من صحة أو تزوير كل مطالبة، وينتج أحكامًا ثنائية. يقوم CLR بتعيين هذه إلى درجة موثوقية المسار غير الخطي، حيث يؤدي ادعاء ضعيف واحد إلى خفض الوزن بشكل حاد.

يتم تجميع الإجابات حسب التكافؤ، وتفوز الإجابة ذات الموثوقية الأعلى. يتم تشغيل التدفق الكامل 8 مرات، ويتم الإبلاغ عن متوسط ​​Pass@1. يرفع CLR AIME26 إلى 97.1 وBruMO25 إلى 99.2.

يتيح لك العرض التوضيحي التفاعلي أدناه قلب المطالبات ومشاهدة انهيار النتيجة. كما يتيح لك أيضًا تبديل المعايير والمقارنة مع النماذج الأكبر حجمًا.


استخدام الحالات مع الأمثلة

قام فريق البحث بتصنيف VibeThinker-3B على أنه متخصص، لذا تتبع حالات الاستخدام حدود الاستدلال التي يمكن التحقق منها.

  • تدريس الرياضيات التنافسية: إنه يحل مشاكل أسلوب AIME وHMMT مع سلاسل كاملة من الاستدلال. يمكن لأداة الدراسة أن تولد حلولاً عملية وتتحقق ذاتيًا من الإجابات محليًا.
  • مساعدة في الترميز الخوارزمي: يشير معدل قبول LeetCode البالغ 96.1% إلى إنشاء بايثون قوي لمرة واحدة. يمكن لمساعد IDE صياغة حلول على غرار المسابقة وإجراء اختبارات مخفية.
  • RL أو الواجهات الخلفية للوكيل حساسة للتكلفة: نموذج 3B رخيص للخدمة على نطاق واسع. يمكن للفرق التي تدير العديد من المهام الفرعية التي يمكن التحقق منها توجيهها هنا بدلاً من نموذج 600B+.
  • المنطق على الجهاز. تناسب أوزان BF16 وحدة معالجة رسومات مستهلكة واحدة. تكتسب عمليات النشر المتطورة أو غير المتصلة بالإنترنت محركًا منطقيًا بدون مكالمات سحابية.

تشغيله: بداية سريعة

يعرض العرض باستخدام vLLM نقطة نهاية متوافقة مع OpenAI:

pip install vllm
vllm serve "WeiboAI/VibeThinker-3B"

curl -X POST "http://localhost:8000/v1/chat/completions" \
  -H "Content-Type: application/json" \
  --data '{
    "model": "WeiboAI/VibeThinker-3B",
    "messages": [{"role":"user","content":"Prove there are infinitely many primes."}],
    "temperature": 1.0, "top_p": 0.95
  }'

يعكس استخدام Direct Transformers البطاقة الرسمية:

from transformers import AutoModelForCausalLM, AutoTokenizer

tok = AutoTokenizer.from_pretrained("WeiboAI/VibeThinker-3B", trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    "WeiboAI/VibeThinker-3B", torch_dtype="bfloat16", device_map="auto")

msgs = [{"role": "user", "content": "Your prompt"}]
text = tok.apply_chat_template(msgs, tokenize=False, add_generation_prompt=True)
inputs = tok([text], return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=102400,
                     do_sample=True, temperature=1.0, top_p=0.95)
print(tok.decode(out[0][inputs.input_ids.shape[-1]:], skip_special_tokens=True))

العالي max_new_tokens يهم. يُنتج النموذج آثارًا طويلة للاستدلال، لذا يمكن للأحرف الكبيرة القصيرة أن تقطع الإجابات.

الوجبات السريعة الرئيسية

  • VibeThinker-3B هو نموذج كثيف 3B، مرخص من MIT، ومبني على Qwen2.5-Coder-3B للاستدلال الذي يمكن التحقق منه.
  • لقد سجل 94.3 على AIME26، مقارنة بـ DeepSeek V3.2 (671B) وKimi K2.5 (1T).
  • يرفع مقياس وقت اختبار CLR AIME26 إلى 97.1 وBruMO25 إلى 99.2، بدون أي معلمات إضافية.
  • في مسابقات LeetCode غير المرئية، نجحت في اجتياز 123 من أصل 128 محاولة إرسال بايثون الأولى (96.1%).
  • المكسب محدود: فهو يتبع نماذج كبيرة على GPQA-Diamond ومعرفة واسعة النطاق بالمجال المفتوح.

تحقق من ورق, وزن النموذج و الريبو. أيضا، لا تتردد في متابعتنا على تغريد ولا تنسى الانضمام إلينا 150 ألف + مل والاشتراك في النشرة الإخبارية لدينا. انتظر! هل أنت على برقية؟ الآن يمكنك الانضمام إلينا على التليجرام أيضًا.

هل تحتاج إلى الشراكة معنا للترويج لصفحة GitHub Repo أو صفحة الوجه المعانقة أو إصدار المنتج أو الندوة عبر الويب وما إلى ذلك؟ تواصل معنا



اكتشاف المزيد من كحيل | أخبار التقنية

اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.

شاركها.
اترك تعليقاً

اكتشاف المزيد من كحيل | أخبار التقنية

اشترك الآن للاستمرار في القراءة والحصول على حق الوصول إلى الأرشيف الكامل.

متابعة القراءة