كان Junyang Lin هو القائد الفني لمشروع Qwen التابع لشركة Alibaba. وأعلن تنحيه في 3 مارس 2026. وهو الآن يدرج نفسه كباحث مستقل على موقعه الشخصي.

في محاضرة بعنوان “كوين: نحو نموذج / وكيل عام”، يتجول في عائلة كوين. وينتهي بسطر واحد: “نماذج التدريب -> وكلاء التدريب”. وقام لاحقًا بتوسيع هذا الخط إلى منشور تفصيلي كباحث مستقل. تقرأ هذه المقالة الحديث والمنشور التفصيلي معًا.

ما يغطيه حديث لين في الواقع

الحديث عبارة عن جولة في عائلة Qwen النموذجية، وليس إصدارًا واحدًا. ويتحرك عبر QwQ-32B، وQwen2.5-Max، وQwen3، وQwen2.5-VL، وQwen2.5-Omni. تعرض كل محطة مخططات مرجعية مقابل المعاصرين. تتضمن خطوط الأساس المسماة DeepSeek-R1 وGrok 3 Beta وGemini 2.5 Pro وسلسلة O OpenAI.

تحمل محطة Qwen3 أكبر قدر من التفاصيل. يسلط لين الضوء على أنماط التفكير الهجين: وضع التفكير للاستدلال خطوة بخطوة، ووضع عدم التفكير للاستجابات شبه الفورية. ويضيف ميزانيات التفكير الديناميكي، حتى يتمكن المتصلون من تحديد مقدار أسباب النموذج. قام Qwen3 بتوسيع الدعم متعدد اللغات من 29 إلى 119 لغة ولهجة.

يسرد العرض التقديمي العديد من أنواع وأحجام النماذج من 0.6B إلى 235B من المعلمات. كما يسرد أيضًا التنسيقات الكمية بما في ذلك GGUF، وGPTQ، وAWQ، وMLX، وكلها ضمن Apache 2.0. يتبع ذلك عرضان تجريبيان: عرض توضيحي لـ Web Dev وعرض توضيحي للأبحاث العميقة. تشير شريحة “العمل المستقبلي” الختامية إلى الوكلاء. فهو يسرد المزيد من التدريب المسبق، وRL مع ردود الفعل البيئية، وسياق أطول، والمزيد من الطرائق. الإشارة الرئيسية الأخيرة هي “نماذج التدريب -> وكلاء التدريب”.

معمارية Qwen3، كما هو موضح في الحديث

تتضمن المحاضرة جداول معمارية Qwen3، الموضحة أدناه.

نموذج طبقات الرؤوس (Q/KV) تضمين التعادل / الخبراء (المجموع / القانون) سياق
Qwen3-0.6B 28 16 / 8 التعادل: نعم 32 ألف
Qwen3-1.7B 28 16 / 8 التعادل: نعم 32 ألف
كوين3-4ب 36 32 / 8 التعادل: نعم 32 ألف
كوين3-8ب 36 32 / 8 التعادل: لا 128 ألف
كوين3-14ب 40 40 / 8 التعادل: لا 128 ألف
Qwen3-32B 64 64 / 8 التعادل: لا 128 ألف
Qwen3-30B-A3B 48 32 / 4 الخبراء : 128 / 8 128 ألف
Qwen3-235B-A22B 94 64 / 4 الخبراء : 128 / 8 128 ألف

تربط النماذج الكثيفة الصغيرة تضمينات الإدخال والإخراج وتستخدم سياق 32 كيلو بايت. تقوم النماذج الأكبر حجمًا ونماذج MoE بإسقاط الربط وتوسيع السياق إلى 128 كيلو بايت. يقوم نموذجا وزارة التربية بتنشيط 8 من 128 خبيرًا لكل رمز مميز.

التفكير الهجين ولماذا يعتبر الاندماج صعبا

يقدم لين التفكير الهجين كميزة نظيفة. يشرح المنشور سبب صعوبة البناء. كتب لين أن وضع التفكير ووضع التعليمات يسيران في اتجاهين متعاكسين.

تتم مكافأة نموذج التعليمات القوي على المباشرة والإيجاز وزمن الوصول المنخفض. يُكافأ نموذج التفكير القوي على إنفاق المزيد من الرموز على المشكلات الصعبة. دمج الاثنين بلا مبالاة، وكلاهما يتحلل. يصبح سلوك التفكير منتفخًا، ويصبح سلوك التوجيه أقل وضوحًا.

حاول Qwen3 الدمج مع خط أنابيب ما بعد التدريب من أربع مراحل. يتضمن خط الأنابيب هذا بداية باردة طويلة لـ CoT، والتفكير المنطقي، وخطوة “دمج وضع التفكير”. وفي وقت لاحق من عام 2025، قام خط 2507 بشحن إصدارات منفصلة من Instruct وThinking بدلاً من ذلك. يضع لين هذه المشكلة على أنها مشكلة بيانات أكثر من كونها مشكلة نموذجية.

اتخذت الأنثروبيك الاتجاه المعاكس، ويصفها لين بأنها تصحيحية مفيدة. تم شحن Claude 3.7 Sonnet كنموذج هجين بميزانية تفكير يحددها المستخدم. يسمح كلود 4 بالتداخل بين الاستدلال واستخدام الأدوات، بهدف البرمجة والمهام طويلة الأمد. وجهة نظره هي أن تتبع الاستدلال الأطول لا يجعل النموذج أكثر ذكاءً. يجب أن يتشكل التفكير من خلال عبء العمل المستهدف، وليس من خلال المعيار.

الشرح التفاعلي

من التفكير “الاستدلالي” إلى التفكير “الفاعل”.

يرسم لين خطًا بين عصرين. الأول كان التفكير المنطقي، الذي حدده o1 و DeepSeek-R1. لقد علمت هذا المجال أن RL يحتاج إلى مكافآت حتمية يمكن التحقق منها، لذلك أصبحت الرياضيات والرمز والمنطق أمرًا أساسيًا. كما أنها حولت RL إلى مشكلة أنظمة تتعلق بالنشر والتحقق على نطاق واسع.

العصر التالي، في تأطيره، هو التفكير الفاعل: التفكير من أجل الفعل. يقوم الوكيل بصياغة الخطط، ويقرر متى يجب التصرف، ويستخدم الأدوات، ويقرأ تعليقات البيئة، ويراجعها. ويتم تعريفه من خلال التفاعل المغلق مع العالم، وليس من خلال مونولوج داخلي طويل.

يسرد لين ما يجب أن يتعامل معه التفكير الفاعل والذي يمكن للتفكير الخالص تجنبه:

  • تحديد متى تتوقف عن التفكير وتتخذ إجراءً
  • اختيار الأداة التي سيتم استدعاؤها وبأي ترتيب
  • دمج الملاحظات الصاخبة أو الجزئية من البيئة
  • – مراجعة الخطط بعد الفشل
  • الحفاظ على التماسك عبر العديد من المنعطفات والعديد من استدعاءات الأدوات

يتغير هدف التحسين مع العصر. يلخص الجدول أدناه التباين الذي يرسمه لين.

البعد التفكير الاستدلالي التفكير الفاعل
يحكم بها جودة المداولات الداخلية قبل الإجابة ما إذا كان التقدم مستدامًا أثناء العمل
إشارة المكافأة إجابات يمكن التحقق منها (الرياضيات، الكود، المنطق) نجاح المهمة في بيئة تفاعلية
الهدف الأساسي للتدريب النموذج النموذج بالإضافة إلى بيئته (الحزام)
عنق الزجاجة بالأشعة تحت الحمراء عمليات الطرح والتحقق وتحديثات السياسة المستقرة خوادم الأدوات، وصناديق الحماية، وفصل خدمة القطار
وضع الفشل الرئيسي آثار استدلال مطولة ومنخفضة القيمة مكافأة القرصنة من خلال الوصول إلى الأدوات وتسريبات البيئة

حالات الاستخدام، مع الأمثلة

يغير التمييز كيفية البناء:

  • وكلاء الترميز: يُصدر نموذج الاستدلال تصحيحًا واحدًا من تتبع المكدس. يقوم النظام الوكيل بتشغيل أداة الاختبار، وقراءة الخطأ الحقيقي، ومراجعته، وإعادة تشغيله حتى تمر المجموعة. التفكير هنا يجب أن يساعد في التنقل في قاعدة التعليمات البرمجية واستعادة الأخطاء وتنسيق الأدوات.
  • بحث عميق: نموذج المنطق يكتب إجابة طويلة من الذاكرة. يقوم النظام الوكيل بتقسيم السؤال إلى استعلامات فرعية، ويستدعي البحث، ويسقط المصادر الضعيفة، ويعيد الاستشهادات المؤرضة. يقع عرض البحث العميق الخاص بـ Qwen ضمن هذه الفئة.
  • تنسيق متعدد الوكيل: يتوقع لين أن تكون “هندسة الحزام” أكثر أهمية. خطط ومسارات عمل منسقة. يقوم الوكلاء الفرعيون المتخصصون بتنفيذ مهام أضيق ويساعدون في التحكم في تلوث السياق.

خطاف خرساني: تبديل التفكير Qwen3

يتم عرض التفكير المختلط مباشرة في التعليمات البرمجية. ال enable_thinking يقوم العلم بتبديل الأوضاع في قالب الدردشة.

from transformers import AutoModelForCausalLM, AutoTokenizer

name = "Qwen/Qwen3-8B"
tok = AutoTokenizer.from_pretrained(name)
model = AutoModelForCausalLM.from_pretrained(
    name, torch_dtype="auto", device_map="auto"
)

messages = [{"role": "user", "content": "Refactor this function and explain the change."}]

# enable_thinking=True  -> step-by-step thinking mode
# enable_thinking=False -> near-instant, non-thinking mode
text = tok.apply_chat_template(
    messages, tokenize=False,
    add_generation_prompt=True, enable_thinking=True,
)
inputs = tok(text, return_tensors="pt").to(model.device)

# Qwen's recommended sampling for thinking mode
out = model.generate(
    **inputs, max_new_tokens=2048,
    temperature=0.6, top_p=0.95, top_k=20,
)

enable_thinking=True هو الإعداد الافتراضي، ويغلف الإخراج المنطق في ملف <think>...</think> حاجز. يقبل Qwen3 أيضًا المفاتيح الناعمة. إلحاق /think أو /no_think إلى مستخدم يقلب الوضع لكل رسالة. إن التحكم في كل دورة هو ما تعتمد عليه ميزانيات التفكير الديناميكي.

لماذا تعتبر البنية التحتية لـ Agentic RL أكثر صعوبة

النقطة الهندسية الأساسية للعرض التقديمي تتعلق بالبنية التحتية. في استدلال RL، تكون عمليات الطرح في الغالب مسارات قائمة بذاتها مع مقيِّمين نظيفين. في وكيل RL، توجد السياسة داخل مجموعة من خوادم الأدوات والمتصفحات والمحطات الطرفية وصناديق الحماية.

يفرض هذا الحزام مطلبًا جديدًا: يجب الفصل بين التدريب والاستدلال بشكل واضح. وبدون ذلك، تنهار إنتاجية الطرح. وكيل الترميز الذي ينتظر تنفيذ الاختبار المباشر يعطل الاستدلال ويحرم من التدريب. ينخفض ​​استخدام وحدة معالجة الرسومات (GPU) إلى أقل بكثير مما يحققه المنطق RL.

يعيد لين أيضًا صياغة ما يجب أن تستحوذ عليه. في عصر SFT، قامت الفرق بتحسين تنوع البيانات. في عصر الوكلاء، يرى أنه يجب على الفرق تحسين جودة البيئة: الاستقرار والواقعية والتغطية واستغلال المقاومة. ويصف قرصنة المكافأة بأنها المشكلة الأصعب، لأن الوصول إلى الأداة يوسع سطح الهجوم من أجل التحسين الزائف.

الوجبات السريعة الرئيسية

  • غادر Junyang Lin Qwen في 3 مارس 2026، ويعمل الآن كباحث مستقل.
  • وينتهي حديثه بأطروحة واحدة: المجال ينتقل من نماذج التدريب إلى وكلاء التدريب.
  • يتم الحكم على التفكير الفاعل من خلال العمل المستمر في بيئة ما، وليس من خلال المداولات الداخلية.
  • يحتاج Agentic RL إلى بيئات منفصلة لخدمة القطارات وبيئات عالية الجودة، وليس فقط مكافآت يمكن التحقق منها.
  • يعد اختراق المكافأة هو الخطر المركزي بمجرد حصول النماذج على وصول حقيقي للأداة.

مصادر:

المصدر الأساسي – الحديث

  • https://www.youtube.com/watch?v=b0xlsQ_6wUQ

المصدر الأساسي – مدونة Junyang Lin

  • “من التفكير “الاستدلالي” إلى التفكير “الفاعل”: https://justinlin610.github.io/blog/from-reasoning-to-agentic-thinking/
  • صفحته الرئيسية (حالة الباحث المستقل): https://justinlin610.github.io/

التفاصيل الفنية لـ Qwen3 (الهندسة المعمارية، 119 لغة، التفكير المختلط)

  • تقرير Qwen3 الفني (arXiv:2505.09388): https://arxiv.org/abs/2505.09388 · HTML: https://arxiv.org/html/2505.09388v1

التحقق من الكود (enable_thinking, /think /no_think، أخذ العينات)

  • البداية السريعة لمستندات Qwen: https://qwen.readthedocs.io/en/latest/getting_started/quickstart.html
  • بطاقة نموذج Qwen3-8B: https://huggingface.co/Qwen/Qwen3-8B
  • بطاقة نموذج Qwen3-32B: https://huggingface.co/Qwen/Qwen3-32B

حقائق المغادرة (مذكورة في المقال)

  • تك كرانش: https://techcrunch.com/2026/03/03/alibababas-qwen-tech-lead-steps-down-after-major-ai-push/
  • بلومبرج: https://www.bloomberg.com/news/articles/2026-03-04/alibaba-qwen-head-who-warned-of-openai-gap-steps-down
  • فينشر بيت: https://venturebeat.com/technology/did-alibaba-just-kneecap-its-powerful-qwen-ai-team-key-figures-depart-in

دعم تغطية المغادرة/السياق (تُستخدم للتحقق المتبادل، وليس جميعها مذكورة في السطر)

  • RecodeChinaAI (ترجمة LatePost): https://www.recodechinaai.com/p/alibababas-qwen-lead-just-stepped-down
  • سيمون ويليسون: https://simonwillison.net/2026/Mar/4/qwen/
  • الجغرافيا السياسية: https://www.geopolitechs.org/p/inside-the-stepping-down-of-qwens
  • أوفيس تشاي: https://officechai.com/ai/alibaba-qwens-tech-lead-junyang-lin-steps-down/
  • أخبار MLQ: https://mlq.ai/news/key-researcher-steps-down-from-alibababas-qwen-ai-project/
  • تجميع GenAI (تحليل المقال، يُستخدم لتحديد موقع المقال أولاً): https://genaiassembling.substack.com/p/what-junyang-lin-saw

وظيفتان X

  • https://x.com/h100envy/status/2068987470960623783
  • https://x.com/h100envy/status/2073433806254624930


ميشال سوتر متخصص في علوم البيانات وحاصل على درجة الماجستير في علوم البيانات من جامعة بادوفا. بفضل أساس متين في التحليل الإحصائي والتعلم الآلي وهندسة البيانات، تتفوق ميشال في تحويل مجموعات البيانات المعقدة إلى رؤى قابلة للتنفيذ.


اكتشاف المزيد من كحيل | أخبار التقنية

اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.

شاركها.
اترك تعليقاً

اكتشاف المزيد من كحيل | أخبار التقنية

اشترك الآن للاستمرار في القراءة والحصول على حق الوصول إلى الأرشيف الكامل.

متابعة القراءة