أصدرت Prime Intellect الإصدار 0.6.0 من Prime-rl. يستهدف الإطار التعلم المعزز على نماذج خليط الخبراء (MoE) المكونة من تريليون معلمة. وهو يركز على أعباء العمل الوكيلة الثقيلة، مثل مهام هندسة البرمجيات طويلة المدى.
قام فريق البحث بتدريب GLM-5 على مهام SWE بطول تسلسل يصل إلى 131 ألفًا. بقيت أوقات الخطوات أقل من خمس دقائق. كان حجم الدفعة 256 عملية طرح. استخدم التشغيل 28 عقدة H200 فقط.
ليرة تركية؛ د
- يقوم Prime-rl 0.6.0 بتدريب نماذج MoE ذات تريليون معلمة على أعباء عمل RL الوكيلة.
- تم تدريب GLM-5 على SWE بطول تسلسلي يبلغ 131 ألفًا، وخطوات أقل من 5 دقائق، و28 عقدة H200.
- يقوم RL غير المتزامن بفصل المدرب والاستدلال من أجل التحسين المستقل.
- يستخدم الاستدلال FP8 وWide EP وتصنيف P/D وتفريغ KV وإعادة تشغيل جهاز التوجيه.
- يستخدم التدريب التوازي ثلاثي الأبعاد (FSDP، EP، CP) بالإضافة إلى FP8.
ما هو الـ Prime-rl 0.6.0؟
Prime-rl هو إطار مفتوح للتعلم المعزز غير المتزامن. يقوم بعد ذلك بتدريب نماذج كبيرة مفتوحة المصدر على المهام الوكيلة. يعمل الإصدار 0.6.0 على توسيع هذا النطاق إلى مقياس وزارة البيئة الذي يحتوي على تريليون معلمة.
نموذج المثال في الإعلان هو zai-org/GLM-5.1. تنطبق التحسينات أيضًا على نماذج وزارة التربية الكبيرة الأخرى. تشمل الأمثلة moonshotai/Kimi-K2.7-Code و nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16.
يبدأ التشغيل الكامل لـ GLM-5.1 بأمر واحد على مجموعة Slurm.
uv run rl @ examples/glm5_llmd/rl.toml --output-dir /shared/outputs/glm5-llmd
دور RL غير المتزامن
المهام الوكيلة لها قيم متطرفة طويلة الذيل. يتم تشغيل بعض عمليات نشر الترميز لساعات. سيؤدي انتظارهم قبل كل تحديث للسياسة إلى تعطيل وحدات معالجة الرسومات.
يتجنب RL غير المتزامن هذا. يتم فصل أنظمة المدرب والاستدلال. إنهم يركضون ويتوسعون بشكل مستقل. يتم تحديث سياسة الاستدلال بمجرد انتهاء خطوة المحسن.
هناك نقطة مزامنة واحدة: تحديث السياسة. يقوم Prime-rl بدفع الأوزان الجديدة بمجرد وجودها. تحتفظ عمليات الطرح التي تم إرسالها بالفعل بذاكرة التخزين المؤقت النشطة للبادئة. لذلك، قد يؤدي طرح واحد إلى مزج الرموز المميزة من عدة إصدارات سياسة.
تتصرف عمليات الطرح الجديدة بشكل مختلف. يقومون بإعادة ملء ذاكرة التخزين المؤقت KV الخاصة بهم، حتى عندما تتطابق البادئات. ملح KV-cache يفرض هذا. يتم إسقاط الطلبات الواردة من سياسة قديمة جدًا. ال max_off_policy_steps تتحكم القيمة في تلك العتبة.
تحسينات الاستدلال
عادة ما يكون الاستدلال هو عنق الزجاجة في نظام RL. يعمل Prime-rl على تحسين الإنتاجية، مع الحفاظ على زمن الاستجابة محدودًا.
استنتاج FP8: تعمل الدقة المنخفضة على تسريع عملية التعبئة المسبقة وفك التشفير. يستخدم prime-rl FP8 مع حبات DeepEP و DeepGEMM.
التوازي الخبراء على نطاق واسع: ينشر EP الواسع الخبراء عبر وحدات معالجة الرسومات ≥32. إنه يقترن برتبة كبيرة موازية للبيانات، على سبيل المثال 32. تحتوي كل وحدة معالجة رسومات على خبراء منفصلين وتعمل كنقطة نهاية. تحدث المزامنة لكل طبقة، من خلال عمليات الإرسال والدمج.
التعبئة المسبقة وفك التشفير: تصل بعض أزواج النماذج↔env إلى نسبة 4:1 للتعبئة المسبقة: رمز فك التشفير. سيؤدي العمال المشتركون إلى تضخيم زمن الوصول الشامل. وهذا يقلل من فوائد PipelineRL. يفصل تصنيف P/D عمال التعبئة المسبقة وفك التشفير. ثم تتوقف مخرجات الأداة الطويلة عن اختناق العاملين في فك التشفير.
إدارة ذاكرة التخزين المؤقت KV: يتطلب التزامن العالي مساحة كبيرة لذاكرة التخزين المؤقت KV. يدعم Prime-rl التفريغ المتدرج لوحدة المعالجة المركزية والقرص. يؤدي التفريغ الأصلي لـ vLLM إلى إنشاء مجموعة واحدة لكل عامل. يقوم متجر Mooncake Store بدلاً من ذلك بتجميع ذاكرة الوصول العشوائي (RAM) والقرص عبر جميع العقد مركزيًا.
طلب التوجيه: يقوم Prime-rl بشحن شوكة جهاز التوجيه vllm بشكل افتراضي. كما أنه يدعم جهاز التوجيه NVIDIA Dynamo كجهاز وصول مباشر. تقوم أجهزة التوجيه بتسجيل العمال باستخدام إعادة استخدام ذاكرة التخزين المؤقت KV وعمق قائمة الانتظار والتحميل المباشر.
إعادة تشغيل جهاز التوجيه (R3): عدم تطابق المدرب↔الاستدلال يقتل التدريب بصمت. تلتقط إعادة تشغيل جهاز التوجيه قرارات توجيه الاستدلال. ويعيدها مباشرة على المدرب. يؤدي هذا إلى تقليل عدم تطابق KL تقريبًا. الخبراء الموجهون لديهم شكل [num_layers, top_k, seq_len]. يمكن أن تنمو هذه الحمولة إلى مئات الجيجابايت. على نطاق واسع، يصل معدل البيانات إلى عشرات جيجابت في الثانية. لذا فإن Prime-rl يعاملها على أنها حمولة غير شفافة. تتولى عمليات PyTorch المحسنة عملية المعالجة.
تحسينات التدريب
يعتمد المدرب على torchtitan، وهي قاعدة بيانات تدريبية أصلية لـ PyTorch. ويعتمد على التوازي ثلاثي الأبعاد: FSDP، CP، وEP. وتستخدم دراسة الحالة GLM-5 هذه العناصر الثلاثة.
| استراتيجية | ما شظايا | الاستخدام الأساسي | التفاصيل الرئيسية |
|---|---|---|---|
| FSDP (FSDP2) | المعلمات والتدرجات وحالات المحسن | استهلاك الذاكرة الأساسية | يجمع الأوزان حسب الطلب لكل طبقة عبر fully_shard |
| التوازي الخبراء (EP) | خبراء داخل طبقة | تقليص ذاكرة الطبقة النشطة | all2all الإرسال/الجمع؛ الشعلة الأصلية أو DeepEP |
| توازي السياق (CP) | البعد التسلسلي | ذاكرة التنشيط ذات السياق الطويل | يوليسيس (افتراضي) أو الانتباه الدائري |
يوجد EP لأن الطبقات تظل ضخمة بعد FSDP. مع وجود 78 طبقة و800B معلمات في float32، يحتاج التجميع الكامل للطبقة الواحدة إلى 40 جيجابايت تقريبًا. طبقة واحدة متداخلة تدفع ما يقرب من 80 جيجابايت. يؤدي تعيين EP=8 إلى إرسال الرموز المميزة بدلاً من جمع الخبراء الكاملين. all2all الأصلي للشعلة أسرع قليلاً داخل عقدة واحدة. يفوز DeepEP عندما يمتد EP إلى عقد متعددة.
CP مهم بطول تسلسل 131 كيلو بايت +. هناك، تهيمن عمليات التنشيط على الذاكرة، وليس المعلمات. يستخدم GLM-5 DSA، والذي لا يوازيه Ulysses ولا Ring Attention بشكل مباشر. لذا فإن Prime-rl يشحن تطبيقًا مخصصًا متوازيًا للسياق له.
تدريب FP8. يستخدم prime-rl DeepGEMM FP8 على نطاق واسع، كما اقترح DeepSeek V3. ونادرا ما يؤدي هذا إلى زيادة الإنتاجية، وذلك بسبب النفقات العامة للتكميم. قيمته الحقيقية هي مطابقة المدرب ودقة الاستدلال. وهذا يقلل من عدم تطابق KL ويثبت التدريب.
الشرح التفاعلي
استخدام الحالات مع الأمثلة
- وكلاء SWE ذو الأفق الطويل: تدريب نموذج على قضايا المستودع الحقيقية. يمكن أن تمتد عمليات الطرح إلى مئات المنعطفات واستدعاءات الأدوات. يؤدي تصنيف P/D إلى إبقاء زمن وصول فك التشفير قابلاً للتنبؤ به هنا.
- مقياس 1T بعد التدريب على عدد أقل من العقد: يعمل GLM-5 على 28 عقدة H200. يؤدي تفريغ EP وKV على نطاق واسع إلى زيادة التزامن والإنتاجية.
- عامل مستقر RL على نطاق واسع: تعمل إعادة تشغيل جهاز التوجيه وتدريب FP8 على تقليل عدم تطابق المدرب ↔استدلال KL. انخفاض عدم التطابق يعني تدريبًا أكثر ثباتًا.
تحقق من التفاصيل الفنية. أيضا، لا تتردد في متابعتنا على تغريد ولا تنسى الانضمام إلينا 150 ألف + مل والاشتراك في النشرة الإخبارية لدينا. انتظر! هل أنت على برقية؟ الآن يمكنك الانضمام إلينا على التليجرام أيضًا.
هل تحتاج إلى الشراكة معنا للترويج لصفحة GitHub Repo أو صفحة الوجه المعانقة أو إصدار المنتج أو الندوة عبر الويب وما إلى ذلك؟ تواصل معنا
اكتشاف المزيد من كحيل | أخبار التقنية
اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.
