يُبلغ مكدس LoRA المتعدد المتزامن الخاص بـ Trajectory عن مكاسب إنتاجية للتجربة تبلغ 2.81 × على RL للمستأجر الفردي، مع كل التعليمات البرمجية في مستودع NovaSky-AI/SkyRL GitHub.

تتحسن معظم نماذج اللغة في القفزات المتقطعة. يقوم الفريق بجمع البيانات وتدريب وشحن نسخة جديدة. يستغرق هذا شهورًا وينتج عنه سلوكًا ملحوظًا أو كارثيًا للمستخدمين. يريد المسار استبدال تلك الدورة بالتعلم المستمر.

نشر فريق المسار تقريرًا ميدانيًا يصف كيفية القيام بذلك. لقد قامت ببناء منصة تدريب متزامنة ومتعددة LoRA للتعلم المستمر لأعباء العمل. تم إنجاز العمل بالتعاون مع UC Berkeley Sky Lab وAnyscale. جميع أكواد التدريب مفتوحة المصدر في مستودع NovaSky-AI/SkyRL.

والنتيجة هي تحسين إنتاجية التجربة من طرف إلى طرف بمقدار 2.81 ×. المقارنة مع إطار تدريب المستأجر الواحد. يشير المسار إلى عدم وجود تراجع في أي مكافآت تدريبية.

ما هو تدريب Multi-LoRA في الواقع؟

يتطلب التعلم المستمر نماذج للتحديث من ردود الفعل المباشرة وتفاعلات الإنتاج. يمكن لوكيل البرمجة أن يتعلم الأنماط الهندسية بينما يقوم المطورون بتصحيح عمله. يمكن لوكيل الدعم حل التذاكر الصعبة حيث يتدخل المشغلون في الحالات الصعبة.

لا تزال معظم البنية التحتية للتدريب تفترض دورة حياة خطية. تقوم الفرق بتخصيص وحدات معالجة الرسومات، وتهيئة النموذج، وتشغيل المهمة، ثم الدوران للأسفل. التعلم المستمر يراجع تلك العلاقة. عندما تصبح تفاعلات الإنتاج مدخلات تدريبية، يصبح التدريب جزءًا من نظام حي.

يقلل تدريب RL الحديث إلى ثلاثة البدائيات الأساسية. ال أخذ العينات يولد مسارات من نموذج السياسة الحالي. ال مدرب يحسب التدرجات ويحدث أوزان السياسة. مزامنة المعلمة تبث الأوزان المحدثة إلى عمال الاستدلال.

يطلق المسار على منهجه التدريب المستمر متعدد LoRA، أو C-LoRA. يتم تعيين كل تجربة لمحول LoRA مخصص على محرك دافئ متعدد المستأجرين.

المشاكل التي يستهدفها

يحدد فريق المسار أربعة أوجه قصور في الأكوام التقليدية:

(1) البدايات الباردة بطيئة: تقوم كل مهمة تسلسلية بإعادة تحميل نقاط التفتيش، وتهيئة وقت التشغيل الموزع، وتدفئة محركات الاستدلال. بالنسبة للنماذج الكبيرة، يمكن أن تتجاوز هذه الخطوة وحدها 30 دقيقة لكل عملية تشغيل.

(2) RL كثيفة الذاكرة: غالبًا ما تتجاوز النماذج الحدودية 100B من المعلمات. يمكن أن يتطلب Qwen3.5-397B ما يصل إلى ثماني عقد H200 لتناسب الذاكرة. تقوم LoRA بتقليل استخدام الذاكرة بمقدار كبير. يقوم بتجميد النموذج الأساسي وتدريب أوزان المحولات الصغيرة فقط.

(3) الأكوام التقليدية هي مستأجر واحد: يجرون تجربة واحدة في كل مرة. يقوم Multi-LoRA بتعيين كل تجربة إلى محول واحد، مما يؤدي إلى مضاعفة إنتاجية الإرسال بعامل N.

(4) الاستخدام الوظيفي منخفض: يتوقف المدربون ومحركات الاستدلال أثناء انتظار بعضهم البعض. أرصدة تحميل Multi-LoRA عبر الوظائف لملء السعة الخاملة.

داخل العمارة

معظم انتصارات الإنتاجية تأتي من الاستدلال. في vLLM، يتم تحميل جميع المحولات بشكل سريع في ذاكرة GPU. يمكن لخطوات فك التشفير بعد ذلك خلط الرموز المميزة من محولات مختلفة في نفس الدفعة. عامل التمكين الرئيسي هو نواة فك تشفير SGMV. فهو يدمج عمل ناقل المصفوفة لكل محول في إطلاق GPU واحد لكل خطوة فك تشفير.

بعد كل خطوة تحسين، يتم تحميل أوزان LoRA المحدثة في مكانها في محرك الاستدلال. لا يتجمد برنامج الجدولة، لذلك يستمر المستأجرون الآخرون في فك التشفير.

التدريب يعمل بشكل مختلف. يتم تدريب محول LoRA نشط واحد على وحدة معالجة الرسومات. الباقي يجلس في ذاكرة وحدة المعالجة المركزية المثبتة. تعيش حالة كل مستأجر في AdapterStore. إنه يحمل معلمات LoRA، والأوزان الرئيسية FP32، ولحظات المحسن، والمخازن المؤقتة المتدرجة.

يقوم المحرك بتبديل حالة مستأجر واحد على وحدة معالجة الرسومات، وتشغيل تمرير واحد للأمام والخلف، ثم يبادله مرة أخرى. لا يزال مسار التدريب هذا عبارة عن محول واحد. مكاسب تزامن الاستدلال لا تنطبق بعد على التدريب.

الأرقام

تم اختبار المسار على عقدة H200 واحدة باستخدام Qwen3-4B-Instruct-2507. تم تشغيل مزامنة RL على GSM8K في بيئة وكيل. أعاد فريق المسار صياغة GSM8K كمهمة تعليمية تستخدم الأداة. يقرر النموذج متى يتم الاتصال بـ آلة حاسبة و أ الإجابة النهائية أداة. المكافأة هي 1.0 فقط عندما يتم استدعاء الإجابة النهائية بالإجابة الصحيحة.

تبدأ السياسة بدقة تصل إلى 40% تقريبًا في الخطوة 0. وباستخدام خوارزمية التعلم الصحيحة، تتخطى الدقة 90% في الخطوة 9.

تم توسيع فريق المسار إلى ثمانية جولات متزامنة متعددة LoRA. وصل وقت التجربة النهائية إلى 5433 ثانية عند N = 8، أي تسريع قدره 2.81 ×. انتهت ثماني تجارب متزامنة قبل ثلاث عمليات تشغيل متتالية. تم أيضًا تحسين متوسط ​​وقت التجربة، حيث بلغ ذروته عند N = 4 مع تسريع قدره 1.88 ×. وصل كل مستوى من مستويات التزامن إلى درجة دقة المكافأة أعلى من 90% في الخطوة 9.

المقايضات

ارتفاع تكاليف الإنتاجية لكل خطوة الكمون. مع نمو N، يتدهور وقت التجربة الأولى ووقت الخطوة. عند N=8، تنتهي التجربة التسلسلية الأولى بسرعة أكبر بمقدار 1.97×. متوسط ​​زمن الخطوة يرتفع من 191 ثانية إلى 500 ثانية، أي أبطأ بمقدار 2.62 مرة فقط.

معظم هذه الزيادة هي وقت الطرح. ينمو الطرح من 162 إلى 401، أي ما يقرب من 77% من الزيادة. عند N=2، تؤدي مضاعفة الحمل إلى إضافة 15% فقط من وقت البدء. هذه هي الحالة المثالية لـ Multi-LoRA.

تم الحفاظ على النمط تحت عبء عمل أصعب. في متاجر البيع بالتجزئة على مقاعد البدلاء مع طراز NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 MoE، أنهى N=2 10 خطوات أسرع بمقدار 1.28 ×، وارتفع وقت خطوة كل مستأجر بمقدار 1.57 ×.

نقاط القوة والضعف

نقاط القوة:

  • 2.81 × زيادة في إنتاجية التجربة من طرف إلى طرف في ثمانية عمليات تشغيل متزامنة
  • لا يوجد انحدار الدقة. تتبعت عمليات التشغيل خط الأساس التسلسلي ضمن ± 1σ في الخطوات النهائية
  • يقوم LoRA بتقطيع الذاكرة بمقدار كبير مقابل الضبط الدقيق الكامل
  • مفتوح المصدر بالكامل في NovaSky-AI/SkyRL ليتمكن المجتمع من البناء عليه

نقاط الضعف:

  • يتدهور زمن الوصول لكل خطوة ووقت التجربة الأولى مع نمو N
  • ويظل التدريب متسلسلاً بين المستأجرين؛ يتم مضاعفة الاستدلال فقط
  • تم اختباره بشكل أساسي على النماذج متوسطة الحجم، وليس على المعلمات ذات النطاق الحدودي
  • يتطلب الإعداد عقدة 8 × H100/H200 وبنية ميجاترون

الوجبات السريعة الرئيسية

  • قام Trajectory ببناء مجموعة تدريب متزامنة ومتعددة LoRA RL للتعلم المستمر، مفتوحة المصدر في NovaSky-AI/SkyRL.
  • يُبلغ عن ربح يبلغ 2.81 × من إنتاجية التجربة من طرف إلى طرف مقارنة بخط الأساس لمستأجر واحد، دون أي تراجع في المكافأة.
  • يتم تعيين كل تجربة لمحول LoRA مخصص على محرك ساخن دائمًا، مما يؤدي إلى مضاعفة الإنتاجية بواسطة N.
  • تأتي معظم المكاسب من استدلال vLLM multi-LoRA عبر نواة فك تشفير SGMV؛ التدريب يبقى محول واحد.
  • المقايضة هي زمن الوصول لكل خطوة: عند N = 8، يرتفع وقت الخطوة من 191 ثانية إلى 500 ثانية.

الشرح المرئي لـ Marktechpost

تقرير ميداني · 27 مايو 2026

التدريب المستمر متعدد LoRA للتعلم المستمر

تم إنشاء المسار بالتعاون مع UC Berkeley Sky Lab وAnyscale.

2.81 × مكاسب إنتاجية التجربة من طرف إلى طرف

01 – ما هو

محرك واحد ساخن دائمًا والعديد من المحولات

يقوم التعلم المستمر بتحديث النماذج من ردود الفعل المباشرة وتفاعلات الإنتاج.

مسار يدعو نهجها التدريب المستمر على Multi-LoRA (C-LoRA). يتم تعيين كل تجربة لمحول LoRA مخصص على محرك دافئ متعدد المستأجرين.

أخذ العينات

يولد مسارات من نموذج السياسة الحالي.

مدرب

يحسب التدرجات ويحدث أوزان السياسة.

مزامنة المعلمة

تبث الأوزان المحدثة إلى عمال الاستدلال.

التحول

يصبح التدريب جزءًا من خدمة حية وموزعة.

02 – المشاكل التي يستهدفها

أربعة أوجه قصور في مكدسات RL التسلسلية

يبدأ البرد البطيء

تقوم كل مهمة بإعادة تحميل نقاط التفتيش وتدفئة المحركات. يمكن أن يتجاوز هذا 30 دقيقة لكل جولة.

الذاكرة المكثفة RL

يمكن أن يحتاج Qwen3.5-397B إلى ما يصل إلى ثماني عقد H200. تقوم LoRA بتقطيع الذاكرة بأمر من حيث الحجم.

مستأجر واحد

يتم تنفيذ تجربة واحدة في كل مرة. إنتاجية تعدد إرسال Multi-LoRA بعامل N.

استخدام منخفض

المدرب ومحرك الاستدلال ينتظران بعضهما البعض. Multi-LoRA يملأ السعة الخاملة.

03 – داخل العمارة

من أين تأتي الإنتاجية

  • الاستدلال. في vLLM، يتم تحميل جميع المحولات بشكل سريع في ذاكرة GPU. ال نواة فك تشفير SGMV تعمل الصمامات لكل محول في إطلاق GPU واحد لكل خطوة فك تشفير.
  • مزامنة الوزن. يتم تحميل أوزان LoRA المحدثة في مكانها. لا يتجمد برنامج الجدولة، لذلك يستمر المستأجرون الآخرون في فك التشفير.
  • تمرين. يتم تدريب محول نشط واحد على وحدة معالجة الرسومات؛ الباقي يجلس في ذاكرة وحدة المعالجة المركزية المثبتة.

متجر المحول

تحتوي حالة كل مستأجر على معلمات LoRA وأوزان FP32 الرئيسية ولحظات المُحسّن والمخازن المؤقتة المتدرجة. لا يزال هذا المسار محولًا واحدًا.

04 – الإعداد

GSM8K، أعيدت صياغته كمهمة استخدام أداة

تم اختباره على عقدة H200 واحدة مع Qwen3-4B-Instruct-2507، تشغيل مزامنة RL على GSM8K في بيئة الوكيل.

  • يقرر النموذج متى يتم الاتصال بـ آلة حاسبة و أ الإجابة النهائية أداة.
  • المكافأة هي 1.0 فقط عندما يتم استدعاء الإجابة النهائية بالإجابة الصحيحة.
  • تبدأ السياسة بدقة تصل إلى 40% تقريبًا وتتجاوز 90% بالخطوة 9.

05 – الأرقام

2.81 × إنتاجية، لا يوجد تراجع في المكافأة

2.81أ—

وقت التجربة النهائية عند N = 8 (5433 ثانية)

1.88 ×

متوسط ​​وقت التجربة، ويبلغ ذروته عند N = 4

> 90%

دقة المكافأة على كل مستوى بالخطوة 9

انتهت ثماني تجارب متزامنة قبل ثلاث عمليات تشغيل متتالية. تتبع عمليات التشغيل خط الأساس التسلسلي ضمن ± 1σ في الخطوات النهائية.

06 – المقايضات

الإنتاجية، وزمن الوصول لكل خطوة

  • عند N = 8، يرتفع متوسط ​​زمن الخطوة من 191 ثانية إلى 500 ثانية، أي أبطأ بمقدار 2.62 ×.
  • ينمو الطرح من 162 إلى 401، أي ما يقرب من 77% من الزيادة.
  • عند N=2، تضيف مضاعفة الحمل 15% فقط من وقت البدء – وهي الحالة المثالية.

فحص عبء العمل الأصعب

في متاجر البيع بالتجزئة على مقاعد البدلاء مع طراز NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 MoE، أنهى N=2 10 خطوات أسرع بمقدار 1.28 ×، وارتفع وقت الخطوة لكل مستأجر بمقدار 1.57 ×.

07 – الوجبات السريعة

ماذا تتذكر

  • تدريب متزامن متعدد LoRA RL للتعلم المستمر، مفتوح المصدر في NovaSky-AI/SkyRL.
  • 2.81 × كسب إنتاجية التجربة من طرف إلى طرف على خط أساس لمستأجر واحد.
  • معظم المكاسب تأتي من استنتاج vLLM multi-LoRA؛ التدريب يبقى محول واحد.
  • تطبق SkyRL واجهة Tinker API؛ أعد إنتاجه على 8 × H100/H200 باستخدام كتاب الطبخ Tinker.

أين (الاستدلالات) للتشغيل

تشغيله / الوصول إلى النموذج

مقدمي الاستدلال والحساب

مكان الوصول إلى النموذج الأساسي Qwen3-4B-Instruct-2507، ومكدس التدريب SkyRL، ووحدات معالجة الرسومات NVIDIA المستخدمة في التجارب.


تحقق من Â الريبوÂ و§ التفاصيل الفنية أيضًا، لا تتردد في متابعتنا على تغريدÂ ولا تنسى الانضمام إلينا 150 ألف+ مل من SubReddit§ والاشتراك في النشرة الإخبارية لدينا. انتظر! هل أنت على برقية؟ الآن يمكنك الانضمام إلينا على التليجرام أيضًا.

هل تحتاج إلى الشراكة معنا للترويج لصفحة GitHub Repo أو صفحة الوجه المعانقة أو إصدار المنتج أو الندوة عبر الويب وما إلى ذلك؟ تواصل معنا


ميشال سوتر متخصص في علوم البيانات وحاصل على درجة الماجستير في علوم البيانات من جامعة بادوفا. بفضل أساس متين في التحليل الإحصائي والتعلم الآلي وهندسة البيانات، تتفوق ميشال في تحويل مجموعات البيانات المعقدة إلى رؤى قابلة للتنفيذ.


اكتشاف المزيد من كحيل | أخبار التقنية

اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.

شاركها.
اترك تعليقاً

اكتشاف المزيد من كحيل | أخبار التقنية

اشترك الآن للاستمرار في القراءة والحصول على حق الوصول إلى الأرشيف الكامل.

متابعة القراءة