أصدرت Tencent AngelSpec، وهو إطار تدريبي مفتوح المصدر ومصباح أصلي لنماذج مسودة فك التشفير. يغطي الإصدار كلا من الانحدار الذاتي التنبؤ متعدد الرموز (MTP) وعائلة DFlash المتوازية.

تبحث معظم أعمال فك التشفير التخميني عن محرر واحد يحقق نتائج جيدة في مزيج قياسي متوسط. حركة الخدمة الحقيقية لا تبدو مثل هذا الخليط. يعامل AngelSpec عدم تجانس عبء العمل كعائق تصميم من الدرجة الأولى، ويتخصص في البنية وبيانات التدريب وعمق التحقق من حولها.

لماذا يكون أداء أحد المُصممين العالميين ضعيفًا؟

فك التشفير المضاربة هو بلا خسارة. يقترح مصمم خفيف الوزن عدة رموز مستقبلية، ويتحقق النموذج المستهدف منها معًا في تمريرة أمامية واحدة باستخدام أخذ عينات الرفض. يعتمد التسريع بعد ذلك على أمرين: عدد الرموز المميزة للمسودة التي يتم قبولها، والمدة التي تستغرقها جولة التحقق من المسودة الكاملة.

تتحرك هاتان الكميتان في اتجاهين متعاكسين عبر المجالات. في المحادثة المفتوحة ذات الإنتروبيا العالية، تكون العديد من الاستمرارات صالحة لغويًا. قد يختار الهدف أيًا منها، لذلك يتلاشى القبول بسرعة مع عمق الاقتراح. إنشاء والتحقق من حساب نفايات الكتلة الطويلة. تتناسب صياغة الخطة المتوسطة الأجل ذات الانحدار الذاتي مع هذا النظام لأنها تقترح تسلسلًا أقصر للمرشح.

يتصرف الكود والتفكير الرياضي بشكل مختلف. إن بناء جملة البرمجة والمعرفات المتكررة والتعبيرات الرسمية والاشتقاقات خطوة بخطوة تقيد الرموز المميزة المستقبلية بقوة أكبر. تخلق أعباء العمل هذه فترات أطول يمكن التنبؤ بها، وهو بالضبط ما تستهلكه الصياغة المتوازية بشكل جيد.

لذلك يتم شحن AngelSpec اثنين من الصياغة التكميلية، وليس حل وسط واحد. يتم تدريب نموذج MTP على بيانات غنية ومتنوعة موجهة نحو المحادثة. يتم تعزيز نموذج نشر الكتلة بعينات تركز على الكود والرياضيات.

مسار الخطة المتوسطة الأجل: اختبار وقت التدريب وطرح النموذج المستهدف

تم تدريب نموذج Hy3 الأصلي بطبقة MTP واحدة ولا يوجد بسط مشروط ذاتيًا متكرر. عند الاستدلال، يمكن إعادة استخدام الكتلة بشكل متكرر، لكن هدف التدريب لم يعدها أبدًا لسلسلة طويلة يتم إنشاؤها ذاتيًا. تتراكم الأخطاء مع العمق، لذا يتم قبول المسودتين الثانية والثالثة بمعدلات أقل بكثير من الأولى.

تعالج AngelSpec عدم تطابق قطار الاستدلال هذا باستخدام ملف معلمة مشتركة، متعددة العمق مخطط. إنه يحتفظ D أعماق التنبؤ المنطقي ولكنها تعيد استخدام كتلة MTP مادية واحدة. أثناء التدريب، يتم فتح هذه الكتلة بشكل انحداري تلقائي D الخطوات، مع إدخال كل توقع في الاستدعاء التالي. باتباع مبدأ اختبار وقت التدريب في EAGLE-3، العمق k+1 يتلقى arg max التنبؤ من العمق k بدلاً من رمز الحقيقة الأرضية. تتم مشاركة المعلمات، لكن يظل الإشراف محددًا بالعمق: يقوم المعلم المستهدف بتعزيز موقع مستقبلي واحد في كل عمق.

هناك خياران آخران يحملان معظم المكاسب. أولاً، العمود الفقري للهدف ورأس نموذج اللغة الهدف هما مجمدة، ويتم فصل مدخلات MTP من العمود الفقري. يقوم المحرر بتحسين توزيع مقترحه دون المساس بالتوزيع الذي يجب أن يحافظ عليه التحقق. ثانياً: استخدامات التدريب طرح النموذج المستهدف: يتم إنشاء الاستجابات بواسطة الهدف المجمد بدلاً من أخذها من المجموعة المرجعية الأصلية. وينتج عن ذلك اختيارات الرمزية الدقيقة، ومسارات الحالة المخفية، وأنماط عدم اليقين المحلية التي يجب على MTP تقريبها في وقت التقديم.

يتركز التأثير المقاس حيث ينبغي أن يكون. في T = 0، ينتقل متوسط ​​القبول من 52.8% إلى 66.4%، ومتوسط ​​الطول المقبول من 2.58 إلى 2.99. تم الحفاظ على معدل المركز الأول تقريبًا عند 0.799 → 0.814. المواقف الأعمق تحمل الدلتا: p3 يتسلق من 0.290 إلى 0.706 على GSM8K، ومن 0.387 إلى 0.757 على HumanEval.

DFly: تكييف هدف هجين ورأس AR مكيف مسبقًا

DFly هي بنية نشر الكتلة. إنه يعتمد على DFlash مع تغييرين هيكليين.

العمود الفقري الهجين لتكييف الهدف: يقوم DFlash بتسلسل الحالات المخفية من طبقات مستهدفة متعددة وتحويلها بطبقة متصلة بالكامل، مما يؤدي إلى إنتاج ميزة سياق مشتركة واحدة. يتم بعد ذلك توفير هذا السياق الفردي لكل طبقة مسودة، مما يحد من تخصص الطبقة. بدلاً من ذلك، يتعلم DFlare أوزان الدمج لكل طبقة، مما يمنح كل طبقة مسودة رؤيتها الخاصة للتسلسل الهرمي المستهدف، ولكنه يسقط تحويل DFlash المكتسب عبر الطبقات. يقوم DFly بتأليفها: ينشئ فرع FC أساسًا دلاليًا مشتركًا، ويتم تطبيق الدمج لكل طبقة باعتباره الصقل المتبقية على القمة. يقدم الفرع الإضافي فقط D × T يمكن حساب الأوزان العددية ومعاملات softmax الخاصة بها مسبقًا بعد التدريب.

رأس انحدار ذاتي مُكيف مسبقًا: يتنبأ العمود الفقري الموازي بموضع كل كتلة من السياق المقبول فقط. لا يمكنه معرفة أي استمرار تم اختياره بالفعل في مواضع المسودة السابقة، مما يؤدي إلى اضمحلال قبول اللاحقة. يضع DFly رأسًا متسلسلًا صغيرًا بعد العمود الفقري الموازي، مما يحول التنبؤات الهامشية من حيث الموضع إلى توزيعات مكيفة بالبادئة. يبقى العمود الفقري باهظ الثمن متوازيًا تمامًا؛ فقط الرأس الصغير يمتد من اليسار إلى اليمين.

الأداء المبكر

على كوين3-8ب، يصل DFly إلى 5.41 متوسط ​​متوسط ​​الطول المقبول، مقابل 5.32 لـ DSpark، و4.57 لـ DFlash، و3.24 لـ MTP. إنه يأخذ أفضل نتيجة في جميع معايير الرياضيات والتعليمات البرمجية الخمسة. يظل DSpark متقدمًا قليلاً على MT-Bench عند 3.77 مقابل 3.67، وهو ما يتوافق مع وضع DFly في الكود والرياضيات.

على Hy3-A21B، الهامش أوسع. يصل DFly إلى 4.79 مقابل 3.69 لـ DFlash و3.00 لـ MTP – مكاسب نسبية قدرها 29.8% و59.7%. إنه يحسن كل واحد من المعايير الستة المبلغ عنها.

الاجتثاث التراكمي على Hy3-A21B تحت آثار فك التشفير الجشع حيث يأتي ذلك من: DFlash backbone 3.77، DFly backbone 4.40، بالإضافة إلى Markov head 4.56، والتصحيح المخفي 4.60، وبيانات الكود/الرياضيات 4.75. يضيف توسيع البيانات 700 ألف مطالبة – 500 ألف رمز من OpenCodeInstruct وOpenCodeReasoning، و200 ألف عملية حسابية من Big-Math. تتم إزالة أي مطالبة بمشاركة نطاق متجاور مكون من 16 رمزًا مميزًا مع مثال تقييم قبل إنشاء الاستجابة.

داخل الإطار

تم بناء AngelSpec على TorchSpec وتمديده إلى عدة أماكن. الأساس هو مصنفة: تقوم محركات الاستدلال بتشغيل نموذج الهدف المجمد وتدفق الحالات المخفية من خلال متجر RDMA المدعوم من Mooncake مباشرة إلى عمال التدريب الموزعين. يتم التقاط الحالات المخفية داخل العمليات المنفذة لـ vLLM من خلال واجهات برمجة تطبيقات vLLM العامة – خطاف استخراج الحالة المخفية التخميني وموصل KV مخصص – دون تفرع المحرك.

الإضافات المهمة لهذا العمل:

  • طرح TTT تم نشره بالتوازي على التسلسل بأكمله، مع إعادة إنتاج بنية الانتباه ذات البادئة السببية بالإضافة إلى القطر ضمنيًا عبر دمج FlexAttention وlogsumexp. تبقى الذاكرة قريبة من تمريرة سببية واحدة.
  • تدريب طويل السياق مع توازي تسلسل يوليسيس، تم التحقق من صحته بأطوال سياقية تصل إلى 128 ألف رمز. كل قطعة محلية تحمل D– هالة رمزية بحيث يظل الإشراف المتغير بالعمق في المرتبة المحلية.
  • تعبئة تسلسلية مدركة للمستندات مع ثلاث آليات عزل – بوابة مستند الانتباه، وبوابة مستند تحويل العمق الخاصة بمسار MTP، وترميز موضع المستند المحلي. يتم تغطية عزل المستندات عبر اختبارات الوحدة للتحقق من عدم تسرب الانتباه.
  • خادم التقييم يقوم بشكل دوري بتشغيل فك تشفير تخميني حقيقي مقابل أحدث نقطة تفتيش على وحدات معالجة الرسومات المخصصة، والإبلاغ عن متوسط ​​الطول المقبول وقبول كل موضع كما تم قياسه بواسطة محرك الخدمة نفسه.
  • واجهات قابلة للتوصيل على ثلاثة مستويات: الأهداف (نقطة إدخال البرنامج الإضافي vLLM لوقت التشغيل، لا يوجد تصحيح مصدر)، والأهداف (تتألف من قاعدة مشتركة، يتم تحديدها بواسطة التكوين)، والمحسنات (Muon كبديل مباشر لـ AdamW).

الواجهات الخلفية متدرجة: vLLM من الدرجة الأولى، مع دعم SGLang وHuggingFace Transformers على مستوى المجتمع.