تم إطلاق الذكاء الاصطناعي السائل مضاد، وهي طريقة مفتوحة المصدر تستهدف وضع الفشل الشائع في نماذج الاستدلال. وضع الفشل هذا هو حلقة الموت. في حلقة الموت، يُصدر النموذج مسافة. ثم يكرر ذلك الامتداد مرارًا وتكرارًا. يستمر الإخراج حتى يتم استنفاد إطار السياق. نماذج الاستدلال الصغيرة هي الأكثر عرضة لذلك، خاصة في آثار التفكير الطويل والمسائل الصعبة.
عند نقطة تفتيش مبكرة LFM2.5-2.6B، 10.2% من عمليات إكمال الرياضيات الصعبة ومطالبات البرمجة أنتجت حلقات متكررة. وبعد تدريب Antidoom، انخفض هذا المعدل إلى 1.4%. تحسنت درجات التقييم في جميع المجالات، ويُعزى ذلك بالكامل إلى تقليل التكرار.
ليرة تركية؛ د
- يعمل Antidoom على تقليل حلقات الموت عن طريق إعادة تدريب أول رمز لبدء الحلقة فقط.
- ينشر FTPO الاحتمالية عبر عدة بدائل متماسكة، وليس بديلاً واحدًا.
- وانخفضت حلقات LFM2.5-2.6B بنسبة 10.2% إلى 1.4%؛ وانخفض سهم Qwen3.5-4B بنسبة 22.9% إلى 1%.
- يتم تشغيل خط الأنابيب في غضون ساعات قليلة، والمكدس الكامل مفتوح المصدر.
ما هو مضاد؟
Antidoom هو إصلاح مستهدف، وليس تغييرًا واسع النطاق في العينات. يجد الرمز المميز الذي يبدأ الحلقة. ثم يقوم بتدريب النموذج على تفضيل البدائل المتماسكة في هذا الموضع الفردي. بقية التوزيع يبقى على حاله إلى حد كبير.
تتكيف الطريقة مضاد للانزلاق. يتم تدريبه على الأزواج المختارة/المرفوضة التي تمثل رمز إكمال واحد. خوارزمية التدريب هي تحسين تفضيلات الرمز النهائي (FTPO)، وهو مشابه لـ DPO.
لا يعلم التدريب النموذج شيئًا جديدًا عن الرياضيات أو البرمجة. فهو يزيل التكرارات التي تمنع الإجابات التي يمكن أن ينتجها النموذج بالفعل.
تشريح حلقة الموت
يعزو فريق Liquid AI حلقات الموت إلى ثلاث آليات تعمل معًا:
الآلية 1: الرموز المميزة المفرطة بالإضافة إلى عدم اليقين. من المرجح أن يتم اختيار بعض الرموز المميزة بشكل عام. تشمل الأمثلة المعروفة في البرية “الحفر” و”الوصية”. لاحظ فريق Liquid AI أن هذا يمكن أن يعود إلى البيانات الاصطناعية في مجموعة التدريب. في مسارات الاستدلال، غالبًا ما تشتمل الاستمرارات ذات الأولوية العالية على علامات الخطاب مثل “انتظر” أو “بديلاً”. هذه الرموز ليست سيئة بطبيعتها. ويمكن أن تمثل تغييرًا مفيدًا في الإستراتيجية، أو خطوة تحقق، أو فرعًا. عندما يكون النموذج غير مؤكد أو عالقًا، فإنه يصبح بدلاً من ذلك استمرارية احتياطية جذابة.
بالنسبة لنقطة تفتيش LFM2.5-2.6B المبكرة، كانت الرموز المميزة الأكثر شيوعًا لبدء الحلقة هي التالية.
| رمز مميز | تبدأ حصة الحلقة |
|---|---|
the |
11.39% |
So |
4.51% |
Alternatively |
3.22% |
Wait |
2.56% |
But |
2.46% |
الآلية 2: السياق السابق يعزز الحلقة. كل تكرار يدفع كل رمز مميز في المدى نحو الاحتمال الذي قاله Duan et al. دراسة هذا في عملهم على المنطق الدائري. ويربطونه بنمط الانتباه “على شكل حرف V”. ووجدوا أن التكرار الدلالي يسبق التكرار النصي.
الآلية 3: أخذ العينات الجشع. عادةً ما تعمل نماذج الاستدلال عند درجة حرارة منخفضة للحصول على آثار مستقرة وقابلة للتكرار. عند درجة الحرارة 0، يتم دائمًا تحديد الرمز الأكثر احتمالاً. وبالتالي فإن الحلقة المعززة محليًا ليس لها مخرج. يُبلغ الذكاء الاصطناعي السائل عن حدوث حلقات كبيرة حتى عند درجة حرارة = 0.67. انخفاض درجات الحرارة يؤدي إلى تفاقم المشكلة.
كيف يقوم Antidoom بتحديد موقع الفشل
يقوم Antidoom بإنشاء عمليات إكمال على مزيج سريع مصمم لإثارة التكرار عند درجة حرارة منخفضة. هذا المزيج من السفن مثل LiquidAI/antidoom-mix-v1.0 dataset. يتم اكتشاف التكرار الحلقي عند تكرار القسم أربع مرات على الأقل، بما لا يقل عن 60 حرفًا.
ثم تستهدف الطريقة أول رمز للتكرار الأول. في هذا الموضع، فإنه يأخذ بدائل top-k log-prob للنموذج الأساسي. يقوم بتصفية الضوضاء القصيرة أو غير الأبجدية الرقمية. إنه يحتفظ بما يصل إلى 20 بديلاً معقولاً اختيار الرموز.
كل صف تدريب عبارة عن مجموعة من البادئة السريعة، واحدة مرفوض رمز، وواحد أو أكثر اختيار الرموز. يتم تنظيم التوزيعات المختارة والمرفوضة قبل التدريب. خلاف ذلك عدد قليل من الجناة مثل انتظر, لذا، و ال سوف يهيمن والإفراط في القمع من شأنه أن يحط من المنطق.
من السهل ذكر قاعدة الكشف نفسها في التعليمات البرمجية. المقتطف أدناه توضيحي.
# A loop = a unit repeating >=4 times, spanning >=60 characters.
# Returns the index of the first token of the first repeat (the target), else None.
def find_loop(text, min_repeats=4, min_chars=60):
n = len(text)
for span in range(1, n // min_repeats + 1):
start = 0
while start + span * min_repeats <= n:
unit = text[start:start + span]
repeats = 1
pos = start + span
while text[pos:pos + span] == unit:
repeats += 1
pos += span
if repeats >= min_repeats and span * repeats >= min_chars:
return start + span # first token of the first repeat
start += 1
return None
تصبح كل حلقة تم اكتشافها صفًا تدريبيًا واحدًا. الهيكل عبارة عن صف بسيط.
# One FTPO training row, per the post's [prefix, rejected, chosen] format.
row = {
"prompt": prefix_up_to_the_loop, # text before the first repeat
"rejected": " Wait", # the single token that started the loop
"chosen": [" So", " Since", " The", " Therefore"], # up to 20 alternatives
}
تحسين تفضيلات الرمز النهائي (FTPO)
FTPO هي خوارزمية تحسين التفضيلات مشابهة لـ DPO. تحتوي عينة التدريب على موجه واستمرار مختار واستمرار مرفوض. لقد تم تصميمه لتغيير عدد قليل من الرموز المميزة، مع الحد الأدنى من الإزعاج للنموذج بخلاف ذلك.
يختلف FTPO عن DPO في أربع طرق:
- تدريب الرمز النهائي: إنه يدرب فقط الرمز المميز للتسلسل الذي يقع في منتصف الطريق خلال عملية التوليد.
- الرموز المختارة المتعددة لكل عينة: إنه ينشر الاحتمالية عبر مجموعة من البدائل، لذلك لا يتم ببساطة استبدال رمز مميز واحد تم تدريبه بشكل مفرط بآخر.
- خسارة تشبه KL في مساحة السجل: يحذف softmax ويحسب الاختلاف عن المرجع في اللوغاريتمات، ويتجنب الضغط على الرموز غير ذات الصلة.
- تسوية من جزأين: تتحرك اللوجيستيات المختارة والمرفوضة بحرية أكبر، بينما تظل المفردات المتبقية مقيدة بإحكام.
في تطبيق Antidoom، يتدرب النموذج لفترة واحدة مع LoRA. أعطت صفوف LoRA العالية من 128 إلى 256 أفضل النتائج. يغطي التدريب كل الاهتمام وإسقاطات MLP، بالإضافة إلى ذلك lm_head. تتراوح معدلات التعلم من 4e-6 إلى 2e-5.
يستخدم التدريب التوقف المبكر chosen_win، حصة العينات التي تم فيها رفض الرموز المختارة. التوقف عند chosen_win=0.35 خفض معدلات حلقة الموت من 20-30% إلى 1-2%. التدريب لفترة أطول يميل إلى تدهور النموذج.
بالنسبة لنقطة تفتيش LFM2.5-2.6B المبكرة، استغرق إنشاء مجموعة التدريب حوالي ساعة واحدة على وحدات معالجة الرسومات 8x MI325. استغرق التدريب بعد ذلك حوالي ساعة إلى ساعتين على وحدة معالجة الرسومات MI325 واحدة. يتوقف الجيل بعد جمع 20 ألف زوج.
كيف يقارن Antidoom بالإصلاحات المعتادة
| يقترب | ما يتغير | ملف تعريف التكلفة | ذكرت العيب |
|---|---|---|---|
repetition_penalty |
يعيد وزن توزيع الإخراج | وقت الاستدلال، رخيص | إسعافات أولية؛ يمكن أن تتدهور الأداء |
| تعزيز التعلم | السياسة عبر المكافآت | مكافآت معايرة، عمليات نشر مكلفة عبر الإنترنت | الإعداد وحساب النفقات العامة |
| DPO (الرمز النهائي) | رمز واحد مختار لكل عينة | التدريب دون اتصال | خشن beta; يقوم بتحديث رمز واحد |
| أنتيدوم (FTPO) | رمز الحلقة الأولى → العديد من الرموز المختارة | ~1 ساعة (8x MI325) + قطار 1-2 ساعة (1x MI325) | يمكن أن يعرض حلقات جديدة. قد تحتاج إلى جولات إضافية |
نتائج
بعد التدريب، انخفض معدل حلقات الهلاك عند نقطة تفتيش LFM2.5-2.6B المبكرة من 10.2% إلى 1.4%. تحسنت درجات التقييم في جميع المجالات، ويُعزى ذلك بالكامل إلى انخفاض التكرار.
قام فريق Liquid AI أيضًا بتشغيل خط الأنابيب Qwen3.5-4B، والتي من المعروف أنها تتكرر أثناء التفكير. انخفض معدل تكرار الهلاك من 22.9% إلى 1% في ظل أخذ العينات الجشع. زادت درجات التقييم بشكل ملحوظ.
تغيرت درجة التقييم عكسيا مع معدل حلقة الموت مع ارتفاع درجة الحرارة. بعد التدريب، أظهر كلا النموذجين انخفاضًا في الأداء بالقرب من درجة الحرارة = 1.0. وهذا أمر متوقع، نظرًا لأن أخذ العينات ذات درجات الحرارة الأعلى يمكن أن يفضل الرموز المميزة الأقل تفضيلاً. وبمجرد إزالة التكرار، أعطت العينات شبه الجشعة أقوى الدرجات في النماذج التي تم اختبارها.
يشير فريق Liquid AI إلى نقطة ذات صلة حول الممارسة الشائعة. قد يتم الخلط بين الاعتقاد بأن درجات الحرارة المرتفعة تساعد على التفكير مع تأثير حلقات الهلاك. في اختباراتهم، بمجرد انتهاء الحلقات، يكون أداء أخذ العينات شبه الجشع هو الأفضل.
جولات متعددة يمكن أن تساعد. ترفض الجولة الأولى الرموز المميزة المسببة للحلقة وتعيد وزنها نحو البدائل. ومن الممكن أن يكشف ذلك عن نقاط فشل جديدة، والتي تستهدفها الجولة الثانية بعد ذلك.
الشرح التفاعلي
استخدام الحالات مع الأمثلة
- نماذج الاستدلال على الجهاز: يمكن لنماذج الاستدلال التي تبلغ سعتها أقل من 1 غيغابايت مثل عائلة LFM2.5 أن تتوقف في منتصف عملية الإثبات عند المطالبات الصعبة. يستعيد Antidoom الدقة التي كانت تكلفتها تلك الحلقات.
- وكلاء الترميز الصغيرة: يمكن لنموذج الترميز 4B أن يتكرر على تتبع تصحيح الأخطاء الثابت ويحرق نافذة السياق الخاصة به. تتيح إزالة الحلقة الوصول إلى الإصلاح الذي يعرفه بالفعل.
- مراقبة تكلفة خط أنابيب الوكيل: الحلقات تستهلك الرموز المميزة حتى استنفاد السياق. يؤدي قطعها إلى تقليل الرموز المميزة المهدرة ووقت الاستجابة عبر عمليات تشغيل الوكيل الطويلة.
- إصلاح ما بعد التدريب. يمكن للفرق التي تقوم بشحن نقاط التفتيش المنطقية الدقيقة تشغيل Antidoom كتمريرة تنظيف في غضون ساعات قليلة.
نقاط القوة والتحديات
نقاط القوة:
- مستهدف: يقوم بتحرير رمز الحلقة الأول ويترك باقي التوزيع سليمًا إلى حد كبير.
- سريع: يتم تشغيل خط الأنابيب بالكامل في غضون ساعات قليلة.
- تم قياسه: انخفض مؤشر LFM2.5-2.6B بنسبة 10.2% إلى 1.4%؛ وانخفض سهم Qwen3.5-4B بنسبة 22.9% إلى 1%.
- المصدر المفتوح: تم إصدار كل من التوليد والكشف ومدرب FTPO.
- يستعيد، لا يعلم: فهو يستعيد الإجابات التي يمكن أن ينتجها النموذج بالفعل.
التحديات:
- يمكن أن يكشف عن نقاط فشل جديدة، لذلك قد تكون هناك حاجة في بعض الأحيان إلى جولات متعددة.
- الإفراط في التدريب يؤدي إلى تدهور النموذج، لذا التوقف مبكرًا
chosen_winمطلوب. - تغطي النتائج المبلغ عنها نقاط تفتيش LFM وQwen3.5-4B، وكلاهما نموذجين صغيرين للاستدلال.
- يمكن أن ينخفض الأداء بالقرب من درجة الحرارة = 1.0 بعد التدريب.
- يحتاج كل نموذج إلى مجموعة بيانات التكرار التي تم إنشاؤها.
تحقق من التفاصيل الفنية و جيثب الريبو. أيضا، لا تتردد في متابعتنا على تغريد ولا تنسى الانضمام إلينا 150 ألف + مل والاشتراك في النشرة الإخبارية لدينا. انتظر! هل أنت على برقية؟ الآن يمكنك الانضمام إلينا على التليجرام أيضًا.
هل تحتاج إلى الشراكة معنا للترويج لصفحة GitHub Repo أو صفحة الوجه المعانقة أو إصدار المنتج أو الندوة عبر الويب وما إلى ذلك؟ تواصل معنا
اكتشاف المزيد من كحيل | أخبار التقنية
اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.
