لقد صدرت نفيديا نيموترون-لابز-TwoTower، نموذج لغة الانتشار المبني على العمود الفقري الانحدار الذاتي المدرب مسبقًا. يتم شحنه كأوزان مفتوحة بموجب ترخيص NVIDIA Nemotron Open Model. يستهدف الإصدار اختناقًا في إنتاجية إنشاء النص.
تقوم نماذج الانحدار الذاتي (AR) بفك تشفير رمز مميز واحد في كل مرة. هذه العملية التسلسلية تحد من إنتاجية التوليد. تأخذ نماذج لغة الانتشار المنفصلة طريقًا آخر. يقومون بإنشاء الرموز المميزة بالتوازي وتحسينها بشكل متكرر.
تستخدم معظم نماذج لغة الانتشار شبكة واحدة لوظيفتين. إنه يمثل الرموز النظيفة ويقلل من الرموز الفاسدة في كل خطوة. يفصل TwoTower هذه الوظائف إلى برجين. فهو يحتفظ بنسبة 98.7% من الجودة القياسية الإجمالية لخط الأساس للواقع المعزز. كما أنه يُبلغ عن إنتاجية أعلى بمعدل 2.42× لساعة الحائط.
ليرة تركية؛ د
- يقوم TwoTower بتقسيم الانتشار إلى برج سياق AR مجمد وبرج مزيل الضوضاء المُدرب.
- وتحتفظ بنسبة 98.7% من جودة الواقع المعزز بمعدل إنتاجية 2.42× (γ=0.8، S=16، 2×H100).
- تم تدريب مزيل الضوضاء على ~ 2.1T من الرموز المميزة؛ العمود الفقري يستخدم 25T.
- تقوم إحدى نقاط التفتيش بتشغيل أوضاع فك التشفير والنشر والواقع المعزز والواقع المعزز.
نيموترون-لابز-TwoTower
TwoTower هو نموذج انتشار الانحدار الذاتي على مستوى الكتلة. تم إنشاء مثيل له على Nemotron-3-Nano-30B-A3B، وهو عمود فقري هجين مفتوح الوزن. ويتداخل هذا العمود الفقري مع طبقات مامبا-2، والاهتمام الذاتي، وخليط الخبراء.
يتكون كل برج من 52 طبقة: 23 مامبا-2، و6 ذاتية الاهتمام، و23 طبقة موي. تشحن نقطة التفتيش المحررة كلا البرجين، بإجمالي 60 مليار تقريبًا من المعلمات. تبلغ المعلمات النشطة لكل رمز حوالي 3B لكل برج. تستخدم وزارة التربية والتعليم 128 خبيرًا قابلاً للتوجيه، منهم 6 نشطين، بالإضافة إلى خبيرين مشتركين.
يبدأ كلا البرجين كنسختين من نفس نقطة التفتيش الأساسية. يتم تدريب برج دينويزر فقط. يظل برج سياق الواقع المعزز مجمداً. تم تدريب مزيل الضوضاء على رموز 2.1T تقريبًا، وهو جزء صغير من التدريب المسبق للعمود الفقري البالغ 25T.
كيف يعمل البرجان
يعمل برج سياق الواقع المعزز بشكل سببي على الرموز المميزة والملتزمة. إنها تنتج ذاكرة تخزين مؤقت KV لكل طبقة وحالات Mamba-2 النهائية. فهو يحافظ على قدرة العمود الفقري على الانحدار الذاتي.
يعمل برج تقليل الضوضاء على تحسين الكتل الصاخبة. داخل الكتلة، يستخدم الانتباه ثنائي الاتجاه داخل الكتلة. يبقى سببيًا فيما يتعلق بالكتل النظيفة السابقة.
تتصل الأبراج طبقة تلو الأخرى. طبقة الدينويزر أنا يتقاطع مع طبقة برج السياق أنا. يمنح هذا الانتباه المتقاطع المحاذي للطبقة وصولاً متعدد النطاق إلى تمثيلات العمود الفقري. تبث الأساليب السابقة فقط الحالة المخفية الأخيرة.
هناك تعديلان آخران لدينويزر مهمان. تزرع طبقات Mamba-2 حالتها الأولية من حالة Mamba في برج السياق. تقوم خطوة الانتشار الزمنية بتعديل كل طبقة من خلال تكييف الوقت الفردي adaLN. تضيف وحدة adaLN هذه حوالي 1.5 مليون معلمة فقط.
يعمل الجيل كتلة تلو الأخرى. تبدأ كل كتلة كـ س [MASK] الرموز. يقوم دينويزر بتنقيحه ت خطوات، ثم يرتكبها. يقوم برج السياق بعد ذلك بمعالجة الرموز المميزة لتحديث ذاكرات التخزين المؤقت الخاصة به.
وهذا ما يفسر سبب قدرة خطوات تقليل الضوضاء المتعددة على التغلب على فك تشفير الرمز المميز الواحد. يلتزم فك التشفير التلقائي برمز واحد بالضبط في كل خطوة. يلتزم TwoTower بعدة رموز مميزة في كل خطوة في مرحلة مبكرة من التحسين.
المعايير
تستخدم التقييمات BF16 على وحدات معالجة الرسومات 2 × H100. نقطة التشغيل الافتراضية هي كشف الثقة، العتبة γ=0.8، حجم الكتلة S=16. يقارن الجدول خط الأساس AR مع فك تشفير نشر TwoTower.
| مهمة | نيموترون-3-نانو-30B-A3B (AR) | Nemotron-Labs-TwoTower (الانتشار) |
|---|---|---|
| MMLU (5 طلقة، ACC) | 78.56 | 78.24 |
| MMLU-Pro (5 طلقة، CoT EM) | 62.59 | 60.93 |
| تحدي ARC (25 طلقة، حسب_المعيار) | 91.72 | 92.66 |
| وينو غراندي (5 طلقات، ACC) | 76.09 | 76.09 |
| السباق (0-طلقة، ACC) | 88.90 | 88.90 |
| HumanEval (0-طلقة) | 79.27 | 75.58 |
| MBPP-المطهر (3 طلقة) | 74.71 | 74.28 |
| GSM8K (8 طلقات، ACC) | 92.49 | 90.14 |
| رياضيات-500 (4 طلقات) | 84.40 | 80.60 |
| MMLU جلوبال لايت (5 طلقات) | 73.97 | 73.94 |
| MGSM (8 طلقات، متوسط السرعة) | 80.80 | 80.40 |
| تم الاحتفاظ بالجودة | 100% | 98.7% |
| إنتاجية التوليد (× AR) | 1.0× | 2.42× |
تبقى المعرفة العامة ضمن نقطة واحدة تقريبًا من خط الأساس للواقع المعزز. يُظهر الكود والرياضيات تدهورًا متواضعًا. يتم استرداد درجات المنطق السليم واللغات المتعددة أو تحسينها قليلاً. يؤدي خفض γ إلى تنفيذ المزيد من الرموز المميزة في كل خطوة وزيادة الإنتاجية، مع انخفاض الجودة.
تشغيله: ثلاثة أوضاع للجيل
تكشف نقطة التفتيش عن ثلاثة مسارات للاستدلال. يستخدم الانتشار الكامل للبرجين وحدتي معالجة رسوميات، حوالي 59 جيجابايت لكل وحدة معالجة رسومات في BF16. يعمل وضع AR فقط على وحدة معالجة رسومات واحدة بسعة 80 جيجابايت.
import torch
from transformers import AutoTokenizer, AutoModelForCausalLM
model_name = "nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name, torch_dtype=torch.bfloat16, trust_remote_code=True,
)
# context tower -> GPU 0, denoiser tower -> GPU 1
model.place_towers_on_devices("cuda:0", "cuda:1")
model.eval()
prompt = "France is a country "
inputs = tokenizer(prompt, return_tensors="pt").to("cuda:0")
outputs = model.generate_mask_diffusion(
inputs["input_ids"], max_new_tokens=128,
block_size=16, steps_per_block=16, mask_token_id=3,
temperature=0.1, confidence_threshold=0.8,
eos_token_id=tokenizer.eos_token_id,
)
print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))
الأوضاع الثلاثة هي generate_mask_diffusion(), generate_mock_ar()، و generate_ar(). يلتزم نشر القناع بما يصل إلى block_size الرموز لكل خطوة. يلتزم Mock-AR وAR برمز مميز واحد في كل خطوة.
حيث يناسب: حالات الاستخدام
حالة الاستخدام الأكثر مباشرة هي إنشاء دفعة أسرع. يمكن لفريق البيانات الذي ينتج نصًا تركيبيًا أن يستبدل انخفاضًا صغيرًا في الجودة بالإنتاجية. عند γ=0.8، تبلغ جودة هذه التجارة 1.3% مقابل سرعة 2.42×.
حالة الاستخدام الثانية هي ضبط المفاضلة بين الجودة والإنتاجية. يؤدي رفع γ إلى الحفاظ على المزيد من الجودة، وفقًا لورقة NVIDIA. يؤدي خفض γ إلى تنفيذ المزيد من الرموز المميزة في كل خطوة لزيادة السرعة.
حالة الاستخدام الثالثة هي التكيف مع الانخفاض. يحتفظ برج السياق برأس LM الخاص به لفك التشفير التخميني أو التحقق أو تسجيل AR. يمكن للفرق تشغيل الواقع المعزز والانتشار من نقطة تفتيش واحدة.
نقاط القوة والضعف
نقاط القوة:
- الأوزان المفتوحة بموجب ترخيص NVIDIA Nemotron Open Model License؛ جاهزة للاستخدام التجاري
- يتم الاحتفاظ بنسبة 98.7% من جودة الواقع المعزز بمعدل إنتاجية يبلغ 2.42× عند نقطة التشغيل الافتراضية
- تدعم إحدى نقاط التفتيش النشر وفك تشفير الواقع المعزز والواقع المعزز
- تم تدريب Denoiser على ما يقرب من 2.1T من الرموز، وليس إعادة تدريب كاملة
- مقاييس ذاكرة التخزين المؤقت ذات الطول المتسلسل مثل خط الأساس للواقع المعزز
نقاط الضعف:
- يحتاج الانتشار الكامل للبرجين إلى وحدتي معالجة رسومات وحوالي 59 جيجابايت لكل وحدة معالجة رسومات في BF16
- الكود والرياضيات يتدهوران أكثر من المعرفة العامة (HumanEval 79.27 → 75.58)
- يؤدي الحفاظ على كلا البرجين إلى زيادة مساحة الذاكرة ذات الوزن الثابت للنموذج
- نقطة التفتيش التي تم إصدارها هي نموذج أساسي، قبل ضبط التعليمات أو محاذاتها
- الإنتاجية التي تتجاوز 3 × تأتي مع فقدان أكبر للجودة
الشرح التفاعلي
تحقق من ورق و الأوزان. أيضا، لا تتردد في متابعتنا على تغريد ولا تنسى الانضمام إلينا 150 ألف + مل والاشتراك في النشرة الإخبارية لدينا. انتظر! هل أنت على برقية؟ الآن يمكنك الانضمام إلينا على التليجرام أيضًا.
هل تحتاج إلى الشراكة معنا للترويج لصفحة GitHub Repo أو صفحة الوجه المعانقة أو إصدار المنتج أو الندوة عبر الويب وما إلى ذلك؟ تواصل معنا
اكتشاف المزيد من كحيل | أخبار التقنية
اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.
