قامت شركة Interfaze، وهي شركة ناشئة تابعة لشركة YC، بفتح مصدر جديد لنموذج جديد للتعرف على الكلام. يطلق عليه diffusion-gemma-asr-small. يقوم النموذج بنسخ الصوت من خلال وحدة فك تشفير الانتشار، وليس وحدة الانحدار الذاتي. يوصف بأنه أول نموذج ASR لنشر الصوت متعدد اللغات. محول واحد يتعامل مع ست لغات. قام فريق البحث بتدريب حوالي 42 مليون معلمة فقط فوق العمود الفقري المتجمد 26B. وهذا يمثل حوالي 0.16% من أوزان النموذج.

هنا هناك فترتان مهمتان في المقدمة. تقوم نماذج الانحدار التلقائي بإنشاء نص رمزي واحد في كل مرة. تعمل نماذج الانتشار على تحسين جميع الرموز المميزة بالتوازي. يستخدم هذا النموذج أسلوب الانتشار لتحويل الكلام إلى نص.

ليرة تركية؛ د

  • ادعى فريق Interfaze أنه أول ASR منتشر متعدد اللغات مفتوح المصدر: ست لغات من محول واحد يبلغ 42 مليونًا تقريبًا.
  • يقوم بالنسخ عبر وحدة فك ترميز الانتشار الخاصة بـ DiffusionGemma باستخدام الانتشار الموحد والعشوائي للرمز المميز، وليس الامتصاص <mask> مخطط.
  • مقاييس تكلفة النسخ مع خطوات تقليل الضوضاء، وليس طول النص.
  • يتصدر أقرانه في النشر على LibriSpeech (6.6% WER مقابل Whisfusion’s 8.3%) ولكنه يتتبع Whisper الانحداري الذاتي.
  • يأتي المحول ضمن Apache-2.0؛ يتم تحميل DiffusionGemma (مصطلحات Gemma) وwisper-small (MIT) بشكل منفصل.

ما هو الانتشار-جيما-عصر-صغير؟

diffusion-gemma-asr-small هو نموذج ASR صوتي أصلي. يقوم بتحويل الكلام إلى نص باستخدام وحدة فك ترميز الانتشار المنفصلة. ينتمي جهاز فك التشفير هذا إلى DiffusionGemma، وهو نموذج Google المختلط المكون من 26B من الخبراء. يقوم DiffusionGemma بتنشيط معلمات 4B، باستخدام 128 خبيرًا مع توجيه من أعلى 8. يقوم بإنشاء نص عن طريق الانتشار المنفصل بدلاً من الانحدار التلقائي.

تفاصيل الانتشار محددة. تستخدم معظم LLMs الانتشار مادة ممتصة <mask> مخطط. يستخدم DiffusionGemma توزيعًا موحدًا وعشوائيًا للرمز المميز بدلاً من ذلك. فهو يملأ لوحة قماشية ذات طول ثابت برموز مفردات عشوائية. تحافظ كل خطوة على تنبؤات موثوقة وتعيد ترتيب الباقي بطريقة عشوائية. بعد بضع خطوات، يتحول الضجيج إلى نص.

أضافت Interfaze الصوت إلى هذا النموذج النصي فقط. خارج الصندوق، يأخذ DiffusionGemma النصوص والصور والفيديو. أنها لا تأخذ الصوت. يشحن الريبو فقط المحول المدرب، حوالي 42 مليون معلمة. يتم تنزيل العناصر الأساسية المجمدة بشكل منفصل عن اتفاقيات إعادة الشراء الخاصة بها.

كيف يعمل

لا يقوم النموذج بتغذية الأشكال الموجية الأولية إلى LLM. لقد حاولت محاولة مبكرة ذلك بالضبط وفشلت. لم يسبق لشهادة LLM المجمدة أن شاهدت مخططًا طيفيًا. لا تحتوي مساحة التضمين على فكرة عن الصياغات أو الصوتيات. تعلم النموذج تجاهل الصوت والهلوسة بطلاقة.

يستخدم تصميم العمل المجمدة whisper-small التشفير. إنه يعمل فقط كمستخرج للميزات، وليس وحدة فك ترميز. يقوم Whisper بتحويل 30 ثانية من الصوت إلى 1500 إطار. يحمل كل إطار ميزات صوتية ذات 768 بُعدًا. ثم يقوم جهاز عرض صغير قابل للتدريب بضغط هذه الإطارات. يستخدم طبقات التحويل التي تحتوي على عينة فرعية 8 × بالإضافة إلى خريطة خطية. الإخراج هو 188 “رمزًا صوتيًا” بأبعاد 2816. تنتشر هذه الرموز المميزة في الموجه المحجوز <|audio|> فتحات. تسمح محولات LoRA للعمود الفقري بالاهتمام بهذه الطريقة الجديدة. يقوم جهاز فك التشفير بعد ذلك بإلغاء تشفير لوحة نصية مكونة من 192 رمزًا. يتم تشغيله في اتجاهين على مدى 16 خطوة تقريبًا.

خط الأنابيب، من بطاقة النموذج، مضغوط:

raw audio ─► whisper-small encoder (frozen) ─► projector (trained, ~19M)
          ─► scatter into <audio> token slots of DiffusionGemma's encoder
          ─► DiffusionGemma decoder denoises a 192-token canvas (bidirectional, cross-attends audio)
          ─► transcript

فتح التدريب

توقفت الدورات التدريبية الأولى. الخسارة ثابتة بالقرب من 8. كان الفشل دائريًا. بدأ جهاز العرض بشكل عشوائي، لذلك كان خرجه ضوضاء. ثم تعلم الاهتمام تجاهله. لم يصل أي تدرج تقريبًا إلى جهاز العرض. النموذج لم يتعلم أبدا.

أشرف الإصلاح على جهاز العرض مباشرة. قام فريق البحث بتشغيل 188 رمزًا صوتيًا من خلال DiffusionGemma المجمدة lm_head. لقد طبقوا خسارة CTC مقابل النص. يعنيCTC التصنيف الزمني Connectionist. يقوم بمحاذاة ميزات الصوت مع النص دون الحاجة إلى الاهتمام.

وهذا يتجنب المواجهة. أصبحت التضمينات الصوتية تتنبأ بشكل خطي بالكلمات الصحيحة. ثم انخفضت خسارة CTC من 24 إلى 8.6 في 300 خطوة. في اختبار LibriSpeech النظيف، انخفض معدل WER للغة الإنجليزية بنسبة 90% → 52% → 14.6% → 6.6% على مدار عشر حقب.

الأداء والمعايير

WER يعني معدل خطأ الكلمات، حيث يكون الأقل أفضل. يعنيCER معدل خطأ الأحرف. تم تدريب النموذج على FLEURS وLibriSpeech وVoxPpuli. تستخدم جميع النتائج أدناه أداة تسوية النص Whisper في 16 خطوة نشر.

المعيار متري نتيجة
اختبار LibriSpeech النظيف (ar) ور 6.6%
فلورز الإنجليزية ور 15.7%
الإنجليزية فوكس بوبولي ور 18.5%
زهور هندية خفض الانبعاثات المعتمدة 15.8%
فلور ماندرين خفض الانبعاثات المعتمدة 29.6%

ضد الانتشار الآخر أو ASR غير الانحداري، فإنه يؤدي.

نموذج يقترب اختبار LibriSpeech نظيف
نقل الدم (2022) انتشار متعدد الحدود ~6–7% (إثبات المفهوم)
Whisfusion (أغسطس 2025) الهمس الكبير v3 + الانتشار المقنع 8.3%
انتشار-جيما-عصر-صغير (2026) الهمس-صغير + انتشارجيما 6.6%

ضد الهمس ذاتي الانحدار، فإنه يتتبع. قام الفريق بتأطير هذه الفجوة على أنها بيانات، وليس بنية.

المعيار لنا الهمس-صغير الهمس-كبير-v3
LibriSpeech نظيف 6.6% ~3.4% ~2.0%
فلور أون 15.7% ~9-10% ~4-5%
VoxPpuli-en 18.5% ~9–11% ~7-10%

يُظهر مسح خطوة تقليل الضوضاء منحنى مسطحًا تقريبًا.

خطوات فلور أون فير سرعة
8 15.7% 14.9 × في الوقت الحقيقي
16 15.6% 10.3×
32 15.2% 6.5×
48 15.6% 4.7×

يؤدي الانتقال من 8 إلى 48 خطوة إلى شراء حوالي 0.1 نقطة WER. يكلف ما يقرب من 3 × الكمون. يتقارب النموذج في حوالي 8 تمريرات متوازية. يمثل ذلك حوالي 0.7 إلى 1.5 ثانية من وقت النموذج لمقطع مدته 10 ثوانٍ.

استخدام الحالات مع الأمثلة

  • تستفيد خطوط أنابيب النسخ المجمعة من فك التشفير المتوازي. يتم تحديد التكلفة عن طريق تقليل الضوضاء، وليس طول المقطع. يحتاج المقطع الذي تبلغ مدته 10 ثوانٍ تقريبًا إلى نفس التمريرات التي يحتاجها المقطع الأقصر.
  • يتم تشغيل النسخ متعدد اللغات من محول واحد. ويغطي الإنجليزية والألمانية والفرنسية والإسبانية والهندية والماندرين. تتجنب الفرق تحميل نموذج منفصل لكل لغة.
  • يكتسب بحث ASR غير الانحداري خط أساس قابل للتكرار. تعتمد الوصفة على LLM مجمدة بمحول صغير. يمكن للباحثين تمديده بمزيد من الصوت أو ببرنامج تشفير أكبر.

كيف تبدأ

النموذج يعيش على المحور. يقوم بشحن المحول، model.py, audio.py، وقابلة للتشغيل inference.py. احتياجات دعم DiffusionGemma transformers من الرئيسي.

pip install torch peft soundfile librosa huggingface_hub \
  "transformers @ git+https://github.com/huggingface/transformers.git"

ثم قم بالنسخ بلغة بايثون:

import sys, soundfile as sf
from huggingface_hub import snapshot_download

repo = snapshot_download("interfaze-ai/diffusion-gemma-asr-small")   # adapter, ~170 MB
sys.path.insert(0, repo)
from inference import load, transcribe

# Loads frozen DiffusionGemma-26B + whisper-small + this adapter.
model, tok, fe = load(f"{repo}/diffusion_asr_small.pt", device="cuda")

wav, sr = sf.read("audio.wav")   # 16 kHz mono float32
print(transcribe(wav, model, tok, fe, max_steps=16))

يعمل مسار سطر الأوامر أيضًا من داخل الريبو الذي تم تنزيله:

python inference.py audio.wav

ال max_steps الحجة تتداول السرعة من أجل الدقة. يلاحظ الفريق أن الرقم 8 هو الأقرب إلى الأفضل والأسرع. الإعداد الافتراضي هو 16. يتم تحميل النماذج الأساسية بموجب تراخيصها الخاصة: DiffusionGemma بموجب شروط Gemma، وwisper-small بموجب MIT.

الشرح التفاعلي