لقد أطلق مختبر Tongyi التابع لشركة علي بابا كوين-الصوت-3.0-TTS، نظام تحويل النص إلى كلام (TTS) الموجه نحو الإنتاج. يأتي النموذج في نسختين مختلفتين من نفس السلالة. فلاش يستهدف التفاعل في الوقت الحقيقي. زائد يستهدف توليد عالي الجودة. يتم تسليم كلاهما كنماذج مستضافة من خلال Alibaba Cloud Model Studio، وليس كأوزان قابلة للتنزيل.

يركز الإصدار على أربعة أشياء حققها المطورون في الإنتاج: التغطية اللغوية الأوسع، والتحكم في نمط اللغة الطبيعية، والتحكم الدقيق في العلامات، والمتانة عندما لا يكون الصوت المرجعي نظيفًا. يحتل Qwen-Audio-3.0-TTS-Plus أيضًا المرتبة الأولى في لوحة المتصدرين المستقلة لتحويل النص إلى كلام.

نوعان، نسب واحد

يعين المستويان وظائف مختلفة. فلاش تم ضبطه للتفاعل في الوقت الفعلي، مع زمن وصول الحزمة الأولى عند مستوى 300 مللي ثانية. زائد تم ضبطه لإنتاج عالي الجودة، حيث تكون الطبيعة ودقة الصوت أكثر أهمية من السرعة.

معرفات النموذج هي qwen-audio-3.0-tts-flash و qwen-audio-3.0-tts-plus. يتم استدعاء كلاهما عبر بروتوكول دفق WebSocket ثنائي الاتجاه. تدعم واجهة برمجة التطبيقات (API) PCM وWAV وMP3 وOpus، بمعدل إخراج يصل إلى 48 كيلو هرتز. يعرض تدفق المدخلات والمخرجات، واستنساخ الصوت، والتصميم الصوتي، والتحكم في التعليمات. توفر شركة Alibaba مجموعة DashScope SDK بالإضافة إلى أمثلة WebSocket الأولية في Python وJava وGo وC# وPHP وNode.js، عبر مناطقها في سنغافورة وبكين.

كيف يتم بناء النموذج

هناك خياران للتصميم يرسيان النظام.

  1. أ مُرمز الكلام بمعدل إطار منخفض 12.5 هرتز يقلل من تكلفة فك التشفير التلقائي مع الاحتفاظ بمعلومات المحتوى والمتحدث. يعني معدل الإطارات المنخفض عددًا أقل من الرموز المميزة في الثانية من الصوت، مما يقلل من زمن الوصول للاستدلال.
  2. أ نموذج التدريب التقدمي المكون من خمس مراحل ينسق مكونات نموذج اللغة (LM) ومطابقة التدفق (FM). المراحل هي التدريب المسبق المستقل على LM وFM، والتدريب المشترك مع التلدين عالي الجودة للبيانات، والتعلم المعزز LM، والتدريب على قوة FM، والتعلم المعزز FM. أفاد فريق البحث أن خط الأنابيب هذا يعمل على تحسين اتساق المحتوى، وطبيعية العروض، ودقة الصوت، وجودة الإدراك الحسي، والمتانة.

يتعامل النموذج أيضًا مع التوليف الطويل لمرة واحدة لمدة تصل إلى 3 دقائق، وحالات تطبيع النص الثابت، والدقة الفائقة للمشفر الصوتي لإخراج 48 كيلو هرتز.