أعلنت جوجل للتو الجوزاء 3.5 ترجمة حية. إنه أحدث نموذج صوتي للترجمة المباشرة من الكلام إلى الكلام. تعني ميزة “تحويل الكلام إلى كلام” أن الصوت المنطوق يدخل، ويخرج الصوت المنطوق المترجم. يكتشف النموذج أكثر من 70 لغة تلقائيًا ويولد كلامًا مترجمًا. فهو يحافظ على نغمة المتحدث وإيقاعه ودرجة صوته في الإخراج. تنتظر الأنظمة خطوة بخطوة حتى ينتهي مكبر الصوت من الرد. يقوم Gemini 3.5 Live Translate بإنشاء الكلام بشكل مستمر بدلاً من ذلك. فهو يوازن بين انتظار السياق والترجمة الفورية. مزيد من السياق يحسن الجودة. يؤدي الإخراج الأسرع إلى إبقاء الترجمة متزامنة مع المتحدث. تبقى النتيجة بضع ثوانٍ خلف السماعة طوال الجلسة.

الجوزاء 3.5 ترجمة حية

Gemini 3.5 Live Translate هو نموذج صوتي واحد (gemini-3.5-live-translate-preview)، وليس مساعد الدردشة. فهو يعالج الكلام أثناء تدفق الصوت داخل جملة كاملة، وليس بعدها. فهو يتعامل مع المدخلات متعددة اللغات دون تكوين الإعدادات يدويًا. تتيح قوة الضوضاء الخاصة بها تشغيل التطبيقات في بيئات عالية الصوت وغير متوقعة.

يتم طرح النموذج عبر ثلاثة أسطح. يحصل المطورون عليها في المعاينة العامة من خلال Gemini Live API وGoogle AI Studio. تحصل المؤسسات على معاينة خاصة في Google Meet بدءًا من هذا الشهر. ويمكن لأي شخص آخر الحصول عليها من خلال تطبيق الترجمة من Google على نظامي التشغيل Android وiOS.

كيف يعمل البث المستمر

فرق التصميم مهم لبناء ميزات في الوقت الفعلي. يستخدم الوكيل المباشر للمحادثة التفاعلات القائمة على الأدوار. يعتمد على الإيقاف المؤقت واكتشاف النوايا ومعالجة الانقطاع. تستخدم الترجمة المباشرة معالجة التدفق المستمر بدلاً من ذلك. يتم ترجمته عندما يتحدث المتحدث، دون انتظار انتهاء الأدوار.

للاحتفاظ بحدود زمن الوصول الصارمة في الوقت الفعلي، يقبل مسار الترجمة إدخال الصوت فقط. إدخال النص غير مدعوم في وضع الترجمة. يسقط النموذج أيضًا استخدام الأداة وتعليمات النظام في هذا الوضع. وهذا يبقيه بمثابة خط أنابيب مترجم مركز بدلاً من وكيل عام.

البناء باستخدام Live API

يقوم المطورون بتكوين الترجمة داخل إعداد جلسة Live API. قمت بتعيين أ translationConfig كتلة داخل generationConfig. ال targetLanguageCode يأخذ الحقل رمز BCP-47، مثل "pl" أو "es". BCP-47 هو التنسيق القياسي لعلامات اللغة مثل en أو pt-BR. انها افتراضية ل "en". ال echoTargetLanguage تتحكم القيمة المنطقية في المدخلات الموجودة بالفعل في اللغة الهدف. متى true، يردد النموذج هذا الخطاب. متى false، يظل صامتًا. يمكنك أيضًا تمكين inputAudioTranscription و outputAudioTranscription للنصوص النصية.

تم إصلاح صيغ الصوت. الإدخال هو PCM خام 16 بت عند 16 كيلو هرتز، أحادي، قليل النهاية. الإخراج هو PCM خام 16 بت عند 24 كيلو هرتز، أحادي، قليل النهاية. PCM هو صوت خام غير مضغوط. يمكنك إرسال الصوت في أجزاء من 100 مللي ثانية. بالنسبة للتطبيقات من جانب العميل، توجد رموز سريعة الزوال على v1alpha تتجنب نقطة النهاية الكشف عن مفتاح واجهة برمجة التطبيقات (API) الخاص بك.

البعد الوكيل الحي الترجمة المباشرة
دور نموذجي المساعد الذي يستمع، والأسباب، والأفعال مترجم فوري / خط أنابيب المترجم في الوقت الحقيقي
تفاعل قائم على الدوران، مع معالجة الانقطاع معالجة تيار مستمر، بدون دوران
أدوات استدعاء الوظائف، بحث جوجل، التعليمات الترجمة فقط، لا توجد أدوات أو تعليمات
المدخلات النص والصوت والفيديو والصورة الصوت فقط، لوقت الاستجابة الصارم
إعدادات الجيل، الكلام، الأدوات، التعليمات targetLanguageCode و echoTargetLanguage

حالة الاستخدام

يستهدف النموذج الترجمة الفورية المباشرة عبر عدة إعدادات. يسرد Google المكالمات والاجتماعات والدروس وعمليات البث متعددة اللغات. تعمل منصات المطورين على تقليل عمل التكامل للوسائط في الوقت الفعلي. يستخدم كل من Agora وFishjam وLiveKit وPipcat وVision Agents بالفعل واجهة برمجة التطبيقات Live API. تتعامل هذه المنصات مع البنية التحتية المعقدة لتدفق الوسائط في الوقت الفعلي. يتيح ذلك للمطورين التركيز على تجربة المستخدم بدلاً من ذلك.

يوضح مثال تطبيق Google الدبلجة والترجمة الفورية متعددة اللغات. تقوم شركة Grab باختبار نموذج التواصل بين السائق والمسافر عند الشاحنات الصغيرة. يقوم مستخدمو Grab بإجراء أكثر من 10 ملايين مكالمة صوتية شهريًا. أبلغت CJ ENM وLiveKit وآخرون عن تعليقات إيجابية حول الجودة والدقة وزمن الوصول المنخفض.

كيف يغير Google Meet والترجمة

وفقًا للإصدار الرسمي من Google، سيستخدم Google Meet قريبًا الإصدار 3.5 من الترجمة المباشرة لترجمة الكلام. يعرض الجدول ما تم ذكره قبل وبعد تطبيق Meet.

القدرة اللقاء السابق مع 3.5 ترجمة حية
اللغات 5 70+
مجموعات لكل اجتماع فقط من وإلى اللغة الإنجليزية 2000+ مجموعات
وصول الواجهة الموجودة واجهة محدثة للوصول الفوري

يتوفر تحديث Meet في معاينة خاصة لعملاء Workspace للأعمال هذا الشهر. سيتم طرحه على نطاق أوسع في وقت لاحق من هذا العام. في تطبيق الترجمة، تعمل ميزة الترجمة المباشرة مع أي سماعات رأس متصلة. إنه يعكس نغمة المتحدث عبر أكثر من 70 لغة. يكتسب Android أيضًا وضع الاستماع. تضع الهاتف على أذنك مثل مكالمة عادية. يتم بعد ذلك تدفق الصوت المترجم عبر سماعة الأذن، دون أن يسمعه الآخرون.

الوجبات السريعة الرئيسية

  • Gemini 3.5 Live Translate هو أحدث نموذج صوتي من Google للترجمة المباشرة من الكلام إلى كلام عبر أكثر من 70 لغة.
  • فهو يتدفق بشكل مستمر بدلاً من خطوة بخطوة، ويبقى بضع ثوانٍ خلف مكبر الصوت.
  • يمكن للمطورين تكوينه عبر Live API باستخدام targetLanguageCode و echoTargetLanguage; صوت فقط، 16 كيلو هرتز للداخل، 24 كيلو هرتز للخارج.
  • يتم طرحه في Gemini Live API وGoogle Meet (5 → 70+ لغة) وتطبيق الترجمة.
  • يحمل كل الصوت الذي تم إنشاؤه علامة مائية SynthID غير محسوسة لسهولة الاكتشاف.

تحقق من البطاقة النموذجية و التفاصيل الفنية. أيضا، لا تتردد في متابعتنا على تغريد ولا تنسى الانضمام إلينا 150 ألف+ مل من SubReddit والاشتراك في النشرة الإخبارية لدينا. انتظر! هل أنت على برقية؟ الآن يمكنك الانضمام إلينا على التليجرام أيضًا.

هل تحتاج إلى الشراكة معنا للترويج لصفحة GitHub Repo أو صفحة الوجه المعانقة أو إصدار المنتج أو الندوة عبر الويب وما إلى ذلك؟ تواصل معنا



اكتشاف المزيد من كحيل | أخبار التقنية

اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.

شاركها.
اترك تعليقاً

اكتشاف المزيد من كحيل | أخبار التقنية

اشترك الآن للاستمرار في القراءة والحصول على حق الوصول إلى الأرشيف الكامل.

متابعة القراءة