تعد الترجمة الفورية إحدى أصعب المشكلات في الذكاء الاصطناعي التطبيقي. أنت تطلب من نموذج أن يترجم الكلام قبل أن ينهي المتحدث الجملة. كل ثانية إضافية من التأخير تحطم وهم التواصل في الوقت الحقيقي. لقد كان فريق Qwen التابع لـ Alibaba يتخلص من هذا الأمر مع كل إصدار. أحدث موديلاتهم، Qwen3.5-LiveTranslate-Flash، يجلب ذلك الكمون يصل إلى 2.8 ثانية ويوسع تغطية لغة الإدخال إلى 60 لغة.

https://qwen.ai/blog?id=qwen3.5-livetranslate

قفزة ذات مغزى من الإصدار السابق

يتعامل Qwen3-LiveTranslate-Flash مع 18 لغة إدخال في وقت استجابة يصل إلى ثلاث ثوانٍ تقريبًا. Qwen3.5-LiveTranslate-Flash يوصل ذلك إلى 2.8 ثانية، يوسع تغطية الإدخال إلى 60 لغة، ويضيف مخرجات الكلام بـ 29 لغة. وهذا أكثر من 3x توسيع في تغطية اللغة على جانب الإدخال. بالنسبة للمطورين الذين يقومون ببناء منتجات متعددة اللغات، فإن هذا يقلل من الحاجة إلى تبديل النماذج لكل لغة في معظم سيناريوهات المؤسسات العالمية.

يأتي تحسين زمن الوصول من تقنية معالجة ما يسميه الفريق “وحدات القراءة”. بدلاً من انتظار وصول جملة كاملة قبل إنتاج المخرجات، يقرر النموذج متى يتراكم معنى كافٍ في مقطع ما للالتزام بالترجمة. يقوم ببث الإخراج بشكل مستمر بينما لا يزال مكبر الصوت يتحدث. هذا هو نفس المنطق الأساسي للتنبؤ بالوحدة الدلالية ولكن مع تنفيذ أكثر إحكامًا يختصر 200 مللي ثانية إضافية.

أصبحت الرؤية الآن مدخلاً من الدرجة الأولى

تتعامل معظم أنظمة الترجمة مع الصوت باعتباره إشارة الإدخال الوحيدة. يعمل هذا بشكل جيد في ظروف الاستوديو النظيفة. إنه يتعطل في قاعة اجتماعات مزدحمة، أو في قاعة تجارية صاخبة، أو في أي مكان به أصوات متداخلة وصوتيات سيئة.

يتبع Qwen3.5-LiveTranslate-Flash نهجًا مختلفًا. فهو يقوم بتحليل المعلومات المرئية بالتوازي مع النص الصوتي الذي يظهر على الشاشة، والأشياء المعروضة فعليًا، وحركات الشفاه، والإيماءات. عندما تكون الكلمة غامضة صوتيًا أو يتدهور تدفق الصوت، فإن السياق المرئي يملأ الفجوة ويزيد من دقة قرار الترجمة. هذه ليست ميزة ثانوية. في النشر على أرض الواقع، نادرًا ما يتم ضمان جودة الصوت. إن وجود قناة رؤية يعني أن النموذج يتعامل مع الواقع الفوضوي للترجمة الفورية المباشرة بشكل أكثر رشاقة من الأنظمة الصوتية فقط.

يحدث استنساخ الصوت في الوقت الحقيقي

هذا هو الجزء الذي يبرز أكثر في إصدار Qwen3.5. تستبدل أنظمة الترجمة القياسية صوت المتحدث بصوت تركيبي عام. يقوم Qwen3.5-LiveTranslate-Flash بدلاً من ذلك باستنساخ ميزات الصوت المميزة للمتحدث الأصلي أثناء الترجمة نفسها. جملة منطوقة واحدة كافية للنموذج لإجراء هذا التكيف الصوتي.

بالنسبة للمستمعين على الطرف المتلقي، يبدو الناتج المترجم وكأنه نفس الشخص الذي يتحدث اللغة المستهدفة وليس بديلاً آليًا. يعد هذا أمرًا مهمًا في الترجمة الفورية للمؤتمرات المباشرة أو البث المباشر متعدد اللغات أو مكالمات العملاء الدولية. تبدو التجربة أكثر إنسانية بشكل ملحوظ مما تقدمه الأنظمة الحالية.

تكوين الكلمات الرئيسية الخاصة بالمجال

أحد أوضاع الفشل المستمر لنماذج الترجمة في الإعدادات المهنية هو أسماء العلم والمفردات المتخصصة. إن النموذج الذي يترجم ملخصًا طبيًا قد يخطئ باستمرار في ترجمة اسم الدواء. تنقسم جلسة التفسير القانوني إلى فترة قانونية فنية.

يعالج Qwen3.5-LiveTranslate-Flash هذه المشكلة من خلال تكوين الكلمات الرئيسية الديناميكية في وقت التشغيل. يمكن للمطورين إدخال مسرد لأسماء العلامات التجارية، أو المصطلحات الطبية، أو المصطلحات القانونية، أو المفردات التقنية، ويتعامل النموذج مع هذه المصطلحات بشكل أكثر موثوقية. لا يتوفر هذا في معظم واجهات برمجة التطبيقات للترجمة ذات الأغراض العامة، كما أنه يسد فجوة حقيقية لعمليات النشر المؤسسية الخاصة بالمجال.

الأداء المعياري

في FLEURS وCoVoST2 – وهما معياران أساسيان لترجمة الكلام متعدد اللغات – يتفوق Qwen3.5-LiveTranslate-Flash على البدائل التجارية الرئيسية. تختبر FLEURS جودة الترجمة عبر مجموعة واسعة من الأزواج اللغوية في ظل ظروف صوتية حقيقية. يغطي CoVoST2 21 اتجاه ترجمة من الكلام، مما يجعله وكيلًا عمليًا لأداء خطوط الأنابيب متعددة اللغات.

الشرح المرئي لـ Marktechpost







ماذا يفعل

Qwen3.5-LiveTranslate-Flash في لمحة

Qwen3.5-LiveTranslate-Flash هو نموذج ترجمة في الوقت الفعلي لواجهة برمجة التطبيقات (API) فقط، ذو الوزن المحدود من فريق Qwen التابع لشركة Alibaba. فهو يأخذ إطارات الصوت والفيديو كمدخلات ومخرجات متزامنة للنص والكلام المترجم. يستخدم النموذج بروتوكولًا يستند إلى WebSocket عبر Alibaba Cloud Model Studio.

كمون

2.8 ثانية

لكل رمز لإخراج الصوت

لغات الإدخال

60

الكلام + المدخلات البصرية

إخراج الكلام

29

اللغات بالصوت

بروتوكول

WebSocket

اتصال مستمر

  • الفهم المعزز للرؤية — حركات الشفاه، والإيماءات، والنص الذي يظهر على الشاشة، جميعها تؤثر في قرار الترجمة إلى جانب الصوت

  • استنساخ الصوت في الوقت الحقيقي – استنساخ الملف الصوتي للمتحدث الأصلي في الإخراج المترجم من جملة منطوقة واحدة

  • التنبؤ بالوحدة الدلالية — يلتزم بإخراج المقاطع قبل انتهاء الجملة الكاملة، مما يتيح التدفق المستمر دون انتظار الكلام الكامل

  • تكوين الكلمات الرئيسية الديناميكية — إدراج مسارد خاصة بالمجال في وقت التشغيل للمصطلحات الفنية أو الطبية أو القانونية

قبل أن تبدأ

المتطلبات الأساسية

أنت بحاجة إلى حساب Alibaba Cloud مع إمكانية الوصول إلى Model Studio ومفتاح DashScope API صالح. الموديل متوفر عبر qwen3-livetranslate-flash-realtime معرف النموذج

إنشاء حساب علي بابا كلاود

قم بالتسجيل في alibabacloud.com وقم بتنشيط Alibaba Cloud Model Studio في لوحة تحكم حسابك.

احصل على مفتاح DashScope API الخاص بك

انتقل إلى Model Studio → مفاتيح API. قم بإنشاء مفتاح وتخزينه كمتغير البيئة DASHSCOPE_API_KEY. لا تقم مطلقًا بترميزها في الملفات المصدر.

تثبيت تبعية بايثون

تثبيت websocket-client حزمة للاتصال WebSocket. لالتقاط الصوت، قم أيضًا بالتثبيت pyaudio.

تحقق من إعداد الصوت الخاص بك

يقبل الطراز صوتًا أحاديًا بمعدل 16 كيلو هرتز و16 بت PCM عند الإدخال. تأكد من إمكانية إخراج الميكروفون أو مصدر الصوت بهذا التنسيق قبل الاتصال.

سحق

# Install dependencies
pip install websocket-client pyaudio

# Set your API key as an environment variable
export DASHSCOPE_API_KEY="your_key_here"

الخطوة 3 – الاتصال

قم بتأسيس اتصال WebSocket

يستخدم النموذج بروتوكول WebSocket للاتصال المستمر ثنائي الاتجاه. يمكنك المصادقة عبر رمز Bearer المميز في رأس الاتصال باستخدام مفتاح DashScope API الخاص بك.

بايثون

import json, websocket, os

API_KEY = os.getenv("DASHSCOPE_API_KEY")
API_URL = (
    "wss://dashscope-intl.aliyuncs.com"
    "/api-ws/v1/realtime"
    "?model=qwen3-livetranslate-flash-realtime"
)

def on_open(ws):
    print("Connected to Qwen3.5-LiveTranslate-Flash")

def on_message(ws, message):
    data = json.loads(message)
    print("Translation event:", data)

def on_error(ws, error):
    print("Error:", error)

ws = websocket.WebSocketApp(
    API_URL,
    header=["Authorization: Bearer " + API_KEY],
    on_open=on_open,
    on_message=on_message,
    on_error=on_error
)
ws.run_forever()

يبقى الاتصال مفتوحًا للجلسة الكاملة. لا يمكنك إعادة الاتصال لكل كلام. إرسال قطع الصوت وإطارات الصور بشكل مستمر عبر نفس المقبس.

الخطوة 4 – تدفق الصوت

تكوين ودفق إدخال الصوت

بعد الاتصال، أرسل حدث تكوين الجلسة لتعيين لغة المصدر واللغة المستهدفة. ثم قم ببث قطع صوت PCM بشكل مستمر. يستخدم النموذج session.input_audio_transcription.language لتحديد لغة الإدخال.

بايثون

import base64, pyaudio

# Audio input config: 16kHz, 16-bit PCM mono
INPUT_RATE    = 16000
INPUT_CHUNK   = 1600  # 100ms per chunk
INPUT_FORMAT  = pyaudio.paInt16
INPUT_CHANNELS = 1

def on_open(ws):
    # 1. Send session config first
    session_cfg = {
        "type": "session.update",
        "session": {
            "input_audio_transcription": {
                "language": "zh"  # source: Chinese
            },
            "translation": {
                "target_language": "en"  # target: English
            }
        }
    }
    ws.send(json.dumps(session_cfg))

    # 2. Stream microphone audio
    pa = pyaudio.PyAudio()
    stream = pa.open(
        rate=INPUT_RATE, channels=INPUT_CHANNELS,
        format=INPUT_FORMAT, input=True,
        frames_per_buffer=INPUT_CHUNK
    )
    while True:
        chunk = stream.read(INPUT_CHUNK)
        audio_b64 = base64.b64encode(chunk).decode()
        ws.send(json.dumps({
            "type": "input_audio_buffer.append",
            "audio": audio_b64
        }))

لا ترسل الصوت قبل session.update تم الاعتراف بالحدث. انتظر حدث تأكيد جلسة الخادم قبل دفق المقاطع الصوتية.

الخطوة 5 – إدخال الرؤية

أرسل إطارات الفيديو لتحسين الرؤية

يقرأ Qwen3.5-LiveTranslate-Flash حركات الشفاه والإيماءات والنص الذي يظهر على الشاشة من إطارات الفيديو إلى جانب الصوت. أرسل إطارات JPEG بتشفير base64 على فترات زمنية منتظمة أثناء الجلسة. حتى معدل الإطارات المنخفض يعمل على تحسين الدقة بشكل كبير في ظروف الصوت الصاخبة.

بايثون

import cv2, base64, threading, time

def stream_video_frames(ws):
    cap = cv2.VideoCapture(0)  # 0 = default camera
    while True:
        ret, frame = cap.read()
        if not ret:
            break
        # Encode frame as JPEG → base64
        _, buf = cv2.imencode(".jpg", frame)
        img_b64 = base64.b64encode(buf).decode()
        ws.send(json.dumps({
            "type": "input_image_buffer.append",
            "image": img_b64
        }))
        time.sleep(0.5)  # ~2fps is sufficient

# Run video streaming in a separate thread
threading.Thread(
    target=stream_video_frames,
    args=(ws,), daemon=True
).start()

يعد إدخال الرؤية اختياريًا ولكن يوصى به لسيناريوهات الكلام البشري المباشر. بالنسبة للملفات الصوتية المسجلة مسبقًا بدون تغذية الكاميرا، يمكنك حذف إطارات الصور تمامًا والاعتماد على الصوت وحده.

الخطوة 6 – دقة المجال

تكوين الكلمات الرئيسية الديناميكية

بالنسبة للمفردات التقنية أو الطبية أو القانونية أو الخاصة بالعلامة التجارية، يمكنك إدخال مسرد للكلمات الرئيسية عند بداية الجلسة. يستخدم النموذج هذه القائمة لتحسين موثوقية الترجمة بشكل ملحوظ للمصطلحات التي قد تتعامل معها بيانات التدريب القياسية بشكل غير متسق.

بايثون

# Add to your session.update payload
session_cfg = {
    "type": "session.update",
    "session": {
        "input_audio_transcription": {
            "language": "zh"
        },
        "translation": {
            "target_language": "en"
        },
        # Inject domain keywords here
        "keywords": [
            {"source": "达芬奇机器人",  "target": "da Vinci Surgical System"},
            {"source": "腹腔镜",      "target": "laparoscope"},
            {"source": "实体瘤",      "target": "solid tumor"}
        ]
    }
}
ws.send(json.dumps(session_cfg))

  • يعمل مع الأسماء التجارية وأسماء الأدوية والقوانين القانونية وأرقام النماذج الفنية
  • يتم تحديد نطاق الكلمات الأساسية للجلسة ولا تستمر عبر الاتصالات
  • حافظ على تركيز القائمة – فقط المصطلحات التي قد تؤدي الترجمة الخاطئة فيها إلى أخطاء حقيقية

مرجع

اللغات المدعومة

يفهم Qwen3.5-LiveTranslate-Flash 60 لغة إدخال ويمكنه إنتاج مخرجات الكلام بـ 29 لغة. الأقراص المميزة أدناه هي لغات إخراج الكلام المؤكدة. تمثل جميع الأقراص مدخلات مدعومة.

الصينية

إنجليزي

فرنسي

الألمانية

الأسبانية

اليابانية

كوري

الروسية

البرتغالية

ايطالي

عربي

الهندية

تركي

الاندونيسية

التايلاندية

الفيتنامية

اليونانية

الماندرين

الكانتونية

لهجة وو

السيشوانية

لهجة تيانجين

لهجة بكين

+ 37 آخرين

أكدت الأقراص المميزة دعم إخراج الكلام (الصوت). الحبوب العادية هي للإدخال فقط أو غير مؤكدة لإخراج الصوت. تحقق من زوج اللغة المستهدف المحدد في وثائق Alibaba Cloud Model Studio قبل إنشاء مسارات إخراج الصوت.

يدعم النموذج إخراج النص لجميع لغات الإدخال الستين. إخراج الكلام متاح لـ 29 لغة فقط. إذا كان المسار الخاص بك يتطلب تسليمًا صوتيًا ولم تكن لغتك المستهدفة موجودة في القائمة المؤكدة، فخطط لخطوة تحويل النص إلى كلام (TTS) الاحتياطية.

الوجبات السريعة الرئيسية

  • يوفر Qwen3.5-LiveTranslate-Flash ترجمة فورية متعددة الوسائط عبر 60 لغة إدخال و29 لغة لإخراج الكلام في زمن استجابة قدره 2.8 ثانية.
  • يستخدم النموذج الفهم المعزز للرؤية – قراءة حركات الشفاه والإيماءات والنص الذي يظهر على الشاشة – للحفاظ على الدقة في البيئات الصوتية الصاخبة أو المتدهورة.
  • يقوم استنساخ الصوت في الوقت الفعلي بتكرار الملف الصوتي للمتحدث الأصلي في الإخراج المترجم باستخدام جملة منطوقة واحدة فقط.
  • يتيح توقع الوحدة الدلالية عبر معالجة “وحدات القراءة” إخراج التدفق المستمر دون انتظار جمل كاملة، مما يقلل زمن الوصول إلى 2.8 ثانية.
  • يسمح التكوين الديناميكي للكلمات الرئيسية للمطورين بإدخال مسارد خاصة بالمجال في وقت التشغيل، مما يحسن موثوقية الترجمة للمصطلحات التقنية والطبية والقانونية.

تحقق من التفاصيل الفنية. أيضا، لا تتردد في متابعتنا على تغريد ولا تنسى الانضمام إلينا 150 ألف+ مل من SubReddit والاشتراك في النشرة الإخبارية لدينا. انتظر! هل أنت على برقية؟ الآن يمكنك الانضمام إلينا على التليجرام أيضًا.

هل تحتاج إلى الشراكة معنا للترويج لصفحة GitHub Repo أو صفحة الوجه المعانقة أو إصدار المنتج أو الندوة عبر الويب وما إلى ذلك؟ تواصل معنا



اكتشاف المزيد من كحيل | أخبار التقنية

اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.

شاركها.
اترك تعليقاً

اكتشاف المزيد من كحيل | أخبار التقنية

اشترك الآن للاستمرار في القراءة والحصول على حق الوصول إلى الأرشيف الكامل.

متابعة القراءة