أصدرت OpenAI نموذجين جديدين للوقت الفعلي في واجهة برمجة التطبيقات (API) الخاصة بها. تم تسميتهم gpt-realtime-2.1 و gpt-realtime-2.1-mini. كلاهما يستهدف تجارب صوتية ومتعددة الوسائط ذات زمن وصول منخفض. النموذج المصغر هو الجزء البارز في هذا الإصدار. إنه نموذج تفكير صغير للصوت في الوقت الفعلي. يتم شحنه بنفس تكلفة الإصدار السابق gpt-realtime-mini. قامت OpenAI أيضًا بتقليل زمن الوصول p95 بنسبة 25% على الأقل عبر النماذج الصوتية في الوقت الفعلي. يأتي هذا التخفيض من التخزين المؤقت المحسن.

ما هو GPT-Realtime-2.1-mini

gpt-realtime-2.1-mini هو نموذج تفكير مصغر للتفاعلات الصوتية في الوقت الفعلي. يستجيب لمدخلات الصوت والنص عبر اتصال مباشر. يضعه OpenAI على أنه الخيار الأسرع والأكثر فعالية من حيث التكلفة في التشكيلة.

تقوم Realtime API بمعالجة الصوت وإنشاءه من خلال نموذج واحد. يؤدي هذا إلى تجنب تسلسل أنظمة تحويل الكلام إلى نص وتحويل النص إلى كلام منفصلة. يعمل هذا التصميم ذو النموذج الواحد على تقليل زمن الوصول ويحافظ على الفروق الدقيقة في الكلام.

التفكير هو القدرة الرئيسية هنا. وهذا يعني أن النموذج يمكنه التفكير داخليًا قبل أن يتحدث. تدعم الطبقة المصغرة أيضًا استخدام الأداة أو استدعاء الوظيفة من خلال Realtime API. تتيح هذه العناصر معًا للنموذج المصغر التخطيط لخطوة، واستدعاء وظيفتك، ثم الإجابة.

الأخ الأكبر هو gpt-realtime-2.1. يقوم بتحديث GPT-Realtime-2 مع تحسين التعرف على الحروف الأبجدية الرقمية. كما أنه يحسن الصمت والتعامل مع الضوضاء وسلوك المقاطعة. وهو يدعم ميزة تحويل الكلام إلى كلام من خلال جهد تفكير قابل للتكوين ومتابعة التعليمات واستخدام الأداة.

طريقة سريعة للاختيار بينهما: الاستخدام gpt-realtime-2.1 عندما تريد أقوى الاستدلال في الوقت الفعلي، واستخدام الأداة، واتباع التعليمات، وسلوك وكيل الصوت. يستخدم gpt-realtime-2.1-mini عندما تريد خيارًا أسرع وأكثر فعالية من حيث التكلفة.

غالبًا ما يتعطل وكلاء الصوت أثناء استدعاءات الأداة. يطلق النموذج استدعاء دالة، ثم يظل صامتًا. يفترض المستخدمون أن المكالمة قد تم إسقاطها ومقاطعتها. وهذا يخلق نتائج جزئية وحالة محادثة مشوشة.

يعمل المنطق والديباجة المنطوقة على إصلاح هذا النمط. يمكن للنموذج أن يقول “سوف أتحقق من هذا الطلب الآن” قبل التصرف. ويستمر في الحديث أثناء عمله من خلال الطلب. يحافظ هذا السلوك على تماسك المهام الصوتية متعددة الخطوات.

جهد التفكير قابل للتكوين عبر المستويات. يمكن للمطورين تحديد الحد الأدنى أو المنخفض أو المتوسط ​​أو العالي أو xhigh. المستوى المنخفض هو الإعداد الافتراضي ويحافظ على زمن الاستجابة منخفضًا للمنعطفات البسيطة. يؤدي الجهد العالي إلى زيادة زمن الوصول واستخدام الرمز المميز للإخراج. تنصح OpenAI بالبدء بمستوى منخفض لمعظم وكلاء الإنتاج الصوتي.

تحسين الكمون والتخزين المؤقت

زمن الاستجابة p95 هو وقت الاستجابة المئوي الخامس والتسعين. إنه يجسد الذيل البطيء الذي يشعر به المستخدمون بالفعل. قطع ما لا يقل عن 25٪ على هذا الذيل يساعد على بث الصوت الحي. يؤدي التخزين المؤقت المحسّن إلى دفع هذا التخفيض عبر نماذج الصوت في الوقت الفعلي.

يؤدي التخزين المؤقت أيضًا إلى خفض التكلفة، وليس زمن الوصول فقط. تتم محاسبة رموز الإدخال المخزنة مؤقتًا بخصم كبير. ل gpt-realtime-2.1-mini، ينخفض ​​إدخال الصوت المخزن مؤقتًا إلى 0.30 دولارًا لكل مليون. تبلغ تكلفة إدخال الصوت الجديد 10.00 دولارًا لكل مليون بالمقارنة. تستفيد الجلسات الطويلة أكثر من غيرها، لأن النظام يقوم بالتخزين المؤقت بعد المنعطف الأول.

التسعير والمقارنة

التسعير هو لكل مليون رمز، مقسمة حسب النص والصوت والصورة. يحتفظ المصغر بالمعدل المصغر السابق مع إضافة المنطق. ويبين الجدول أدناه الأرقام المنشورة.

القدرة / السعر (لكل مليون) gpt-realtime-2.1 gpt-realtime-2.1-mini gpt-realtime-mini (قبل)
المنطق نعم (جهد قابل للتكوين) نعم (نموذج الاستدلال المصغر) لا
استخدام الأداة/استدعاء الوظيفة نعم نعم نعم
إدخال النص 4.00 دولار 0.60 دولار 0.60 دولار
إدخال النص المخزن مؤقتًا 0.40 دولار 0.06 دولار 0.06 دولار
إخراج النص 24.00 دولارًا 2.40 دولار 2.40 دولار
إدخال الصوت 32.00 دولارًا 10.00 دولار 10.00 دولار
إدخال الصوت المخزن مؤقتا 0.40 دولار 0.30 دولار 0.30 دولار
إخراج الصوت 64.00 دولارًا 20.00 دولارًا 20.00 دولارًا
إدخال الصورة 5.00 دولار 0.80 دولار 0.80 دولار
إدخال الصورة المخزنة مؤقتًا 0.50 دولار 0.08 دولار 0.08 دولار

معدل إخراج الصوت المصغر هو 20.00 دولارًا لكل مليون. الكامل gpt-realtime-2.1 يتقاضى 64.00 دولارًا لنفسه. وهذا يمثل فجوة 3x تقريبًا في إخراج الصوت. يمكن للفرق استبدال بعض القدرات بتكلفة أقل مع الحفاظ على المنطق.

استخدام الحالات مع الأمثلة

  • فرز دعم العملاء: أبلغ المتصل عن خطأ في الفواتير عبر الهاتف. النموذج المصغر يفسر المشكلة بجهد منخفض. ويدعو أ lookup_account أداة، ثم أ check_invoice أداة. يروي كل خطوة حتى يبقى المتصل على اطلاع.
  • جدولة المواعيد: يطلب أحد المستخدمين نقل الحجز إلى يوم الثلاثاء القادم. يلتقط النموذج التاريخ الدقيق حرفًا بحرف. ويؤكد التفاصيل، ثم يدعو أ reschedule وظيفة. تمنع القيم المؤكدة استدعاءات الأداة على المدخلات التي تم تخمينها.
  • مساعد صوت داخل التطبيق: يقوم تطبيق الهاتف المحمول ببث صوت الميكروفون عبر WebRTC. يجيب النموذج المصغر على أسئلة المنتج في جملة أو جملتين قصيرتين. تتيح التكلفة المنخفضة تشغيل الميزة بمستوى صوت أعلى.
  • التقاط البيانات الميدانية: يطلب الفني من الوكيل تسجيل رقم القطعة. يساعد التعرف المحسّن على الحروف الأبجدية الرقمية على التقاط رموز مثل “8-3-5-7-1”. يقرأ النموذج القيمة مرة أخرى للتأكيد قبل التصرف.

الحد الأدنى من التنفيذ

يتصل عملاء المتصفح عبر WebRTC. يقوم الخادم الخاص بك بإصدار سر العميل قصير الأمد أولاً. يتصل المتصفح بعد ذلك مباشرةً بواجهة برمجة التطبيقات Realtime API. تستخدم خطوط أنابيب وسائط الخادم WebSockets، وتستخدم الاتصالات الهاتفية SIP.

أولاً، يقوم الخادم بإنشاء سر عميل سريع الزوال. احتفظ بمفتاح API القياسي الخاص بك على الخادم. يقوم تكوين الجلسة بتعيين النموذج وجهد التفكير المنخفض وأداة واحدة.

// Server: mint a short-lived client secret (API key stays server-side)
const r = await fetch("https://api.openai.com/v1/realtime/client_secrets", {
  method: "POST",
  headers: {
    Authorization: `Bearer ${process.env.OPENAI_API_KEY}`,
    "Content-Type": "application/json"
  },
  body: JSON.stringify({
    session: {
      type: "realtime",
      model: "gpt-realtime-2.1-mini",
      instructions: "You are a support agent. Reply in one or two short sentences.",
      reasoning: { effort: "low" },
      tools: [
        {
          type: "function",
          name: "lookup_account",
          description: "Look up a customer account by email.",
          parameters: {
            type: "object",
            properties: { email: { type: "string" } },
            required: ["email"]
          }
        }
      ],
      tool_choice: "auto"
    }
  })
});
const { value: EPHEMERAL_KEY } = await r.json(); // pass this to the browser

بعد ذلك، يفتح المتصفح اتصال نظير WebRTC. يضيف مسار الميكروفون وقناة بيانات للأحداث. ثم يقوم بعد ذلك بنشر عرض SDP الخاص به إلى نقطة نهاية المكالمات.

// Browser: connect to the Realtime API over WebRTC
// EPHEMERAL_KEY comes from your server endpoint above.
const pc = new RTCPeerConnection();

const audioEl = document.createElement("audio");
audioEl.autoplay = true;
pc.ontrack = (e) => { audioEl.srcObject = e.streams[0]; };

const mic = await navigator.mediaDevices.getUserMedia({ audio: true });
pc.addTrack(mic.getTracks()[0]);

const events = pc.createDataChannel("oai-events");
events.addEventListener("message", (e) => console.log(JSON.parse(e.data)));

const offer = await pc.createOffer();
await pc.setLocalDescription(offer);

const sdp = await fetch("https://api.openai.com/v1/realtime/calls", {
  method: "POST",
  body: offer.sdp,
  headers: {
    Authorization: `Bearer ${EPHEMERAL_KEY}`,
    "Content-Type": "application/sdp"
  }
});
await pc.setRemoteDescription({ type: "answer", sdp: await sdp.text() });

ابدأ في التفكير في جهد منخفض، ثم قم برفعه فقط للمهام الأصعب. أضف تعليمات قصيرة تفصل القواعد الصارمة عن القواعد الافتراضية. قم بإجراء عمليات التقييم قبل وبعد أي ترحيل للنموذج.

نقاط القوة والضعف

نقاط القوة:

  • يصل التفكير الآن إلى المستوى الصغير منخفض التكلفة.
  • التسعير يطابق السابق gpt-realtime-mini معدل.
  • انخفض زمن الوصول p95 بنسبة 25% على الأقل عبر نماذج الصوت في الوقت الفعلي.
  • تعمل جهود الاستدلال القابلة للتكوين على استبدال زمن الوصول بالعمق لكل مهمة.
  • يحافظ مسار الصوت أحادي النموذج على المحادثات طبيعية.

نقاط الضعف:

  • من الصعب تحويل تسعير الرمز الصوتي إلى تكلفة لكل مكالمة.
  • تعمل جهود الاستدلال الأعلى على رفع كل من رموز زمن الوصول والإخراج.
  • تعمل الجلسات الطويلة على إعادة إرسال السياق وزيادة تكلفة الإدخال دون تشذيب.
  • يتداول المستوى الصغير بعض القدرات مقابل المستوى الكامل gpt-realtime-2.1.

الشرح التفاعلي



تحقق من التفاصيل الفنية هنا. أيضا، لا تتردد في متابعتنا على تغريد ولا تنسى الانضمام إلينا 150 ألف + مل والاشتراك في النشرة الإخبارية لدينا. انتظر! هل أنت على برقية؟ الآن يمكنك الانضمام إلينا على التليجرام أيضًا.

هل تحتاج إلى الشراكة معنا للترويج لصفحة GitHub Repo أو صفحة الوجه المعانقة أو إصدار المنتج أو الندوة عبر الويب وما إلى ذلك؟ تواصل معنا


ميشال سوتر متخصص في علوم البيانات وحاصل على درجة الماجستير في علوم البيانات من جامعة بادوفا. بفضل أساس متين في التحليل الإحصائي والتعلم الآلي وهندسة البيانات، تتفوق ميشال في تحويل مجموعات البيانات المعقدة إلى رؤى قابلة للتنفيذ.


اكتشاف المزيد من كحيل | أخبار التقنية

اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.

شاركها.
اترك تعليقاً

اكتشاف المزيد من كحيل | أخبار التقنية

اشترك الآن للاستمرار في القراءة والحصول على حق الوصول إلى الأرشيف الكامل.

متابعة القراءة