يحتاج المطورون الذين يقومون ببناء وكلاء الإنتاج إلى كفاءة رمزية أعلى وزمن وصول أقل وأداء أكثر موثوقية. أصدرت Google اليوم ثلاثة نماذج جديدة من Gemini. التشكيلة هي Gemini 3.6 Flash وGemini 3.5 Flash-Lite وGemini 3.5 Flash Cyber. تقع الثلاثة جميعها في فئة Flash، والتي تقوم Google بضبطها من أجل السرعة والتكلفة والعمل الوكيل كبير الحجم بدلاً من الحد الأقصى لعمق التفكير.

Gemini 3.6 Flash: جودة أفضل ورموز أقل وسعر أقل

Gemini 3.6 Flash هو العمود الفقري الافتراضي الجديد. إنه يعتمد على 3.5 Flash ويستهدف الترميز والعمل المعرفي والمهام متعددة الوسائط. النقطة الرئيسية هي الكفاءة. في مؤشر التحليل الاصطناعي، يستخدم 3.6 Flash رموز إخراج أقل بنسبة 17% من 3.5 Flash. وفقًا لمعيار DeepSWE من Datacurve، أبلغت Google عن انخفاض يصل إلى 65%. يأخذ النموذج أيضًا خطوات تفكير واستدعاءات أقل للأدوات لكل سير عمل متعدد الخطوات.

يتحرك التسعير إلى الأسفل جنبًا إلى جنب مع الكفاءة. يبلغ سعر Gemini 3.6 Flash 1.50 دولارًا أمريكيًا لكل مليون رمز إدخال و7.50 دولارًا أمريكيًا لكل مليون رمز إخراج. ينخفض ​​​​معدل الإخراج من 9.00 دولارات سابقة على 3.5 فلاش. يقلل الإسهاب المنخفض وسعر المخرجات المنخفض من التكلفة الإجمالية لكل مهمة وكيل.

مكاسب الجودة تصاحب مكاسب الكفاءة. في DeepSWE، سجل 3.6 Flash 49% مقابل 37% لـ 3.5 Flash. على MLE Bench تصل إلى 63.9% مقابل 49.7%. في OSWorld-Verified، يصل إلى 83.0% مقابل 78.4%. في معيار الناتج المحلي الإجمالي (GDVval-AA v2)، وهو معيار العمل المعرفي، حصل على 1421 مقابل 1349. أصبح استخدام الكمبيوتر الآن أداة مدمجة من جانب العميل من خلال Gemini API وGemini Enterprise. يستشهد العملاء الأوائل بما في ذلك Hebbia وHarvey بالمكاسب التي تحققت في تحليل المستندات، وتحليل المخططات والبيانات، وصياغة التقارير.

تقوم Google بشحن الإصدار 3.6 Flash مع ضمانات السلامة الحدودية المحسنة. وهي تغطي إساءة استخدام المواد الكيميائية والبيولوجية والإشعاعية والنووية (CBRN) والجرائم السيبرانية. التفاصيل الكاملة موجودة في بطاقة طراز Flash 3.6.

يتيح لك الشرح التفاعلي أدناه مقارنة كل نموذج بسابقه وتقدير تكلفة الرمز المميز حسب الحجم الخاص بك.


Gemini 3.5 Flash-Lite: أسرع طراز في خط 3.5

تم تمييز Gemini 3.5 Flash-Lite للمهام ذات زمن الوصول المنخفض والإنتاجية العالية. تتضمن حالات الاستخدام المستهدفة البحث الوكيل ومعالجة المستندات. وفقًا لقياسات التحليل الاصطناعي، فإنه يعمل بمعدل 350 رمزًا مميزًا للإخراج في الثانية. السعر هو 0.30 دولارًا أمريكيًا لكل مليون رمز إدخال و2.50 دولارًا أمريكيًا لكل مليون رمز إخراج.

يقوم النموذج بمسح الإصدار 3.1 Flash-Lite السابق بهوامش واسعة. في Terminal-Bench 2.1، حصل على 54% مقابل 31%. وفي GDM-MRCR v2، وهو معيار مرجعي طويل السياق، يصل إلى 72.2% مقابل 60.1%. في الناتج المحلي الإجمالي (GDVal-AA v2)، حصل على 1140 مقابل 642. والجدير بالذكر أن Flash-Lite يتفوق أيضًا على 3 Flash الأقدم في بعض التقييمات. إنه يتقدم على SWE-Bench Pro بنسبة 54.2% مقابل 49.6% وعلى OSWorld-Verified بنسبة 74.0% مقابل 65.1%.

يعرض Flash-Lite مستويات التفكير القابلة للتكوين: الحد الأدنى والمنخفض والأعلى. يمكن للمطورين إعطاء الأولوية للتنفيذ منخفض التكلفة وزمن الوصول المنخفض للمهام كبيرة الحجم. ويمكنهم أيضًا المشاركة في مستويات تفكير أعلى لأعباء عمل الوكلاء الفرعيين متعددة الخطوات. يعد استخدام الكمبيوتر أداة مدمجة هنا أيضًا.

Gemini 3.5 Flash Cyber ​​في CodeMender: وكلاء رخيصون يبحثون عن الأخطاء ويصلحونها

Gemini 3.5 Flash Cyber ​​هو الإصدار الأكثر تخصصًا. إنه مبني على 3.5 Flash ويتم ضبطه بدقة للعثور على نقاط الضعف في البرامج والتحقق من صحتها وتصحيحها. فرضية التصميم هي مشكلة مساحة البحث. إن العثور على عيوب عميقة يعني استكشاف مساحة بحث هائلة عن التنفيذ. استدعاء واحد لنموذج واحد ضخم يصبح عنق الزجاجة.

الجواب هو نموذج رخيص تم استدعاؤه عدة مرات. داخل CodeMender، وكيل أمان التعليمات البرمجية من Google، يعمل العديد من عملاء Flash Cyber ​​3.5 بالتوازي. يستدعي CodeMender النموذج حتى خمس مرات، ثم يدمج نتائج الوكيل الفرعي في تقرير واحد. وفقًا لمعيار CyberGym، يصل هذا الإعداد إلى أداء تنافسي مقارنة بالنماذج الأكبر حجمًا.

التقييمات الداخلية ملفتة للنظر. في تقييم Google Big Sleep، تجاوز Flash Cyber ​​الخط الرئيسي 3.5 Flash و3.6 Flash بشكل ملحوظ. في محرك JavaScript V8، تم العثور على 55 مشكلة فريدة مؤكدة عند عدد ثابت من الاستدعاءات. هذا بالمقارنة مع 47 للخط الرئيسي 3.5 Flash و 36 لـ Claude Opus 4.6. لقد اشتعلت 10 مشكلات غاب عنها النموذجان الآخران. وفي أحد الاختبارات الواقعية، استخدمه فريق أبحاث الثغرات السحابية في Google للعثور على عيوب تنفيذ التعليمات البرمجية عن بعد في واجهات برمجة التطبيقات العامة في غضون ساعتين.

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/

انقسام رد الفعل على طول خطوط يمكن التنبؤ بها. رحب بناة السعر والكفاءة. أثار الرائد المتأخر أكبر انتقادات. في Hacker News، جادل البعض بأن Google تبالغ في بيع السعة التي لا يمكنها توفيرها بشكل موثوق، مشيرين إلى جلسات البرمجة العملية المحبطة. فتح إصدار Flash Cyber ​​المسور نقاشًا مزدوج الاستخدام حول من يجب أن يمتلك أدوات آلية لاكتشاف الثغرات.

تقوم لوحة المعلومات أدناه بتجميع تلك المناقشة حسب النظام الأساسي. إنه تجميع تحريري نوعي، وليس مجموعة بيانات مسروقة، وقد تم تضمين مذكرة الطريقة.