اليوم، أصدرت Anthropic لعبة Claude Opus 5. وهي تحل محل Claude Opus 4.8 باعتبارها اللعبة الرائدة من فئة Opus. لم يتغير السعر عند 5 دولارات لكل مليون رمز إدخال و25 دولارًا لكل مليون رمز مخرج.

يصنف الفريق الأنثروبي Opus 5 على أنه يقترب من ذكاء Claude Fable 5 بنصف السعر. إنه الآن النموذج الافتراضي على كلود ماكس والنموذج الأقوى على كلود برو.

ما الذي تغير بالفعل على مستوى واجهة برمجة التطبيقات (API).

هناك ثلاثة تغييرات مهمة جدًا قبل أن يفعل أي معيار:

  1. التفكير قيد التشغيل بشكل افتراضي. في Opus 4.8، يتم تنفيذ الطلبات دون تفكير إلا إذا قمت بتعيينها thinking: {"type": "adaptive"}. في Opus 5، يتم التفكير في نفس الطلب، وتتحكم معلمة الجهد في العمق. لأن max_tokens التفكير الكبير بالإضافة إلى نص الاستجابة، القيم الموجودة تحتاج إلى مراجعة.
  2. هناك كسر التغيير. جلسة thinking: {"type": "disabled"} مع الجهد xhigh أو max يقوم الآن بإرجاع خطأ 400. يتم فرض القيد لكل طلب. يمكنك إما الحد من الجهد في high أو إسقاط thinking مجال.
  3. الأنثروبي يخبر المطورين بذلك حذف مطالبات التحقق الخاصة بهم. تؤدي الآن تعليمات مثل “تضمين خطوة التحقق النهائية” إلى المبالغة في التحقق، لأن النموذج يتحقق بالفعل من عمله. يغطي دليل المطالبة Opus 5 أنماط الضبط.

معرف النموذج هو claude-opus-5. السياق هو مليون رمز مميز افتراضيًا والحد الأقصى، بدون متغير أصغر. الحد الأقصى للإخراج هو 128 ألف رمز مميز على واجهة برمجة التطبيقات للرسائل المتزامنة. تصل واجهة برمجة تطبيقات دفعات الرسائل إلى 300 ألف مع output-300k-2026-03-24 رأس بيتا. ينخفض ​​​​الحد الأدنى للمطالبة القابلة للتخزين المؤقت إلى 512 رمزًا، بعد أن كان 1024.

الترميز والنتائج الوكيلة

في FrontierBench v0.1، وهو الإصدار التالي لـ Terminal-Bench 2.1، والذي يحتوي على 74 مهمة، سجل Opus 5 43.3% عند أقصى جهد. حصل Opus 4.8 على نسبة 18.7%. وصلت نسبة Fable 5 إلى 33.7%، بينما وصلت نسبة GPT-5.6 Sol إلى 37.5%. في xhigh مجهود Opus 5 يصل إلى 44.4% متوسط ​​المكافأة، وهي أفضل نتيجة لها.

تجدر الإشارة إلى إحدى التفاصيل من هذا السباق. تم وضع علامة على مصنفات الأمان الخاصة بـ Opus 5 ورفضت 5% من استدعاءات واجهة برمجة التطبيقات (API)، عبر 4% من التجارب. حددت مصنفات Fable 5 42% من المكالمات عبر 26% من التجارب.

حصل Opus 5 على 96.0% في SWE-bench Verified و79.2% في SWE-bench Pro. لا يزال Fable 5 يتفوق على Pro بنسبة 80.0%. في SWE-bench Multimodal، تكون القفزة أكبر، من 38.4% إلى 59.4%.

أرقام الوكلاء هي أوضح الانتصارات. وصلت Opus 5 إلى 70.57% في OSWorld 2.0 مقابل 55.7% لـ Opus 4.8. على Zapier AutomationBench، سجلت 26.0%، مقابل 17.0% لـ Opus 4.8 و17.4% لـ Fable 5. وفي الجهد المتوسط، لا تزال تسجل 24% بسعر 0.89 دولار لكل مهمة.

في التحليل الاصطناعي لـGDPval-AA v2، احتلت Opus 5 أعلى مركزين في قائمة المتصدرين في ELO 1861 و1827. xhigh يتفوق الإعداد على كل النماذج الأخرى مع استخدام رموز إخراج أقل بنسبة 25% من max.

الاستدلال ونتيجة ARC-AGI-3

دفعت Anthropic Opus 5 إلى حل جميع مشكلات IMO 2026 الستة بدون أدوات أو أداة مساعدة. قامت لجنة تحكيم مكونة من ثلاثة نماذج بتسجيل جميع الحلول الـ 24 التي تم إنشاؤها بشكل صحيح. قام الخبراء البشريون بشكل مستقل بتقييم حل محدد مسبقًا لكل مشكلة عند 7/7. النهائي 42/42 هو مستوى الميدالية الذهبية، فوق الحد 29/42.

أعلنت مؤسسة جائزة ARC عن نسبة 30.16% تم التحقق منها في ARC-AGI-3 بجهد عالٍ. وهذا ما يقرب من أربعة أضعاف أفضل نتيجة تم الإبلاغ عنها سابقًا في قائمة المتصدرين. وصلت نسبة GPT-5.6 Sol إلى 7.78% و Opus 4.8 إلى 1.52%. لم تكن نتائج Opus 5 بأقصى جهد متاحة عند الإصدار.

في الاختبار الأخير للإنسانية، حصلت Opus 5 على 56.3% بدون أدوات و64.7% باستخدامها.

يحمل قسم الوسائط المتعددة درسًا عمليًا. تستخدم الأداة الوكيلة مقاييس حساب وقت الاختبار بشكل أكثر فعالية من حيث التكلفة من التفكير التكيفي وحده.

في رسم الخرائط، سجلت Opus 5 29.6% بدون أدوات و83.0% باستخدام الحاوية وأداة قص الصور. في BenchCAD Vision2Code، ينتقل voxel IoU من 0.366 إلى 0.821. باستخدام الأدوات، يتفوق هذا على كلود ميثوس 5 عند 0.678 بفارق كبير.

وارتفعت القدرة السيبرانية، وتم تخفيف الإجراءات الوقائية في مكان واحد

لم تقم Anthropic بتدريب Opus 5 على مهام الأمن السيبراني. ارتفعت القدرة على أي حال، كنتيجة ثانوية لمكاسب القدرة العامة.

على ExploitBench، التقط Opus 5 10.14 إشارة قدرة متوسطة في ذراع AutoNudge. أنتجت 99 عملية استغلال كاملة لتنفيذ التعليمات البرمجية التعسفية. أنتجت Mythos 5 132 نقطة. في OSS-Fuzz، سجلت Opus 5 نقاطًا غير صفرية على 79.4% من الأهداف. وصلت نسبة Mythos 5 إلى 80% تقريبًا. لكن Opus 5 أكمل 4 مآثر كاملة مقابل 13 لـ Mythos 5.

وتحدد هذه الفجوة تصميم الضمانات. Opus 5 قوي تقريبًا مثل Mythos 5 العثور على نقاط الضعف، وتخلف إلى حد كبير في استغلال هم. لذلك تمكنت البشرية من اكتشاف الثغرات الأمنية في الكود المصدري. يظل الفحص الثنائي واختبار الاختراق وتوليد الثغرات محظورًا. من المتوقع أن يتدخل المصنفون بنسبة 85% أقل مما هو عليه في Fable 5. يمكن للمدافعين التقدم لبرنامج التحقق السيبراني.

اختبرت UK AISI نقاط التفتيش المبكرة على ثلاثة نطاقات إلكترونية بمعدل 100 مليون رمز لكل محاولة. قامت Opus 5 بحل مشكلة “The Last Ones” بشكل كامل في 8 من 10 محاولات. لم يحل نطاق “ممارسة الحياة” الأصعب. لقد وصلت إلى الخطوة 22 من 23، وهي أبعد من أي نموذج تم اختباره.

بموجب RSP، تتعامل Anthropic مع Opus 5 على أنها تتمتع بقدرات CB-1 ولكن ليس CB-2. إنه يطبق نفس إجراءات الحماية ASL-3 المستخدمة في Opus 4.8. لم يتم تجاوز عتبة البحث والتطوير في مجال الذكاء الاصطناعي.

الحقن الفوري هو رقم الأمان المتميز

في معيار الحقن الفوري غير المباشر لـ Gray Swan، انخفض نجاح المهاجم خلال 15 محاولة من 5.5% على Opus 4.8 إلى 2.0%. يقع Mythos 5 عند 2.6% وGPT-5.6 Sol عند 20.0%.

في بيئات المتصفح التي يتم تشغيلها من خلال Claude Cowork، انخفض نجاح الهجوم من 31.5% على Opus 4.8 إلى 3.70%. وهذا الرقم لا يخضع لأي ضمانات. ومع تمكين الوضع التلقائي، وصلت النسبة إلى 0% في جميع البيئات الـ 129.

الوجبات السريعة الرئيسية

  • يتم شحن Opus 5 بسعر 5 دولارًا أمريكيًا/25 دولارًا أمريكيًا دون تغيير مع نافذة سياق مكونة من 1 مليون رمز كافتراضي والحد الأقصى.
  • يتم الآن تشغيل التفكير بشكل افتراضي، ويتم تعطيله أعلاه high الجهد يرجع خطأ 400.
  • تقييمات الوكلاء هي أوضح المكاسب: OSWorld 2.0 بنسبة 70.57%، AutomationBench بنسبة 26.0%، ARC-AGI-3 بنسبة 30.16%.
  • تخفف الضمانات السيبرانية فقط من أجل اكتشاف ثغرات كود المصدر؛ تظل مسارات الاستغلال مسدودة.
  • تنشر Anthropic سلبياتها الخاصة، بما في ذلك هلوسة واقعية أعلى قليلاً من Opus 4.8.

مصادر: منشور إطلاق إنساني، وبطاقة نظام Claude Opus 5، وما الجديد في Claude Opus 5، وTechCrunch، والمراجعة المستقلة لـ CodeRabbit


آصف رزاق هو الرئيس التنفيذي لشركة Marktechpost Media Inc.. بصفته رجل أعمال ومهندسًا صاحب رؤية، يلتزم آصف بتسخير إمكانات الذكاء الاصطناعي لتحقيق الصالح الاجتماعي. وكان أحدث مساعيه هو إطلاق منصة وسائط الذكاء الاصطناعي، Marktechpost، والتي تتميز بتغطيتها المتعمقة لأخبار التعلم الآلي والتعلم العميق التي تتميز بأنها سليمة من الناحية التقنية وسهلة الفهم من قبل جمهور واسع. تتمتع المنصة بأكثر من 2 مليون مشاهدة شهريًا، مما يوضح شعبيتها بين الجماهير.


اكتشاف المزيد من كحيل | أخبار التقنية

اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.

شاركها.
اترك تعليقاً

اكتشاف المزيد من كحيل | أخبار التقنية

اشترك الآن للاستمرار في القراءة والحصول على حق الوصول إلى الأرشيف الكامل.

متابعة القراءة