أصدرت Sakana AI Fugu-Cyber (معرف النموذج هو fugu-cyber-v1.0)، وهي إضافة متخصصة في الأمن السيبراني إلى عائلة تنسيق Fugu. إنه ليس مجرد نموذج حدودي جديد. إنها نقطة النهاية الثالثة على مُنسق Fugu، تم ضبطها لأسباب أمنية. أطلق سكنا هذا المنسق قبل شهر.
سجلت Sakana معدل نجاح بلغ 86.9% في CyberGym و72.1% في CTI-REALM. ويصف هذه النتائج بأنها قابلة للمقارنة بالنماذج الحدودية التي تركز على الإنترنت مثل GPT-5.5-Cyber وClaude Mythos Preview.
ما يقيسه المعياران فعليًا
يقع التقييمان على طرفي نقيض من سير العمل الأمني:
- يعد CyberGym أحد معايير جامعة كاليفورنيا في بيركلي التي تضم 1507 نقاط ضعف في العالم الحقيقي عبر 188 مشروع OSS-Fuzz. في مهمته الرئيسية، يتلقى الوكيل وصفًا للثغرة الأمنية وقاعدة تعليمات برمجية غير مُصححة. يجب أن يكتب إثباتًا للمفهوم يعطل بنية ما قبل التصحيح ولكن ليس بناء ما بعد التصحيح. إن خطوة التحقق هذه هي ما يجعل من الصعب تطبيق المعيار.
- CTI-REALM هو معيار هندسة الكشف مفتوح المصدر من Microsoft. قامت Microsoft بتنظيم 37 تقريرًا عن التهديدات العامة من مصادر تشمل Datadog Security Labs وPalo Alto Networks وSplunk. يجب على الوكيل تعيين تقنيات MITRE ATT&CK، واستكشاف القياس عن بعد، والتكرار على استعلامات KQL، وإصدار قواعد Sigma التي تم التحقق من صحتها. يغطي تسجيل النقاط نقاط نهاية Linux وخدمة Azure Kubernetes وسحابة Azure.
يمتد الثنائي معًا إلى “العثور على الخطأ وإثباته” و”تحويل المعلومات إلى اكتشاف”. هذا الإطار هو الجزء الأكثر دفاعًا في إعلان سكنا.
حيث يجلس 86.9% مقابل الملعب
السياق يهم أكثر من العدد.
عندما نشر باحثو CyberGym نتائجهم الأولى، وصل أفضل اقتران بين الوكيل والنموذج إلى 20% تقريبًا. سجلت Anthropic نسبة 83.1% لـ Claude Mythos Preview ضمن مشروع Glasswing في أبريل 2026. سجلت OpenAI 85.6% لـ GPT-5.5-Cyber المحدث، مقابل 81.8% لـ GPT-5.5. وبالتالي فإن نسبة 86.9% التي حصلت عليها سكنا تمثل خطوة صغيرة تتجاوز الحدود المذكورة، وليست قفزة.
CTI-REALM قصة مختلفة. وضع تقييم Microsoft الخاص التكوينات الثلاثة الأولى، كلود، في نطاق من 0.624 إلى 0.685. سوف تقع نسبة 72.1٪ لشركة Fugu-Cyber فوق هذا النطاق. تحذير واحد مهم. يتم تسجيل CTI-REALM كمكافأة مسار تتراوح بين 0 و1. وهي ليست معدل نجاح/فشل. يسميها سكنا معدل النجاح على أي حال.
كيف يعمل التنسيق
Fugu هو في حد ذاته نموذج لغوي. يتم تدريبه على قراءة الاستعلام وبناء سقالة وكيلة بسرعة. ثم يقوم بعد ذلك بتفويض المهام الفرعية إلى النماذج المتخصصة في المجموعة.
تم توثيق هذا النهج في تقرير Fugu الفني وورقتي ICLR 2026، TRINITY وConductor. تقوم TRINITY بتعيين أدوار المفكر والعامل والمدقق عبر LLMs متعددة. يتعلم القائد استراتيجيات التنسيق باللغة الطبيعية من خلال التعلم المعزز.
بالنسبة للعمل الأمني، يرى فريق سكنا البحثي أن دور المدقق هو الهدف. يتم التحقق من صحة الثغرة الأمنية المرشحة التي كشف عنها وكيل واحد من قبل وكلاء فرعيين متخصصين في الأمان قبل اقتراح أي تصحيح. يظل التوجيه ملكية خاصة، لذا لا يمكنك معرفة النموذج الذي تعامل مع أي خطوة.
الوصول والسياسة والسعر
Fugu-Cyber مسور بأربعة أبعاد.
يتطلب الوصول نموذج طلب يوضح حالة الاستخدام المقصودة وتفاصيل الاتصال التي تم التحقق منها. يقوم فريق سكنا بمراجعة كل منها يدويًا. يتم شحن النموذج بموجب سياسة الاستخدام المقبول المحدثة التي تحظر إساءة الاستخدام الهجومية. يقتصر الفوترة على خطة الرمز المميز. تغطي مستويات الاشتراك 20 دولارًا و100 دولار و200 دولار Fugu وFugu-Ultra فقط. ولا يتم تقديم Fugu API في الاتحاد الأوروبي أو المنطقة الاقتصادية الأوروبية بينما تعمل Sakana على الامتثال للقانون العام لحماية البيانات.
تم تحديد السعر عند 6 دولارات لكل مليون رمز إدخال، و36 دولارًا للمخرجات، و0.60 دولارًا للمدخلات المخزنة مؤقتًا. جميع الأسعار الثلاثة تتضاعف فوق سياق 272 ألف رمز مميز. كل سطر هو بالضبط 1.2× معدل Fugu-Ultra، وهو علاوة ثابتة بنسبة 20% لنقطة النهاية السيبرانية. تعمل قاعدة التعليمات البرمجية الطويلة على تجاوز 272 كيلو بايت بسهولة، وبالتالي فإن الطبقة المضاعفة ليست حالة حافة.
الوجبات السريعة الرئيسية
- Fugu-Cyber هي نقطة نهاية للتنسيق، وليست نموذجًا حدوديًا جديدًا، تم إطلاقها في 21 يوليو 2026.
- سجلت Sakana نسبة 86.9% في CyberGym و72.1% في CTI-REALM، وكلاهما تم الإبلاغ عنه ذاتيًا وغير متكرر.
- تتفوق هذه النتائج على 85.6% لـ GPT-5.5-Cyber و83.1% لـ Claude Mythos Preview على CyberGym.
- الوصول مسور: موافقة يدوية، سياسة الاستخدام الآمن (AUP) للاستخدام الدفاعي، خطة الرمز المميز فقط، لا يوجد الاتحاد الأوروبي/المنطقة الاقتصادية الأوروبية، لا أوزان.
- موقف سكنا الخاص هو أن واجهة برمجة التطبيقات القادرة إلى جانب الخبرة في مجال الأمن البشري تتفوق على واجهة برمجة التطبيقات وحدها.
آصف رزاق هو الرئيس التنفيذي لشركة Marktechpost Media Inc.. بصفته رجل أعمال ومهندسًا صاحب رؤية، يلتزم آصف بتسخير إمكانات الذكاء الاصطناعي لتحقيق الصالح الاجتماعي. وكان أحدث مساعيه هو إطلاق منصة وسائط الذكاء الاصطناعي، Marktechpost، والتي تتميز بتغطيتها المتعمقة لأخبار التعلم الآلي والتعلم العميق التي تتميز بأنها سليمة من الناحية التقنية وسهلة الفهم من قبل جمهور واسع. تتمتع المنصة بأكثر من 2 مليون مشاهدة شهريًا، مما يوضح شعبيتها بين الجماهير.
اكتشاف المزيد من كحيل | أخبار التقنية
اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.
