أصدرت Microsoft AI نموذج MAI-Cyber-1-Flash، وهو أول نموذج مصمم خصيصًا للدفاع السيبراني. لا يتم شحن النموذج كنقطة نهاية مستقلة. إنه يعمل في الداخل مداش، أداة المسح الوكيل متعددة النماذج من Microsoft.
MAI-Cyber-1-Flash عبارة عن محول ذو اهتمام ذاتي وطبقات متفرقة من مزيج الخبراء. يحمل إجمالي 137B معلمات مع 5B نشط، و أ طول السياق 256 كيلو بايت. المدخلات والمخرجات هي نص فقط.
إنه عبارة عن ضبط دقيق متخصص في الأمن السيبراني لـ MAI-Code-1-Flash، وهو نموذج ترميز وكيل خفيف الوزن مضمن بالفعل في GitHub Copilot وVS Code. يصفه الإصدار بأنه مشتق من سلالة MAI-Thinking-1.
المعايير
CyberGym عبارة عن مجموعة عامة تضم 1507 مهمة لإعادة إنتاج الثغرات الأمنية في العالم الحقيقي مستمدة من 188 مشروعًا لـ OSS-Fuzz. تم تقييم Microsoft بتكوين المستوى الأول الافتراضي لـ CyberGym، والذي يوفر مصدرًا ضعيفًا ووصفًا عالي المستوى.
يقوم MDASH بتشغيل MAI-Cyber-1-Flash جنبًا إلى جنب مع نتائج GPT-5.4 95.95%. تقوم Microsoft بتأطير هذا على أنه أعلى بنحو 12 نقطة من Anthropic’s Mythos، ويضع مخطط الإطلاق الأنظمة الأربعة المتنافسة بين 83.2% و85.6%.
عندما قامت Microsoft بتفصيل MDASH لأول مرة في مايو 2026، سجل الحزام نقاطًا 88.45% على CyberGym باستخدام النماذج المتاحة بشكل عام فقط. لقد كانت هذه بالفعل أعلى نتيجة عامة في قائمة المتصدرين، بفارق خمس نقاط تقريبًا عن الإدخال التالي بنسبة 83.1%. يذكر فريق البحث التحسن بوضوح: حيث أدى استبدال 80% من النماذج الموجودة في MDASH إلى نقل الحزام من 88.4% إلى 95.95%.
لماذا التوجيه هو المنتج الحقيقي
يدير MDASH أكثر من 100 وكيل متخصص من خلال خمس مراحل: الإعداد والمسح والتحقق وإزالة التكرار والإثبات. يقوم وكلاء المدققون بوضع علامة على النتائج، ويناقش وكلاء المناظرة قابلية الاستغلال (باستخدام الخلاف كإشارة)، وتنفذ مرحلة الإثبات إطلاق المدخلات باستخدام ASan لأهداف C/C++.
للتحكم في تكاليف النماذج الحدودية على نطاق واسع، يتعامل MAI-Cyber-1-Flash ما يصل إلى 90% من مهام MDASH، وتصاعد أصعب 10% إلى GPT-5.4. ينتج عن هذا التوجيه أ توفير التكاليف بنسبة 50% على التكوين السابق لـ GPT-5.4، و5.4 mini، و5.3 codex.
تم تطوير MDASH بواسطة Microsoft أمان الكود المستقل (ACS) فريق يضم أعضاء من فريق أتلانتا الحائز على تحدي DARPA AI Cyber Challenge. في شهر مايو، تم إنشاء العمل بمساعدة MDASH 16 تحديًا مشتركًا (بما في ذلك أربعة عيوب خطيرة في تنفيذ التعليمات البرمجية عن بعد) في شبكة Windows ومكدس المصادقة. بأثر رجعي، تعافى 96٪ من 28 حالة MSRC في clfs.sys و 100% من 7 حالات tcpip.sys على مدى خمس سنوات.
أداء
يقدم فريق البحث نتائج مستقلة من حزام طرفي خفيف الوزن:
| المعيار | ماي-سايبر-1-فلاش |
|---|---|
| CVEBench | 0.314 |
| CyberSecEval4 — تهديد إنتل | 0.553 |
| CyberSecEval4 — تحليل البرامج الضارة | 0.33 |
| CRSBench | 0.651 (بوف = 1200) |
| ExploitGym — Kernel / مساحة المستخدم / المتصفح | 0 / 0 / 0 |
الأصفار المستقيمة في ExploitGym متعمدة وليست عيبًا. يشير فريق Microsoft إلى أن النموذج قد تم تدريبه على أداء مهام دفاعية مثل تصحيح الأخطاء، وليس مهام هجومية مثل نشر البرامج الضارة. نموذج 5B النشط الذي لا يمكنه توليد برمجيات استغلال الثغرات ولكن يمكنه توجيه مسار اكتشاف بنسبة 95.95% هو بالضبط الأداة التي يحتاجها منتج المدافع فقط.
كيفية استخدامه
الوجبات السريعة الرئيسية
- MAI-Cyber-1-Flash هو إجمالي 137 بايت / 5 بايت نشط، ضبط دقيق متناثر لوزارة التعليم لـ MAI-Code-1-Flash مع سياق 256 كيلو بايت.
- 95.95% على CyberGym هي نتيجة النظام – MDASH بالإضافة إلى النموذج الجديد بالإضافة إلى GPT-5.4، ارتفاعًا من 88.45% في مايو 2026.
- يتعامل مع ما يصل إلى 90% من مهام MDASH، مما أدى إلى تصعيد نسبة الـ 10% الصعبة إلى GPT-5.4 مقابل خفض التكلفة بنسبة 50%.
- درجات ExploitGym هي 0/0/0 حسب التصميم – يقوم النموذج بتصحيح الأخطاء، ولا يقوم بكتابة الثغرات.
- الوصول مسور
آصف رزاق هو الرئيس التنفيذي لشركة Marktechpost Media Inc.. بصفته رجل أعمال ومهندسًا صاحب رؤية، يلتزم آصف بتسخير إمكانات الذكاء الاصطناعي لتحقيق الصالح الاجتماعي. وكان أحدث مساعيه هو إطلاق منصة وسائط الذكاء الاصطناعي، Marktechpost، والتي تتميز بتغطيتها المتعمقة لأخبار التعلم الآلي والتعلم العميق التي تتميز بأنها سليمة من الناحية التقنية وسهلة الفهم من قبل جمهور واسع. تتمتع المنصة بأكثر من 2 مليون مشاهدة شهريًا، مما يوضح شعبيتها بين الجماهير.
اكتشاف المزيد من كحيل | أخبار التقنية
اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.
