أصدر مختبر حدود الذكاء الاصطناعي التابع لأبحاث Microsoft Fara1.5. إنها عائلة من نماذج وكيل استخدام الكمبيوتر (CUA) للمتصفح. يأتي الإصدار بثلاثة أحجام: Fara1.5-4B، وFara1.5-9B، وFara1.5-27B. تم دمج النماذج مع MagenticLite، وهي واجهة متصفح Microsoft المعزولة لهؤلاء الوكلاء.

وكلاء استخدام الكمبيوتر عبارة عن نماذج بكسل إلى إجراء تقود متصفحًا حقيقيًا. يقرأون لقطات الشاشة ويصدرون إجراءات الماوس ولوحة المفاتيح لإكمال المهام. تقع منتجات الوكلاء الحديثة مثل OpenAI’s Operator وGemini 2.5 Computer Use من Google ضمن هذه الفئة.

حقق Fara1.5-27B نجاحًا بنسبة 72% في المهمة على Online-Mind2Web. يغطي هذا المعيار 300 مهمة عبر 136 موقعًا شائعًا. في نفس التقييم، حصل مشغل OpenAI على 58.3% وGemini 2.5 لاستخدام الكمبيوتر على 57.3%. وصل اختبار Yutori’s Navigator n1 إلى 64.7%، وحصل Fara1.5-9B على 63.4%. وهذا يضاعف تقريبًا الطراز السابق Fara-7B، الذي سجل 34.1% على نفس المعيار.

https://www.microsoft.com/en-us/research/articles/fara1-5-computer-use-agent/

العمارة وحلقة الوكيل

تستخدم النماذج نقاط التفتيش الأساسية Qwen3.5 في متغيراتها 4B و9B و27B. إنهم يعملون من خلال حلقة المراقبة والتفكير والفعل. في كل خطوة، يأخذ النموذج سجل المحادثة السابقة ولقطات شاشة المتصفح الثلاث الأخيرة. ثم تنبعث منه أفكار وإجراء واحد تالٍ.

تشتمل مساحة الإجراء على مدخلات قياسية للماوس ولوحة المفاتيح وإجراءات خاصة بالويب مثل بحث الويب. كما أنه يعرض الإجراءات الفوقية لإدارة السياق. يتضمن ذلك حفظ الحقائق لاستخدامها لاحقًا وطرح أسئلة توضيحية على المستخدم. تتيح هذه الإجراءات الوصفية للوكيل العمل على آفاق أطول والعمل بشكل تعاوني مع المستخدمين.

مزيج التدريب

يستخدم التدريب الضبط الدقيق الخاضع للإشراف لما يقرب من مليوني عينة. يتكون المزيج من 60% من مسارات الويب و12.8% من البيئات الاصطناعية. يمثل ملء النماذج وتفاعلات المستخدم 12.5%. يساهم التأريض بنسبة 8.8% وVQA بنسبة 4.9%. تغطي الشرائح الأصغر سحب واجهة المستخدم الرسومية واتباع التعليمات والسلامة. يتم تطبيق الخسارة فقط على المنعطفات الثلاثة الأخيرة في كل مسار.

https://www.microsoft.com/en-us/research/articles/fara1-5-computer-use-agent/

FaraGen1.5: خط أنابيب البيانات الاصطناعية

FaraGen1.5 هو خط الأنابيب الاصطناعي الذي أنتج مسارات التدريب. وهو يتألف من ثلاثة مكونات نمطية: البيئات، ووحدات الحل، وأدوات التحقق.

تنقسم البيئات إلى نوعين. يتم تشغيل مهام الإنترنت المفتوح على مواقع الويب المباشرة التي لا تتطلب تسجيلات الدخول. تتطلب مهام النطاق المسور جلسات مصادق عليها أو اتخاذ إجراءات لا رجعة فيها، مثل إرسال بريد إلكتروني.

بالنسبة للنطاقات المسورة، قام الفريق ببناء ستة نسخ اصطناعية تسمى FaraEnvs. وهي تغطي البريد والتقويم والدفق وML والبقاء والمجدول. يحتوي كل استنساخ على واجهة أمامية واقعية، وواجهة برمجة التطبيقات (API) كاملة الوظائف، وقاعدة بيانات تحتوي على بيانات أولية قائمة على الشخصية.

تم إنشاء هذه البيئات باستخدام GitHub Copilot CLI بالإضافة إلى التحسين البشري التكراري. نظرًا لأن الفريق يتحكم في المجموعة الكاملة، فإنهم يعرفون النتيجة الصحيحة لكل مهمة. بالنسبة للمهام التي تؤدي إلى تغيير الواجهة الخلفية، يقوم أحد محكمي LLM بمقارنة لقطات قاعدة البيانات قبل التنفيذ وبعده. يتم تسجيل المهام التي لا تغير حالتها مقابل الإجابات المرجعية المحسوبة مسبقًا.

يستخدم وكيل الحل GPT-5.4 الخاص بـ OpenAI مع أدوات مخصصة تعكس مساحة عمل Fara1.5. حصل الحل على 83% على Online-Mind2Web باستخدام WebJudge الآلي. حصل حل Fara-7B السابق على 67% في نفس التقييم. يتم استدعاء محاكي المستخدم عندما يصدر الحل رسالة ask_user اتصل أو عند الانتهاء من المهمة.

بوابة ثلاثة محققين للمسارات التي تدخل في التدريب. يستخدم موقع Correctness نماذج التقييم التي تم إنشاؤها بواسطة LLM لمهام الإنترنت المفتوحة وقواعد البيانات المميزة للحكم على المهام الاصطناعية. الكفاءة تعاقب الإجراءات الزائدة أو غير الضرورية. يتحقق التحقق من تفاعل المستخدم مما إذا كان الوكيل قد توقف مؤقتًا عند النقاط الحرجة.

النقاط الحرجة والسلامة

تم تدريب Fara1.5 على التوقف وسؤال المستخدم في ثلاث مواقف. أولاً: تتطلب المهمة معلومات شخصية لم يقدمها المستخدم. ثانياً: أن يكون وصف المهمة غامضاً أو يفتقد التفاصيل اللازمة للتنفيذ. ثالثاً: وقوع إجراء لا رجعة فيه دون موافقة مسبقة.

يستخدم التدريب على السلامة مجموعات بيانات السلامة العامة والمهام الداخلية المتوافقة مع سياسة الذكاء الاصطناعي المسؤول من Microsoft. داخل MagenticLite، يتم تسجيل جميع إجراءات الوكيل وتكون قابلة للتدقيق. يعمل متصفح وضع الحماية أيضًا كحدود أمان بين الوكيل وجهاز المستخدم.

معايير أخرى

على WebVoyager، حصل Fara1.5-27B على 88.6%، و9B يصل إلى 86.6%، و4B يصل إلى 80.8%. يتفوق 9B أيضًا على أقرانه ذات الحجم المماثل مثل MolmoWeb 8B وGUI-Owl-1.5 8B وHolo2 8B. تستخدم جميع عمليات تقييم Fara1.5 Browserbase لتحقيق استقرار الجلسات وتقليل الحظر على مستوى الجلسة. يتم حساب متوسط ​​الأرقام على مدى ثلاثة أشواط مستقلة.

في الإصدار 1.5 من WebTailBench، الذي يستهدف مهام الويب طويلة المدى، حقق Fara1.5-9B نجاحًا في العملية بنسبة 64.5% ونجاحًا في النتائج بنسبة 32.3%. حصل GPT-5.4 على 79.6% من العمليات و57.4% من النتائج على نفس المعيار.

الوجبات السريعة الرئيسية

فيما يلي 5 نقاط أساسية في سطر واحد:

  • أصدرت Microsoft Research Fara1.5، وهي عائلة من وكلاء استخدام كمبيوتر المتصفح بأحجام 4B و9B و27B المبنية على Qwen3.5.
  • حصل Fara1.5-27B على 72% على Online-Mind2Web، متغلبًا على OpenAI Operator (58.3%)، وGemini 2.5 CU (57.3%)، وYutori Navigator n1 (64.7%).
  • يفتح خط أنابيب البيانات الاصطناعية FaraGen1.5 التدريب على المجالات المسورة عبر ستة نسخ تطبيقات وظيفية (FaraEnvs) تم إنشاؤها باستخدام GitHub Copilot CLI.
  • يتوقف Fara1.5 مؤقتًا لسؤال المستخدم عند النقاط الحرجة: معلومات مفقودة، أو مهام غامضة، أو إجراءات لا رجعة فيها دون موافقة.

تحقق من التفاصيل الفنية. أيضا، لا تتردد في متابعتنا على تغريد ولا تنسى الانضمام إلينا 150 ألف+ مل من SubReddit والاشتراك في النشرة الإخبارية لدينا. انتظر! هل أنت على برقية؟ الآن يمكنك الانضمام إلينا على التليجرام أيضًا.

هل تحتاج إلى الشراكة معنا للترويج لصفحة GitHub Repo أو صفحة الوجه المعانقة أو إصدار المنتج أو الندوة عبر الويب وما إلى ذلك؟ تواصل معنا



اكتشاف المزيد من كحيل | أخبار التقنية

اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.

شاركها.
اترك تعليقاً

اكتشاف المزيد من كحيل | أخبار التقنية

اشترك الآن للاستمرار في القراءة والحصول على حق الوصول إلى الأرشيف الكامل.

متابعة القراءة