الكاتب: كحيل

فريق Kimi التابع لـ Moonshot AI وkvcache-ai مفتوح المصدر الوكيلENV (AENV)، منصة موزعة لتشغيل بيئات الوكيل على نطاق واسع. يقوم AgentENV بتشغيل التدريب على التعلم المعزز (RL) لـ كيمي ك3، نموذج Moonshot’s Mixture of Experts الذي يبلغ 2.8 تريليون معلمة. يتم شحن الرمز تحت عنوان رخصة معهد ماساتشوستس للتكنولوجيا. لماذا تعيق البيئة Infra Agentic RL لا يقوم Agentic RL بأخذ عينة من النص فقط. يتطلب النموذج أن يعمل داخل جهاز كمبيوتر حقيقي. يحتاج كل إصدار إلى بيئة Linux معزولة تحتوي على نظام ملفات، ومكدس شبكة، وعمليات مباشرة. هذا الشرط يخلق مقايضة صعبة. تبدأ الحاويات بسرعة ولكنها تشترك في النواة المضيفة،…

قراءة المزيد

في هذا البرنامج التعليمي، قمنا ببناء سير عمل متقدم الخدمات المالية الأنثروبي المستودع وإعادة إنتاج بنيته القائمة على المهارات في لغة بايثون النقية. نبدأ بتثبيت المكتبات المطلوبة، واستنساخ المستودع، وتخطيط وكلائه برمجيًا، والمكونات الإضافية الرأسية، وعمليات تكامل الشركاء، وكتب الطبخ الخاصة بالوكيل المُدار، ومهارات التحليل المالي. نقوم بعد ذلك بتحليل ملفات SKILL.md الخاصة بالمستودع إلى سجل قابل للبحث وإنشاء SkillAgent قابل لإعادة الاستخدام والذي يقوم بإدخال قواعد اللعبة المالية المحددة في Anthropic messages API مع دعم حلقة استخدام الأدوات التكرارية لحسابات Python وإنشاء الملفات. باستخدام هذه البنية، نقوم بتنفيذ تقييم اصطناعي للتدفقات النقدية المخصومة، وإنشاء خريطة حرارة لمتوسط ​​تكلفة رأس…

قراءة المزيد

لقد صدرت الحيرة pplx، عميل سطر أوامر رسمي لواجهة برمجة تطبيقات البحث الخاصة به. تقوم الأداة بإرجاع نتائج البحث المؤرضة ونص الصفحة المستخرج، كل ذلك بتنسيق JSON. ووفقًا لمستنداته، فإنه يستهدف البشر ووكلاء البرمجة على حدٍ سواء. إنه ليس عميل دردشة. لا يوجد وضع محادثة، ولا يوجد اختيار للنموذج، ولا توجد إجابة مركبة. سطحان، عقد إخراج واحد تعرض الأداة سطحي عمل بالضبط. pplx search web يدير بحثًا مباشرًا على الويب. pplx content fetch يسحب عنوان URL ويعيد نص الصفحة المنظف. العقد من حولهم هو الجزء المثير للاهتمام. حسب المسؤول pplx-cli Agent Skill، النجاح يعني الخروج من الكود 0 وكائن JSON…

قراءة المزيد

تعالج العديد من شركات الروبوتات إحدى أصعب مشكلات الذكاء الاصطناعي: بناء نماذج أساسية قادرة على تنفيذ المهام التي لم يتم تدريبها بشكل صريح على التعامل معها. تشمل أساليبهم سلسلة كاملة، بدءًا من دراسة الملايين من مقاطع الفيديو على الويب وإجراء عمليات محاكاة حاسوبية وحتى جمع بيانات الحركة من البشر الذين يؤدون مهامًا وهم يرتدون قفازات باستخدام أجهزة استشعار مدمجة. إن إنجما، وهو مختبر أبحاث من المقرر أن يخرج من الخفاء يوم الاثنين، يتخذ نهجا مختلفا جذريا. بدلاً من التركيز فقط على قدرات النموذج، ترغب الشركة الناشئة التي لم يتجاوز عمرها عام واحد في دراسة كيفية تفاعل البشر مع الروبوتات على…

قراءة المزيد

Comic-Con International: لقد كانت سان دييغو دائمًا مقياسًا للمكان الذي تضع فيه صناعة الترفيه أكبر رهاناتها، وقد أوضحت تشكيلة هذا العام ذلك أكثر من أي وقت مضى. على مدار عطلة نهاية أسبوع واحدة، استخدمت كل من Marvel Studios وPrime Video وApple TV وAMC قاعة المؤتمر لكشف النقاب عن عروض الممثلين ولقطات النظرة الأولى لبعض مشاريعهم الأكثر مشاهدة عن كثب، والتي تشمل أفلام الأبطال الخارقين الرائجة والخيال العلمي المرموقة ورعب الشاشة الصغيرة على حد سواء.أصبحت الشائعات التي طال أمدها أخيرًا إعلانات رسمية، وحصلت الامتيازات التي مضى عليها عقود من الزمن على عملاء جدد وجداول زمنية جديدة، واحتشد المشجعون في اللوحات لإلقاء…

قراءة المزيد

أصدرت Black Forest Labs (BFL) FLUX 3، وهو نموذج أساسي متعدد الوسائط يتعلم من الصور ومقاطع الفيديو والصوت داخل بنية واحدة. وهو أيضًا أول نموذج FLUX يشحن الفيديو والصوت والتنبؤ بالحركة من مجموعة واحدة من الأوزان. يجادل فريق البحث في Black Forest Labs (BFL) بأنه لا توجد طريقة واحدة تعطي وصفًا كاملاً للعالم. تلتقط الصور البنية المكانية في لحظة واحدة. يستعيد الفيديو الوقت ويكشف عن الديناميكيات الجسدية. يكشف الصوت عن العلاقات السببية بين الأحداث الميكانيكية والصوت. يتم التعامل مع كل منها على أنها إسقاط خاسر لنفس الواقع الأساسي. والتدريب عليها جميعا في وقت واحد يعني أن الطرائق تقيد بعضها البعض.…

قراءة المزيد

قدم فريق KwaiKAT في Kuaishou KAT-Coder-V2.5. إنه نموذج ترميز تم تدريبه للعمل داخل مستودعات حقيقية قابلة للتنفيذ بدلاً من إصدار تعليمات برمجية أحادية المنعطف. النموذج المقدم متاح من خلال StreamLake. تم إصدار متغير الوزن المفتوح، KAT-Coder-V2.5-Dev، بشكل منفصل على Hugging Face ضمن Apache-2.0. AutoBuilder: البيئات التي تقوم بالفعل بتشغيل الاختبارات المقصودة يضع البحث مهمة يمكن التحقق منها على أنها ثلاثية. فهو يحتاج إلى وصف دقيق للمهمة، وبيئة مستودع قابلة للتنفيذ، ومجموعة من اختبارات التحقق من الصحة. التصحيح يكون صحيحًا فقط إذا اجتازهم جميعًا. يتم استخراج المهام من طلبات السحب والالتزامات الحقيقية، وفقًا لسلالة SWE-bench. يوفر تغيير التعليمات البرمجية المدمج تصحيحًا…

قراءة المزيد

يحتاج معظم الوكلاء الذين يتعلمون من الفيديو إلى معرفة الإجراء الذي أدى إلى كل إطار. تجادل شركة Induction Labs بأن هذا المتطلب هو عنق الزجاجة. في الأسبوع الماضي، أطلقوا سراحهم نماذج الخيال، وهي بنية نموذجية أساسية يتم تدريبها مسبقًا على الفيديو الخام بدون تسميات إجراء على الإطلاق. نظام الاختبار الخاص بهم هو الفوتون-1، محول متناثر 106B-A5B من خليط الخبراء (MoE) تم تدريبه على 18 عامًا من الفيديو التوضيحي للكمبيوتر. في اختبار داخلي لاستخدام الكمبيوتر، تشير Induction Labs إلى أن Photon-1 يتفوق على Gemini 3.1 Flash-Lite مع استخدام حوسبة أقل بكثير للتدريب المسبق وتكلفة أقل بثلاث مرات تقريبًا للخدمة. ما يفعله…

قراءة المزيد

في هذا البرنامج التعليمي، نستكشف فيركيم v2 والإمكانات الذرية العالمية للتعلم الآلي لـ UMA كإطار موحد للمحاكاة الذرية عبر الكيمياء الجزيئية والحفز الكيميائي والمواد غير العضوية. نقوم بتكوين بيئة، والمصادقة باستخدام Hugging Face للوصول إلى أوزان نماذج UMA المسورة، وتهيئة الآلات الحاسبة الخاصة بالمهام لمجالات omol وoc20 وomat. نقوم بعد ذلك بتطبيق نفس الإمكانات المدربة مسبقًا على مجموعة واسعة من سير عمل الكيمياء الحسابية، بما في ذلك الطاقة ذات النقطة الواحدة والتنبؤ بالقوة، وتحسين الهندسة الجزيئية، ومقارنة حالة الدوران، وتقدير طاقة التفاعل، والتحليل الاهتزازي، وامتزاز السطح، واسترخاء الخلايا البلورية، وتركيب معادلة الحالة، والديناميكيات الجزيئية، ومسح سطح الطاقة الكامنة. طوال البرنامج…

قراءة المزيد

أصدرت Sakana AI Fugu-Cyber ​​(معرف النموذج هو fugu-cyber-v1.0)، وهي إضافة متخصصة في الأمن السيبراني إلى عائلة تنسيق Fugu. إنه ليس مجرد نموذج حدودي جديد. إنها نقطة النهاية الثالثة على مُنسق Fugu، تم ضبطها لأسباب أمنية. أطلق سكنا هذا المنسق قبل شهر. سجلت Sakana معدل نجاح بلغ 86.9% في CyberGym و72.1% في CTI-REALM. ويصف هذه النتائج بأنها قابلة للمقارنة بالنماذج الحدودية التي تركز على الإنترنت مثل GPT-5.5-Cyber ​​وClaude Mythos Preview. ما يقيسه المعياران فعليًا يقع التقييمان على طرفي نقيض من سير العمل الأمني: يعد CyberGym أحد معايير جامعة كاليفورنيا في بيركلي التي تضم 1507 نقاط ضعف في العالم الحقيقي عبر 188…

قراءة المزيد