أصدرت Poolside Laguna S 2.1، وهو نموذج ذو وزن مفتوح بمعلمة 118B مصمم للتشفير الوكيل. إنه نموذج خليط من الخبراء (MoE) مع 8B من المعلمات النشطة لكل رمز مميز. وهو يدعم نافذة سياق تصل إلى مليون رمز في كل من وضعي التفكير وعدم التفكير. الأوزان موجودة على Hugging Face بموجب ترخيص OpenMDW-1.1، والنموذج صغير بما يكفي لتشغيله على NVIDIA DGX Spark واحد.

فيما يتعلق بمعايير الترميز طويلة المدى، يحتفظ Laguna S 2.1 بمواصفاته الخاصة مقارنة بالنماذج التي تفوق حجمه عدة مرات، بما في ذلك DeepSeek-V4-Pro-Max، وNVIDIA’s Nemotron 3 Ultra، وThinking Machines’ Inkling. Laguna S 2.1 هو نسخة مطورة من عائلة Laguna XS، وقد تم تدريبه على نفس بيانات التدريب المسبق مثل XS 2.1.

ما هو لاجونا اس 2.1

يقوم النموذج بتنشيط ما يقرب من 6.8% من معلماته على أي رمز مميز. تظل كافة المعلمات 118B موجودة في الذاكرة، ولكن فقط 8B فقط يتم توجيهها عبر الشبكة في كل خطوة. هذا التناثر هو السبب في أن النموذج متوسط ​​الحجم يمكن أن يتصرف كنموذج أكبر مع البقاء رخيصًا في الخدمة.

ينشر فريق Poolside الأوزان في BF16 وFP8 وINT4 وNVFP4، إلى جانب تحويلات GGUF وMLX الرسمية ونماذج مسودة DFlash. لقد استغرق الأمر من بداية التدريب حتى يتم إطلاقه في أقل من تسعة أسابيع. بدأ التدريب المسبق في 22 مايو 2026 على 4096 وحدة معالجة رسومات NVIDIA H200. إنه أول نموذج لـ Poolside يتم فيه تشغيل التعلم المعزز بدقة FP8.

أداء

حصل Laguna S 2.1 على 70.2% في Terminal-Bench 2.1 مع تمكين التفكير. وهذا يضعها في المرتبة الأولى بين النماذج المفتوحة ذات الحجم المكشوف على لوحة المتصدرين المجمعة في Poolside، خلف الأنظمة الأكبر أو المغلقة فقط. في SWE-Bench Multilingual حصل على 78.5%، متصدرًا الجدول المنشور تمامًا. المقارنة الكاملة لـ Poolside التي تم إصدارها أدناه.

المعيار لاجونا اس 2.1 (118B-A8B) تينسنت Hy3 (295B-A21B) التحبير (975B-A41B) نيموترون 3 الترا (550B-A55B) ديب سيك-V4-برو-ماكس (1.6T-A49B) كيمي K3 (2.8T-A50B) كوين 3.7 ماكس موسى سبارك 1.1 كلود فابل 5
المحطة الطرفية 2.1 70.2 71.7 63.8 56.4 64.0 88.3 74.5 80.0 88.0
SWE-مقعد متعدد اللغات 78.5 75.8 67.7 76.2 78.3
SWE-Bench Pro (عام) 59.4 57.9 54.3 55.4 60.6 61.5 80.3
DeepSWE v1.1 40.4 9.0 69.0 53.3 70.0
أطلس SWE (Codebase QnA) 46.2 27.2 42.2
تم التحقق من تولاثلون 49.7 45.5 34.3 55.9 75.6

أوضح إشارة هي DeepSWE v1.1، والتي لا تزال تتمتع بإرتفاع حقيقي. هناك، حقق Laguna S 2.1 نسبة 40.4% مقابل 9.0% لـ DeepSeek-V4-Pro-Max، مع ما يقرب من سدس المعلمات النشطة. لا تزال نماذج الحدود المغلقة مثل Claude Fable 5 وKimi K3 تتصدر العديد من المعايير. إن ادعاء Poolside يتعلق بفئة الوزن، وليس القمة المطلقة. يتم نشر المسارات من مجموعة التقييم النهائية على trajectories.poolside.ai.

وضعين للتفكير، ومن أين تأتي النتيجة

لاجونا اس 2.1 لديها وضعين: إيقاف والحد الأقصى، مع تمكين الحد الأقصى بشكل افتراضي. في الوضع الأقصى، يقوم النموذج بتعيين ميزانية حساب وقت الاختبار الخاصة به. يتم شحن Poolside بدون التحكم في الجهد المنخفض/المتوسط/العالي الذي يمكن للمستخدم تكوينه في الوقت الحالي.

يؤدي التفكير الأقصى إلى رفع مستوى Terminal-Bench 2.1 من 60.4% إلى 70.2%. يرفع DeepSWE من 16.5% إلى 40.4%. هذه المكاسب تكلف الرموز: تعمل مسارات DeepSWE على حوالي 249 ألف رمز إكمال في وضع التفكير مقابل 99 ألف بدونها. يقدم فريق Poolside تقارير عن تفكير متماسك ومثمر يستمر لساعات ومئات الآلاف من الرموز المميزة.

ثلاث أشواط منشورة

شارك فريق Poolside ثلاثة مسارات غير محررة لإظهار السلوك بدلاً من النتائج. في إحداها، قام النموذج ببناء محرك متصفح HTML/CSS عامل من مجلد فارغ. استغرق هذا التشغيل 181 خطوة خلال جلسة مدتها 50 دقيقة، دون أي تدخل بشري، وتم التحقق من صحة إنتاجه ضد Chromium مقطوع الرأس.

في ثانية واحدة، قام النموذج بتحسين حزام وكيل Poolside الخاص. لقد جعل الحزام أسرع بنسبة 5.2% مع تخصيص ذاكرة أقل بنسبة 71% تقريبًا، واستبدال تسلسل سلسلة O(n²) بالمخازن المؤقتة. وفي الثالثة، أعادت اشتقاق مشكلة Erdős #397 في وضع عدم الاتصال بلغة Perl لأكثر من 68 دقيقة، نظرًا لأن صندوق الحماية لا يحتوي على Python. وهذه النتيجة هي إعادة اكتشاف مستقلة. حل GPT-5.2 Pro نفس المشكلة في يناير 2026، والموعد النهائي للمعرفة لدى Laguna هو نوفمبر 2025.

هل يمكنك نشرها فعلا؟

يستخدم تغيير الحجم المعلمات 118B الكاملة، وليس العدد النشط 8B، لأن كل خبير يبقى في الذاكرة. في 4 بت (NVFP4 أو INT4)، تحتاج الأوزان إلى حوالي 59 جيجابايت، والتي تتناسب بشكل مريح مع ذاكرة DGX Spark الموحدة التي تبلغ سعتها 128 جيجابايت. في FP8، يحتاجون إلى حوالي 118 جيجابايت، ولا يزالون ضمن Spark واحدة أو H200 واحدة. في BF16، يحتاجون إلى حوالي 236 جيجابايت، وهو ما يستدعي وجود جهازي Sparks مرتبطين أو عقدة مركز بيانات متعددة وحدات معالجة الرسومات.

عملت Poolside مع NVIDIA لتحسين الاستدلال من خدمة TRT-LLM إلى NVFP4 على Blackwell، وصولاً إلى DGX Spark واحد. لقد قامت بشحن دعم اليوم الأول لـ vLLM وSGLang وOllama. يتم تشغيل الوصول المستضاف من خلال OpenRouter، مجانًا في سياق 256 كيلو بايت ويتم دفعه في سياق 1 مليون كامل مقابل 0.10 دولار / 0.20 دولار / 0.01 دولار لكل مليون رمز مميز للإدخال / الإخراج / قراءة ذاكرة التخزين المؤقت. النموذج موجود أيضًا على Baseten وKilo وPrime Intellect Prime Lab وZML.

الوجبات السريعة الرئيسية

  • Laguna S 2.1 هو نموذج ترميز MoE إجمالي 118B/نشط 8B مع سياق رمزي 1M، مفتوح ضمن OpenMDW-1.1.
  • لقد سجلت 70.2% على Terminal-Bench 2.1 و78.5% على SWE-Bench Multilingual، الرائدة في النماذج المفتوحة ذات الحجم المكشوف.
  • في 4 بت يتم تشغيله على NVIDIA DGX Spark واحد؛ FP8 يناسب سبارك واحد أو H200، BF16 يحتاج إلى اثنين.
  • يؤدي “التفكير الأقصى” الافتراضي إلى تحقيق معظم النتائج، بتكلفة رمزية حقيقية (DeepSWE: 16.5% → 40.4%).
  • تم تدريبه في أقل من تسعة أسابيع على 4,096 وحدة معالجة رسوميات H200، وهو النموذج الثالث من Poolside في أقل من ثلاثة أشهر.

مصادر: Poolside Technical— نقدم لكم Laguna S 2.1 وRobert McHardy على X وPoolside on X وHugging Face.


آصف رزاق هو الرئيس التنفيذي لشركة Marktechpost Media Inc.. بصفته رجل أعمال ومهندسًا صاحب رؤية، يلتزم آصف بتسخير إمكانات الذكاء الاصطناعي لتحقيق الصالح الاجتماعي. وكان أحدث مساعيه هو إطلاق منصة وسائط الذكاء الاصطناعي، Marktechpost، والتي تتميز بتغطيتها المتعمقة لأخبار التعلم الآلي والتعلم العميق التي تتميز بأنها سليمة من الناحية التقنية وسهلة الفهم من قبل جمهور واسع. تتمتع المنصة بأكثر من 2 مليون مشاهدة شهريًا، مما يوضح شعبيتها بين الجماهير.


اكتشاف المزيد من كحيل | أخبار التقنية

اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.

شاركها.
اترك تعليقاً

اكتشاف المزيد من كحيل | أخبار التقنية

اشترك الآن للاستمرار في القراءة والحصول على حق الوصول إلى الأرشيف الكامل.

متابعة القراءة