ثلاثة مختبرات صينية تحتل الآن قمة قائمة المتصدرين للوزن المفتوح. إن Kimi K3 من Moonshot AI، وDeepSeek V4 Pro، وGLM-5.2…
MoE
نشر اتحاد أبحاث ألماني تقرير التدريب المسبق لـ صوفي S 30B-A3B. إنه نموذج قاعدة مفتوحة للغة الألمانية والإنجليزية. تم إجراء…
تعتبر نماذج MoE الهجينة الكبيرة مثل Nemotron-3-Super دقيقة ولكنها مكلفة في الخدمة. تحدد معلماتها النشطة وذاكرة التخزين المؤقت KV وحالة…
تعتبر نماذج MoE الهجينة الكبيرة مثل Nemotron-3-Super دقيقة ولكنها مكلفة في الخدمة. تحدد معلماتها النشطة وذاكرة التخزين المؤقت KV وحالة…
أطلق فريق Tencent’s Hy Hy3. Hy3 هو نموذج خليط من الخبراء (MoE) ذو معلمة 295B. يقوم بتنشيط 21B معلمة فقط…
لقد أطلق سراح ميتوان لونج كات-2.0، نموذج لغة واسع النطاق لمزيج الخبراء (MoE). يحمل 1.6 تريليون مجموع المعلمات وينشط حول…
أصدرت Prime Intellect الإصدار 0.6.0 من Prime-rl. يستهدف الإطار التعلم المعزز على نماذج خليط الخبراء (MoE) المكونة من تريليون معلمة.…
أصدرت MiniMax MSA (MiniMax Sparse Attention)، وهي طريقة انتباه متفرقة مبنية مباشرة على انتباه الاستعلام المجمع (GQA). إنه يستهدف عنق…
أصدرت JetBrains Mellum2، وهو مصدر مفتوح للأوزان بموجب ترخيص Apache 2.0. كان الإصدار الأول من Mellum عبارة عن نموذج كثيف…
تم شحن الذكاء الاصطناعي السائل للتو LFM2.5-8B-A1B. وهو عبارة عن نموذج خليط من الخبراء (MoE) الموجود على الجهاز والذي تم…