الكاتب: كحيل

الخط في كائن الاستجابة يمكنك استدعاء API. قمت بتمرير النموذج: “كلود-فابل-5”. ستستعيد الإكمال وعدد الرموز وحقلًا يقرأ “النموذج”: “claude-opus-4-8”. لا شيء أخطأ. لا شيء إعادة المحاولة. تم تصنيف الطلب قبل بدء الإنشاء، وتطابق مع فئة حساسة، وتم تسليمه إلى مجموعة مختلفة من الأوزان تمامًا. قامت Anthropic بتوثيق ذلك عندما أعادت Fable 5 مرة أخرى في 1 يوليو: يتم إرسال الطلبات المحظورة إلى Opus 4.8 بدلاً من ذلك، ويتم إخطار المستخدم. يحدث التبديل في طبقة API، ويقوم كائن الاستجابة بتسمية النموذج الذي تم تشغيله بالفعل. هذه هي النسخة حسنة التصرف. وهو أيضًا، بقدر ما أستطيع أن أقول، الإصدار الوحيد الذي يتم…

قراءة المزيد

قال المستشار العلمي للبيت الأبيض، مايكل كراتسيوس، إن شركة Moonshot، الشركة الصينية التي تقف وراء Kimi K3، وهي أكبر شركة LLM متاحة ذات وزن مفتوح، قامت ببناء نموذجها عن طريق نسخ Anthropic’s Fable LLM أثناء استخدام رقائق غير مصرح لها بالتصدير إلى الصين. وكتب كراتسيوس، وسط مناقشات وردت حول حظر النماذج الصينية ذات الوزن المفتوح التي عصفت بقطاع الذكاء الاصطناعي: “إن التقطير الصناعي السري واسع النطاق الذي يهدف إلى سرقة التكنولوجيا الأمريكية المملوكة وتقويض الأبحاث الأمريكية أمر غير مقبول”. ولم ترد شركة Moonshot على الأسئلة المتعلقة بعملية التدريب الخاصة بها، ولم يشارك كراتسيوس المزيد من التفاصيل حول مصادر ادعاءاته. رددت…

قراءة المزيد

يعد الرمز المميز هو الجزء الوحيد من مجموعة نماذج اللغة التي لا يوجد أي ملف تعريف لها تقريبًا. يجادل جيجاتوكن، الذي أصدره مارسيل رود (طالب دكتوراه من جامعة ستانفورد) بموجب ترخيص من معهد ماساتشوستس للتكنولوجيا، بأن هذا كان خطأ. تقوم المكتبة بتشفير النص بسرعة غيغابايت في الثانية على جهاز واحد، مقابل خطوط أساسية متعددة الخيوط بالفعل. يؤدي قياس أداء الرموز المميزة GPT-2 إلى نتائج رائعة: تم تقييمه على مجموعة owt_train.txt بسعة 11.9 جيجابايت باستخدام إعداد ثنائي المقبس AMD EPYC 9565 ذو 144 نواة، حيث تقوم Gigatoken بمعالجة البيانات بسرعة مذهلة. 24.53 جيجابايت/ثانية. بالمقارنة، يحقق tiktoken الخاص بـ OpenAI 36.0 ميجابايت/ثانية،…

قراءة المزيد

توقف التعرف على الكلام المفتوح عن كونه ثقافة Whisper الأحادية في وقت ما خلال الاثني عشر شهرًا الماضية. في مارس 2026، أصدرت Cohere Transcribe، وهو نموذج 2B Apache 2.0 الذي احتل قمة Hugging Face Open ASR Leaderboard بمتوسط ​​معدل خطأ في الكلمات يبلغ 5.42%. وبعد خمسة أسابيع قامت شركة IBM بشحن Granite Speech 4.1 2B بنسبة 5.33%. ومنذ ذلك الحين، سجلت ARK-ASR-3B وMOSS-Transcribe-preview-2B أرقامًا أقل. يتم الآن فصل الجزء العلوي من لوحة المتصدرين بأقل من نقطة WER واحدة. وهذا له نتيجة محددة لأي شخص يختار نموذجًا: لم تعد الرتبة هي المتغير الحاسم. الترخيص وتغطية اللغة ودعم البث والتكلفة لكل ساعة…

قراءة المزيد

أصدرت الأنثروبيك كلود الأمن البرنامج المساعد لكلود كود في مرحلة تجريبية. يقوم البرنامج الإضافي بتشغيل فحص الثغرات الأمنية متعدد العوامل للمستودع من داخل جلسة Claude Code الموجودة، ثم يحول النتائج التي تحددها إلى ملفات تصحيح تقوم بمراجعتها وتطبيقها بنفسك. أكدت Anthropic على تعدد استخدامات الأداة عند الإعلان عنها، وسلطت الضوء على قدرتها على إجراء فحص شامل عبر قاعدة التعليمات البرمجية الكاملة أو فحص التغييرات من الجهاز قبل الالتزام مباشرة. ما يضيف البرنامج المساعد يضيف المكون الإضافي أمرًا واحدًا، / claude-security، الذي يفتح قائمة من ثلاث وظائف، وفقًا للوثائق الرسمية: مسح قاعدة التعليمات البرمجية – المستودع بأكمله أو مجموعة فرعية منه…

قراءة المزيد

لقد جعل Cursor Cursor Router متاحًا بشكل عام لخطط Teams وEnterprise. النظام عبارة عن مصنف يقوم بفحص كل طلب قبل تشغيل النموذج، ثم يرسله إلى النموذج الأكثر ملاءمة لتلك المهمة المحددة. أبلغ فريق المؤشر عن أداء عالي الجودة مع توفير بنسبة 60% في اختبارات A/B عبر الإنترنت، وتوفير بنسبة 30-50% لحسابات المؤسسات ذات الوصول المبكر. المشكلة التي تستهدفها هي نمط الإنفاق وليس فجوة القدرات. يشير المؤشر إلى ذلك تقريبًا 60% من مطوريها يختارون طرازًا واحدًا كمحرك يومي. وبالتالي، يتم إنجاز العمل الروتيني بأسعار خيالية، وينمو الإنفاق على الذكاء الاصطناعي بشكل أسرع من جودة الإنتاج. التوجيه هو إجابة المؤشر على عدم…

قراءة المزيد

في هذا البرنامج التعليمي، نستكشف EdgeBench كمعيار عملي لتقييم وكلاء الذكاء الاصطناعي المتقدمين عبر فئات المهام المتنوعة وبيئات وقت التشغيل وميزانيات وقت التفاعل. نبدأ بتنزيل لقطة مجموعة البيانات من Hugging Face، وتحليل مواصفات المهمة التي تم إصدارها، وفحص التصنيف المعياري، وإعدادات التنفيذ، ومتطلبات الإنترنت، ومنطق الحكم، وتسجيل البيانات الوصفية. نقوم بعد ذلك باستخراج بيانات لوحة المتصدرين مباشرة من المستودع README، وتوحيد أسماء النماذج، وإعادة تشكيل النتائج على مستوى المهمة إلى تنسيق جاهز للتحليل، ومقارنة الأداء عبر ميزانيات زمنية متعددة. أخيرًا، نحن نلائم منحنيات القياس اللوغاريتمي السيني، ونقيس تحسينات النتيجة على مستوى الفئة، ونفحص المهام التي تحقق أكبر المكاسب، وندرس كيف…

قراءة المزيد

أربعة مشاريع مفتوحة المصدر تهيمن على الضبط الدقيق لـ LLM اليوم. Unsloth، وAxolotl، وTRL، وLLaMA-Factory جميعها تحتوي على نفس مكدس PyTorch وHugging Face الأساسي. إنهم يختلفون حول المكان الذي يقضون فيه الجهد الهندسي. Unsloth يعيد كتابة النوى. Axolotl يؤلف استراتيجيات التوازي. يحدد TRL واجهات برمجة تطبيقات المدرب التي يبني عليها الآخرون. يعمل LLaMA-Factory على تحسين نطاق تغطية النموذج وتشغيل الكود الصفري. تغطي هذه المقارنة ثلاثة محاور قام بها المهندسون بالفعل: إنتاجية التدريب، وذروة VRAM، وتوسيع نطاق وحدات معالجة الرسومات المتعددة. ترل هي طبقة التنفيذ المرجعية. انها السفن SFTTrainer, DPOTrainer, GRPOTrainer, KTOTrainer, RewardTrainer، و RLOOTrainer. Axolotl و LLaMA-Factory كلاهما يستدعيان ذلك.…

قراءة المزيد

لقد أصدرت مؤسسة Cisco Foundation AI أنتاريس، وهي عائلة من نماذج اللغات الأمنية الصغيرة (SLM) المصممة لمهمة أمنية ضيقة واحدة. المهمة هي توطين الضعف. بالنظر إلى وصف الثغرة الأمنية والمستودع، ابحث عن الملفات التي تحتوي على الخلل. هناك طرازان مفتوحان الوزن ومتاحان الآن على Hugging Face، Antares-350M وAntares-1B. كلاهما أباتشي 2.0. قام فريق Cisco أيضًا بشحن معيار توطين الثغرات الأمنية (VLoc Bench)، وهو تقييم وكيل مكون من 500 مهمة، بموجب نفس الترخيص. والنتيجة الرئيسية ليست حالة جديدة من الفن. وهو أن نموذج 1B يصل إلى 0.209 ملف F1. يصل GPT-5.5 إلى 0.229، ويصل طراز 753B ذو الوزن المفتوح إلى 0.186.…

قراءة المزيد

أصدرت Poolside Laguna S 2.1، وهو نموذج ذو وزن مفتوح بمعلمة 118B مصمم للتشفير الوكيل. إنه نموذج خليط من الخبراء (MoE) مع 8B من المعلمات النشطة لكل رمز مميز. وهو يدعم نافذة سياق تصل إلى مليون رمز في كل من وضعي التفكير وعدم التفكير. الأوزان موجودة على Hugging Face بموجب ترخيص OpenMDW-1.1، والنموذج صغير بما يكفي لتشغيله على NVIDIA DGX Spark واحد. فيما يتعلق بمعايير الترميز طويلة المدى، يحتفظ Laguna S 2.1 بمواصفاته الخاصة مقارنة بالنماذج التي تفوق حجمه عدة مرات، بما في ذلك DeepSeek-V4-Pro-Max، وNVIDIA’s Nemotron 3 Ultra، وThinking Machines’ Inkling. Laguna S 2.1 هو نسخة مطورة من عائلة…

قراءة المزيد