لقد أطلق فريق NVIDIA AI الكون 3. إنها عائلة من النماذج العالمية متعددة الوسائط للذكاء الاصطناعي المادي. تجمع النماذج بين التفكير الجسدي وتوليد العالم وتوليد العمل. جميع القدرات الثلاث موجودة داخل نموذج واحد مفتوح. NVIDIA مفتوحة المصدر لنقاط التفتيش والبرامج النصية للتدريب وأدوات النشر ومجموعات البيانات. ال الكون 3 يستهدف الإصدار الروبوتات والمركبات المستقلة وفرق مراقبة المستودعات.
نفيديا كوزموس 3
يجب أن تفهم أنظمة الذكاء الاصطناعي المادية العالم قبل التصرف فيه. تحتاج الروبوتات والمركبات إلى الإدراك والتنبؤ ثم التصرف. قامت إصدارات Cosmos السابقة بتقسيم هذه الوظائف عبر نماذج منفصلة. يوحدهم Cosmos 3 ببنية خليط المحولات (MoT). تم بناء الهندسة المعمارية حول برجين.
برج المفكر هو نموذج لغة الرؤية (VLM). إنه يفسر الصور ومقاطع الفيديو والنص باستخدام بنية الانحدار الذاتي. إنه يفهم الحركة وتفاعلات الأشياء والسياق المادي الآخر. يصف فريق NVIDIA هذا البرج بأنه عقل النموذج.
برج المولدات ينتج ملاحظات مستقبلية وتسلسلات عمل. يستخدم عملية قائمة على الانتشار للفيديو والإجراءات المدركة للفيزياء. هذه المخرجات مشروطة بفهم البرج المنطقي. تتدفق المعلومات في اتجاه واحد، من المفكر إلى المولد. يمكن للمفكر أن يركض بمفرده. يقوم المولد دائمًا بتنشيط كلا البرجين من أجل التوليد الموجه.
وبالتالي، يمكن لنموذج واحد أن يتعامل مع التفكير والتوليد معًا.

العائلة النموذجية
يصف فريق NVIDIA ثلاثة مقاييس للنماذج: Edge وNano وSuper. يستخدم كل منها تصميم برج مزدوج خليط من المحولات. تمت تهيئة البرجين من أوزان Qwen3-VL المدربة مسبقًا. يؤدي ذلك إلى مضاعفة عدد معلمات المحول الأساسي تقريبًا.
كوزموس 3 نانو هو نموذج 16B مبني على محول 8B كثيف. إنه يتكيف مع بنية Qwen3-VL 8B. يستهدف Nano الاستدلال الفعال على وحدات معالجة الرسومات لمحطات العمل. إنه يعمل على أجهزة مثل NVIDIA RTX PRO 6000. وهذا يناسب الروبوتات في الوقت الفعلي والذكاء الاصطناعي الفعلي على الجهاز.
كوزموس 3-سوبر هو نموذج 64B مبني على محول 32B كثيف. إنه يتكيف مع بنية Qwen3-VL 32B. يستهدف Super وحدات معالجة الرسومات في مراكز البيانات، بما في ذلك NVIDIA Hopper وBlackwell. إنه يناسب توليد البيانات الاصطناعية على نطاق واسع والتفكير المتقدم.
يشحن هذا الإصدار Nano وSuper، إلى جانب المتغيرات الخاصة بالمهمة. وتشمل هذه البرامج Super Text2Image وSuper Image2Video وNano-Policy-DROID.
كيف يعمل التصميم الموحد
يشترك كلا البرجين في بنية محول واحدة ومشغل اهتمام مشترك. يستخدمون موضعًا دوارًا متعدد الوسائط ثلاثي الأبعاد (mRoPE). يقوم mRoPE بمحاذاة الرموز المميزة للفيديو والصوت والعمل على محور زمني واحد. في وضع السبب، تمر الرموز المميزة من خلال الاهتمام الذاتي السببي. يتيح ذلك التنبؤ بالرمز التالي للإدراك والتخطيط والاستدلال. في وضع المولد، يتم التخلص من الرموز المميزة المزعجة من خلال الاهتمام الكامل. لا يتم تحديث الرموز المميزة للانحدار الذاتي أبدًا بواسطة الرموز المميزة للنشر.
يعامل النموذج العمل باعتباره طريقة أساسية مع رموز عمل مخصصة. تتضمن المدخلات المدعومة مصفوفات إجراءات النص والصورة والفيديو وJSON. تتضمن المخرجات الصور والفيديو والصوت المتزامن وحالات الإجراء والنص. يتبع المسبب اصطلاحات الرسائل المتوافقة مع Qwen3-VL لمدخلات الرؤية.
يدعم الجيل مستويات الدقة 256p و480p و720p. يتراوح عدد الإطارات من 5 إلى 300، افتراضيًا إلى 189. وهذا يعادل حوالي 7.9 ثانية من الفيديو بمعدل 24 إطارًا في الثانية. يتم إنشاء الصوت بتنسيق AAC استريو بتردد 48 كيلو هرتز. يمتد تكييف الحركة إلى الكاميرا، والمركبة، والأنانية، والذراع الواحدة، والذراع المزدوجة، والتجسيدات البشرية. يستخدم كل تجسيد بعدًا ثابتًا للعمل، مثل 9D للكاميرات.
القضية المرجعية
قام فريق NVIDIA بتقييم Cosmos 3 عبر مجموعات التفكير والإنشاء. بناءً على المنطق، يقود Super وNano VANTAGE-Bench في مستويات كل منهما. تقوم VANTAGE-Bench باختبار VLMs على لقطات كاميرا ثابتة في العالم الحقيقي. ويغطي المستودعات والنقل والمساحات الذكية. يتصدر Cosmos 3 أيضًا قائمة المتصدرين الخاصة باستدلال الشذوذ المروري (TAR). TAR هي لوحة المتصدرين الرسمية لـ AI City Challenge 2026 Track 3.
عند الإنشاء، تعلن NVIDIA عن أحدث النتائج مفتوحة المصدر. Cosmos 3 هو SOTA مفتوح المصدر على R-Bench. كما أنها تتصدر PAI-Bench وPhysics-IQ وRoboLab في قوائم المتصدرين العامة. فيما يتعلق بالتحليل الاصطناعي، فهو يقود لوحتين متصدرتين مفتوحتين المصدر. تغطي هذه التحويلات النص إلى صورة والصورة إلى الفيديو بدون صوت.
قدم فريق NVIDIA أيضًا إطار عمل Cosmos Human Evaluation، المسمى HUE. تقوم HUE بتحليل كل مقطع فيديو تم إنشاؤه إلى أسئلة حقيقة بنعم/لا. يسجل أربعة أبعاد عبر سبعة مجالات فعلية للذكاء الاصطناعي. الأبعاد هي المحاذاة الدلالية، والقوانين الفيزيائية، والتفكير الهندسي، والسلامة البصرية. يقوم خط أنابيب VLM بصياغة الأسئلة، ويقوم الخبراء البشريون بتنقيحها.
الشرح المرئي لـ Marktechpost
01 / 09
الوجبات السريعة الرئيسية
- Cosmos 3 هي عائلة NVIDIA المفتوحة من نماذج العالم متعددة الوسائط، والتي توحد التفكير المادي وتوليد العالم وتوليد الحركة في نموذج واحد.
- يجمع تصميم خليط المحولات المكون من برجين بين مسبب VLM ذاتي الانحدار مع مولد نشر، مكيف في اتجاه واحد من المسبب إلى المولد.
- يتم الآن شحن نقطتي تفتيش: Cosmos3-Nano (16B، العمود الفقري الكثيف 8B) لمحطات العمل وCosmos3-Super (64B، العمود الفقري الكثيف 32B) لمراكز البيانات.
- NVIDIA مفتوحة المصدر لنقاط التفتيش، وستة مجموعات بيانات لأهداف التنمية المستدامة، ووصفات التدريب، ومعيار HUE بموجب ترخيص OpenMDW-1.1.
- إنه يقدم تقارير SOTA مفتوحة المصدر على R-Bench ونتائج التحليل الاصطناعي الرائدة من النص إلى الصورة والصورة إلى الفيديو.
تحقق من أوزان النماذج، GitHub Repo، صفحة المشروع و التفاصيل الفنية. أيضا، لا تتردد في متابعتنا على تغريد ولا تنسى الانضمام إلينا 150 ألف+ مل من SubReddit والاشتراك في النشرة الإخبارية لدينا. انتظر! هل أنت على برقية؟ الآن يمكنك الانضمام إلينا على التليجرام أيضًا.
هل تحتاج إلى الشراكة معنا للترويج لصفحة GitHub Repo أو صفحة الوجه المعانقة أو إصدار المنتج أو الندوة عبر الويب وما إلى ذلك؟ تواصل معنا
اكتشاف المزيد من كحيل | أخبار التقنية
اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.
