لقد أطلق فريق NVIDIA AI الكون 3. إنها عائلة من النماذج العالمية متعددة الوسائط للذكاء الاصطناعي المادي. تجمع النماذج بين التفكير الجسدي وتوليد العالم وتوليد العمل. جميع القدرات الثلاث موجودة داخل نموذج واحد مفتوح. NVIDIA مفتوحة المصدر لنقاط التفتيش والبرامج النصية للتدريب وأدوات النشر ومجموعات البيانات. ال الكون 3 يستهدف الإصدار الروبوتات والمركبات المستقلة وفرق مراقبة المستودعات.

نفيديا كوزموس 3

يجب أن تفهم أنظمة الذكاء الاصطناعي المادية العالم قبل التصرف فيه. تحتاج الروبوتات والمركبات إلى الإدراك والتنبؤ ثم التصرف. قامت إصدارات Cosmos السابقة بتقسيم هذه الوظائف عبر نماذج منفصلة. يوحدهم Cosmos 3 ببنية خليط المحولات (MoT). تم بناء الهندسة المعمارية حول برجين.

برج المفكر هو نموذج لغة الرؤية (VLM). إنه يفسر الصور ومقاطع الفيديو والنص باستخدام بنية الانحدار الذاتي. إنه يفهم الحركة وتفاعلات الأشياء والسياق المادي الآخر. يصف فريق NVIDIA هذا البرج بأنه عقل النموذج.

برج المولدات ينتج ملاحظات مستقبلية وتسلسلات عمل. يستخدم عملية قائمة على الانتشار للفيديو والإجراءات المدركة للفيزياء. هذه المخرجات مشروطة بفهم البرج المنطقي. تتدفق المعلومات في اتجاه واحد، من المفكر إلى المولد. يمكن للمفكر أن يركض بمفرده. يقوم المولد دائمًا بتنشيط كلا البرجين من أجل التوليد الموجه.

وبالتالي، يمكن لنموذج واحد أن يتعامل مع التفكير والتوليد معًا.

https://developer.nvidia.com/blog/develop-physical-ai-reasoning-world-and-action-models-with-nvidia-cosmos-3

العائلة النموذجية

يصف فريق NVIDIA ثلاثة مقاييس للنماذج: Edge وNano وSuper. يستخدم كل منها تصميم برج مزدوج خليط من المحولات. تمت تهيئة البرجين من أوزان Qwen3-VL المدربة مسبقًا. يؤدي ذلك إلى مضاعفة عدد معلمات المحول الأساسي تقريبًا.

كوزموس 3 نانو هو نموذج 16B مبني على محول 8B كثيف. إنه يتكيف مع بنية Qwen3-VL 8B. يستهدف Nano الاستدلال الفعال على وحدات معالجة الرسومات لمحطات العمل. إنه يعمل على أجهزة مثل NVIDIA RTX PRO 6000. وهذا يناسب الروبوتات في الوقت الفعلي والذكاء الاصطناعي الفعلي على الجهاز.

كوزموس 3-سوبر هو نموذج 64B مبني على محول 32B كثيف. إنه يتكيف مع بنية Qwen3-VL 32B. يستهدف Super وحدات معالجة الرسومات في مراكز البيانات، بما في ذلك NVIDIA Hopper وBlackwell. إنه يناسب توليد البيانات الاصطناعية على نطاق واسع والتفكير المتقدم.

يشحن هذا الإصدار Nano وSuper، إلى جانب المتغيرات الخاصة بالمهمة. وتشمل هذه البرامج Super Text2Image وSuper Image2Video وNano-Policy-DROID.

كيف يعمل التصميم الموحد

يشترك كلا البرجين في بنية محول واحدة ومشغل اهتمام مشترك. يستخدمون موضعًا دوارًا متعدد الوسائط ثلاثي الأبعاد (mRoPE). يقوم mRoPE بمحاذاة الرموز المميزة للفيديو والصوت والعمل على محور زمني واحد. في وضع السبب، تمر الرموز المميزة من خلال الاهتمام الذاتي السببي. يتيح ذلك التنبؤ بالرمز التالي للإدراك والتخطيط والاستدلال. في وضع المولد، يتم التخلص من الرموز المميزة المزعجة من خلال الاهتمام الكامل. لا يتم تحديث الرموز المميزة للانحدار الذاتي أبدًا بواسطة الرموز المميزة للنشر.

يعامل النموذج العمل باعتباره طريقة أساسية مع رموز عمل مخصصة. تتضمن المدخلات المدعومة مصفوفات إجراءات النص والصورة والفيديو وJSON. تتضمن المخرجات الصور والفيديو والصوت المتزامن وحالات الإجراء والنص. يتبع المسبب اصطلاحات الرسائل المتوافقة مع Qwen3-VL لمدخلات الرؤية.

يدعم الجيل مستويات الدقة 256p و480p و720p. يتراوح عدد الإطارات من 5 إلى 300، افتراضيًا إلى 189. وهذا يعادل حوالي 7.9 ثانية من الفيديو بمعدل 24 إطارًا في الثانية. يتم إنشاء الصوت بتنسيق AAC استريو بتردد 48 كيلو هرتز. يمتد تكييف الحركة إلى الكاميرا، والمركبة، والأنانية، والذراع الواحدة، والذراع المزدوجة، والتجسيدات البشرية. يستخدم كل تجسيد بعدًا ثابتًا للعمل، مثل 9D للكاميرات.

القضية المرجعية

قام فريق NVIDIA بتقييم Cosmos 3 عبر مجموعات التفكير والإنشاء. بناءً على المنطق، يقود Super وNano VANTAGE-Bench في مستويات كل منهما. تقوم VANTAGE-Bench باختبار VLMs على لقطات كاميرا ثابتة في العالم الحقيقي. ويغطي المستودعات والنقل والمساحات الذكية. يتصدر Cosmos 3 أيضًا قائمة المتصدرين الخاصة باستدلال الشذوذ المروري (TAR). TAR هي لوحة المتصدرين الرسمية لـ AI City Challenge 2026 Track 3.

عند الإنشاء، تعلن NVIDIA عن أحدث النتائج مفتوحة المصدر. Cosmos 3 هو SOTA مفتوح المصدر على R-Bench. كما أنها تتصدر PAI-Bench وPhysics-IQ وRoboLab في قوائم المتصدرين العامة. فيما يتعلق بالتحليل الاصطناعي، فهو يقود لوحتين متصدرتين مفتوحتين المصدر. تغطي هذه التحويلات النص إلى صورة والصورة إلى الفيديو بدون صوت.

قدم فريق NVIDIA أيضًا إطار عمل Cosmos Human Evaluation، المسمى HUE. تقوم HUE بتحليل كل مقطع فيديو تم إنشاؤه إلى أسئلة حقيقة بنعم/لا. يسجل أربعة أبعاد عبر سبعة مجالات فعلية للذكاء الاصطناعي. الأبعاد هي المحاذاة الدلالية، والقوانين الفيزيائية، والتفكير الهندسي، والسلامة البصرية. يقوم خط أنابيب VLM بصياغة الأسئلة، ويقوم الخبراء البشريون بتنقيحها.

الشرح المرئي لـ Marktechpost




marktechpost@guide ~ /nvidia/cosmos-3
01 / 09

دليل المطور · الذكاء الاصطناعي المادي

نفيديا كوزموس 3

نماذج عالمية مفتوحة متعددة الوسائط للذكاء الاصطناعي المادي.

صدر في 31 مايو 2026. نموذج واحد للتفكير الجسدي، وتوليد العالم، وتوليد العمل.

خليط من المحولات
الأوزان المفتوحة
أوبن إم دي دبليو-1.1

استخدم ← → أو اسحب للتنقل

01 · ما هو

نموذج موحد للفهم والتوليد

كوزموس 3 هي عائلة مكونة من نماذج عالمية شاملة للذكاء الاصطناعي الجسدي. أصدرت شركة Cosmos السابقة وظائف مقسمة عبر نماذج منفصلة. يوحدهم Cosmos 3 في نموذج واحد مفتوح.

  • المنطق الجسدي على الصور والفيديو والنص.
  • جيل العالم الفيديو والصوت المدركين للفيزياء.
  • جيل العمل للروبوتات والأنظمة المستقلة.

يتضمن VLMs، ومولدات الفيديو، ومحاكيات العالم، ونماذج الحركة العالمية.

02 · الهندسة المعمارية

برجين ومحول واحد

برج ريسونر

نموذج لغة الرؤية الانحداري الذاتي (VLM). يفسر الحركة وتفاعلات الأشياء والسياق المادي. تسميها NVIDIA دماغ النموذج.

برج المولدات

مسار قائم على الانتشار للفيديو والإجراءات المدركة للفيزياء. وهو مشروط بفهم العاقل.

تتدفق المعلومات في اتجاه واحد، المنطق → المولد. يشترك كلا البرجين في حبل متعدد الوسائط ثلاثي الأبعاد (mRoPE).

03 · العائلة النموذجية

اختر حجمًا لجهازك

كوزموس 3 نانو
إجمالي 16B (8B الكثيفة، Qwen3-VL 8B). وحدات معالجة الرسومات لمحطات العمل مثل RTX PRO 6000. الروبوتات في الوقت الحقيقي.

كوزموس 3-سوبر
إجمالي 64B (كثيف 32B، Qwen3-VL 32B). هوبر مركز البيانات ووحدات معالجة الرسوميات بلاكويل. أهداف التنمية المستدامة واسعة النطاق.

كوزموس 3 إيدج
إجمالي 4B (كثيفة 2B). مقياس على الجهاز. المخطط لإصدار لاحق.

المتغيرات الإضافية: Super-Text2Image، وSuper-Image2Video، وNano-Policy-DROID.

04 · الطرائق

المدخلات والمخرجات وإعدادات التوليد

  • المدخلات: صفائف الإجراءات النصية والصورة والفيديو وJSON.
  • النواتج: الصورة والفيديو والصوت المتزامن وحالات العمل والنص.
  • دقة: 256p، 480p، 720p. صوت: ستيريو AAC عند 48 كيلو هرتز.
  • طول: من 5 إلى 300 إطار؛ الافتراضي 189 (حوالي 7.9 ثانية عند 24 إطارًا في الثانية).
  • تجسيدات: كاميرا، مركبة، أنانية، ذراع واحدة، ذراع مزدوجة، شبيهة بالبشر.

05 · المعايير

ما تقارير نفيديا

المنطق

نانو وسوبر يقودان VANTAGE-Bench في مستوياتهما. يتصدر Cosmos 3 قائمة TAR، وهي قائمة المتصدرين في AI City Challenge 2026 Track 3.

جيل

SOTA مفتوح المصدر على R-Bench. يقود PAI-Bench وPhysics-IQ وRoboLab. أعلى المصادر المفتوحة في التحليل الاصطناعي لتحويل النص إلى صورة ومن الصورة إلى الفيديو.

تقوم HUE بتقييم مقاطع الفيديو من خلال التحقق من صحة نعم/لا عبر أربعة أبعاد وسبعة مجالات.

06 · الإصدار المفتوح

كل شيء السفن مفتوحة

  • نقاط التفتيش للمتغيرات Nano وSuper والمهام المحددة.
  • ست مجموعات بيانات لأهداف التنمية المستدامة: الروبوتات، الفيزياء، التفكير المكاني، الحركة البشرية، القيادة، المستودعات.
  • وصفات التدريب: SFT بالإضافة إلى العمل بعد التدريب.
  • أوضاع العمل: الديناميكيات الأمامية، والديناميكيات العكسية، وتوليد السياسات.
  • رخصة: أوبن إم دي دبليو-1.1.

07 · النشر

تشغيله في الإنتاج

  • خدمات نيم الصغيرة: السبب NIM متاح الآن؛ مولد NIM في وقت لاحق.
  • التكميم: BF16، FP8، وNVFP4. يوفر NVFP4 سرعة تصل إلى 2x.
  • التقديم: تم بناء مكدس Reasoner NIM على vLLM.
  • أخذ عينات فيديو فعالة (EVS): تقليم رموز الفيديو الزائدة عن الحاجة عند الاستدلال.

استخدام الناشرون والمحولات للبحث؛ vLLM-Omni وvLLM للخدمة.

08 · القيود والبدء

اعرف المحاذير ثم ابنِ

يمكن أن تظهر المخرجات عدم تناسق زمني، وحركة غير مستقرة، وتحول الكائن، وبنية ثلاثية الأبعاد غير دقيقة، واختلال محاذاة الصوت والفيديو. يحتاج التحكم الحيوي بالسلامة إلى التحقق من الصحة، وحواجز الحماية، والتحليل على مستوى النظام.

جيثبgithub.com/nvidia/cosmos

تعانق الوجهHuggingface.co/collections/nvidia/cosmos3

الوجبات السريعة الرئيسية

  • Cosmos 3 هي عائلة NVIDIA المفتوحة من نماذج العالم متعددة الوسائط، والتي توحد التفكير المادي وتوليد العالم وتوليد الحركة في نموذج واحد.
  • يجمع تصميم خليط المحولات المكون من برجين بين مسبب VLM ذاتي الانحدار مع مولد نشر، مكيف في اتجاه واحد من المسبب إلى المولد.
  • يتم الآن شحن نقطتي تفتيش: Cosmos3-Nano (16B، العمود الفقري الكثيف 8B) لمحطات العمل وCosmos3-Super (64B، العمود الفقري الكثيف 32B) لمراكز البيانات.
  • NVIDIA مفتوحة المصدر لنقاط التفتيش، وستة مجموعات بيانات لأهداف التنمية المستدامة، ووصفات التدريب، ومعيار HUE بموجب ترخيص OpenMDW-1.1.
  • إنه يقدم تقارير SOTA مفتوحة المصدر على R-Bench ونتائج التحليل الاصطناعي الرائدة من النص إلى الصورة والصورة إلى الفيديو.

تحقق من أوزان النماذج، GitHub Repo، صفحة المشروع و التفاصيل الفنية. أيضا، لا تتردد في متابعتنا على تغريد ولا تنسى الانضمام إلينا 150 ألف+ مل من SubReddit والاشتراك في النشرة الإخبارية لدينا. انتظر! هل أنت على برقية؟ الآن يمكنك الانضمام إلينا على التليجرام أيضًا.

هل تحتاج إلى الشراكة معنا للترويج لصفحة GitHub Repo أو صفحة الوجه المعانقة أو إصدار المنتج أو الندوة عبر الويب وما إلى ذلك؟ تواصل معنا



اكتشاف المزيد من كحيل | أخبار التقنية

اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.

شاركها.
اترك تعليقاً

اكتشاف المزيد من كحيل | أخبار التقنية

اشترك الآن للاستمرار في القراءة والحصول على حق الوصول إلى الأرشيف الكامل.

متابعة القراءة