أصدرت Black Forest Labs (BFL) FLUX 3، وهو نموذج أساسي متعدد الوسائط يتعلم من الصور ومقاطع الفيديو والصوت داخل بنية واحدة. وهو أيضًا أول نموذج FLUX يشحن الفيديو والصوت والتنبؤ بالحركة من مجموعة واحدة من الأوزان.
يجادل فريق البحث في Black Forest Labs (BFL) بأنه لا توجد طريقة واحدة تعطي وصفًا كاملاً للعالم. تلتقط الصور البنية المكانية في لحظة واحدة. يستعيد الفيديو الوقت ويكشف عن الديناميكيات الجسدية. يكشف الصوت عن العلاقات السببية بين الأحداث الميكانيكية والصوت. يتم التعامل مع كل منها على أنها إسقاط خاسر لنفس الواقع الأساسي.
والتدريب عليها جميعا في وقت واحد يعني أن الطرائق تقيد بعضها البعض. يجب أن يتناسب الصوت مع التأثير. يجب أن تخضع الحركة للكتلة. يطلق فريق البحث على FLUX 3 نموذجه الأول المبني بالكامل على هذا المبدأ.
الطريقة أدناه: التدفق الذاتي
يعتمد FLUX 3 على التدفق الذاتي، وهو أسلوب BFL لمواءمة إنشاء الوسائط المتعددة والفهم في بنية واحدة. يجمع التدفق الذاتي بين هدف مطابقة التدفق وهدف إعادة بناء الميزات الخاضع للإشراف الذاتي. التنفيذ المرجعي على GitHub هو Apache-2.0 ويستخدم SiT-XL/2 مع تكييف الخطوات الزمنية لكل رمز مميز. إنه يتدرب بنسبة قناع 25% لكل رمز والتقطير الذاتي من معلم EMA في الطبقة 20 إلى طالب في الطبقة 8.
نقطة التفتيش التي تم إصدارها هي نموذج بحث ImageNet 256 × 256، وليس FLUX 3. تنص BFL على أنها “قامت بتوسيع موارد الحوسبة والبيانات بشكل كبير” على نفس النهج لتدريب FLUX 3 عبر الفيديو والصور والصوت في وقت واحد. تم تقديم ميزة Self-Flow نفسها في مارس 2026، لذا فهي ليست جديدة على هذا الإطلاق. الجديد هو المقياس.
ما يفعله فيديو FLUX 3
يقوم FLUX 3 Video بإنشاء مقاطع تصل مدتها إلى 20 ثانية في جيل واحد، مع الصوت الأصلي. تغطي الأوضاع المدعومة تحويل النص إلى فيديو، ومن صورة إلى فيديو، ومن فيديو إلى فيديو من مقطع مرجعي، ومن إطار رئيسي إلى فيديو للانتقالات التي يتم التحكم فيها، واستمرار الصوت والصورة التوليدي من إدخال الفيديو والصوت.
يسرد BFL أيضًا الحوار متعدد اللغات، والتسلسل الفعال للمقاطع في تسلسلات متعددة اللقطات، وتوليد الطباعة القوية مع التصميمات المتحركة. أبلغ فريق BFL عن قوة خاصة في تعبيرات الوجه البشري وفي ربط الأصوات بالأحداث الجسدية.
أداء
نشر فريق BFL النتائج الأولية للتفضيلات البشرية. كان الإعداد عبارة عن مقاطع فيديو مدتها 10 ثوانٍ بدقة 720 بكسل مع الصوت. تم تفضيل FLUX 3 على Luma Ray 3.2 في 93% من المقارنات وعلى Runway Gen-4.5 في 77%. مقابل Grok Imagine Video يصل الرقم إلى 69%، ثم Kling v3 Pro بنسبة 60%، وHappy Horse v1 بنسبة 59%، وHappy Horse 1.1 بنسبة 57%. ضد Seedance 2.0 وGemini Omni Flash كانت النتيجة 52%، وهي نسبة قريبة من رمي العملة المعدنية.
تفاعلية إكسبلورر
يدخل
الوجبات السريعة الرئيسية
- FLUX 3 عبارة عن عمود فقري مطابق للتدفق تم تدريبه بشكل مشترك على الصور والفيديو والصوت.
- يُنشئ فيديو FLUX 3 ما يصل إلى 20 ثانية بصوت أصلي في جيل واحد.
- يستهلك توقع الفيديو أكثر من 95% من حساب التدريب؛ الصوت أقل من 0.5% من الرموز.
- نفس العمود الفقري هو محرك FLUX-mimic، وهو نظام روبوت يعمل بأقل من 80 مللي ثانية على بطاقة RTX 5090 واحدة.
- الوصول مسور: الفيديو والحركة في الوصول المبكر، الصورة تتبع، الأوزان المفتوحة تأتي أخيرًا.
تحقق من إعلان FLUX 3 والمنشور الفني لتقليد FLUX 3 x وورقة التدفق الذاتي. كل الفضل في هذا البحث يعود إلى الباحثين في هذا المشروع.
ميشال سوتر متخصص في علوم البيانات وحاصل على درجة الماجستير في علوم البيانات من جامعة بادوفا. بفضل أساس متين في التحليل الإحصائي والتعلم الآلي وهندسة البيانات، تتفوق ميشال في تحويل مجموعات البيانات المعقدة إلى رؤى قابلة للتنفيذ.
اكتشاف المزيد من كحيل | أخبار التقنية
اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.
