Robbyant، شركة الذكاء الاصطناعي المتجسدة ضمن Ant Group، لديها مصادر مفتوحة LingBot-الرؤية، عائلة من محولات الرؤية ذاتية الإشراف والمصممة للإدراك المكاني الكثيف. يتم شحن الأوزان تحت Apache-2.0 على Hugging Face بأربعة أحجام – ViT-giant، وViT-large، وViT-base، وViT-small – بالإضافة إلى تقرير فني وكود استنتاجي.
يتم تدريب معظم نماذج أسس الرؤية على الثبات الدلالي: فهم يتعلمون الإجابة ماذا هو في صورة بينما يتجاهل بالضبط البنية المكانية الدقيقة – حدود الكائن، والخطوط الكنتورية، وانقطاعات العمق – التي تعتمد عليها الروبوتات وغيرها من الأنظمة المتجسدة جسديًا. وتقلب LingBot-Vision تلك الأولوية. يعامل الحدود على أنها إشارة التدريب المسبق الأصلية بدلاً من الإخراج النهائي، والمردود عبارة عن عمود فقري ذو معلمة 1B يطابق أو يفوق النماذج الأكبر بما يصل إلى 7 × في المهام المكانية الكثيفة، بما في ذلك 7B DINOv3.
ما هي رؤية LingBot؟
LingBot-Vision هو جهاز تشفير مُدرب ذاتيًا يتم الإشراف عليه مسبقًا لمهام المصب المنظمة مكانيًا. يحتوي الطراز ViT-g/16 الرئيسي على ما يقرب من 1.1B من المعلمات ويتم تدريبه بهدف جديد يسمى نمذجة الحدود المقنعة في مجموعة منسقة مكونة من حوالي 161 مليون صورة – تم اختيارها من مجموعة ويب 2B – بدون تسميات بشرية، ولا كاشفات خارجية للحواف، ولا يوجد عمود فقري مُدرب مسبقًا للتمهيد منه. كما أن التدريب اقتصادي بشكل ملحوظ: فالمجموعة أصغر حجمًا من LVD-1689M الخاص بـ DINOv3، ويستهلك النموذج أقل من ثلث عينات التدريب الخاصة بـ DINOv3.
يقوم جهاز التشفير بإخراج ميزات رمز التصحيح الكثيفة المخصصة للقراءات المجمدة. للنشر بميزانيات أصغر، يتم تقطير الرائد إلى طلاب ViT-L (300M)، وViT-B (86M)، وViT-S الذين يقودون التنبؤ الكثيف ضمن فئات الحجم الخاصة بهم.
كيف تعمل نمذجة الحدود المقنعة
تعتمد الطريقة على نموذج التقطير الذاتي DINO/iBOT: يقوم المعلم – نسخة EMA من الطالب – بإنشاء أهداف عبر الإنترنت، ويستعيدها الطالب من وجهات النظر المقنعة.
تعمل نمذجة الصور المقنعة القياسية على إخفاء التصحيحات بشكل عشوائي، متجاهلة ما تصوره كل تصحيح. إن الرقعة الداخلية المسطحة رخيصة الثمن للتعافي من جيرانها. تحمل الرقعة الممتدة على حدود كائن بنية لا يمكن للسياق وحده توفيرها. الحدود هي المناطق الأقل تكرارًا والأكثر إفادة في الصورة – ويعاملها الإخفاء العشوائي مثل أي شيء آخر.
تقوم LingBot-Vision بسد هذه الفجوة بفكرتين.
فرض الحدود. يتنبأ المعلم بحقل حدودي كثيف عبر الإنترنت ويحدد الرموز المميزة الحاملة للحدود B. ويتم فرضها على مجموعة الطالب المقنعة أعلى القناع العشوائي M، مما يعطي القناع المدمج Mâ § = M ∪ B. يتم بعد ذلك توجيه الرموز المميزة المقنعة بواسطة الهندسة: تتلقى الرموز المميزة للحدود هدفًا هندسيًا واضحًا بالإضافة إلى هدف التقطير الذاتي الدلالي، في حين تحافظ الرموز المميزة المقنعة الداخلية على الهدف الدلالي القياسي وحده. هذا التوجيه مهم لأن الهدف الدلالي يكون غامضًا بطبيعته بالضبط حيث تلتقي منطقتان – يتم وضع الهدف الهندسي بشكل جيد على وجه التحديد حيث تكون النمذجة المقنعة التقليدية أضعف، وهو ما يسمح للتمثيلات الدلالية والهندسية بالظهور معًا بدلاً من التنافس.
مجال الحدود الفئوية. يتم تصميم الحدود على شكل مقاطع خطية مرفوعة إلى حقل كثيف: يخزن كل بكسل قريب ناقل سمة a(p) = (d, θ, φ¹, φ²) يسجل المسافة إلى أقرب مقطع وثلاث زوايا تحدد موقعه. ينهار التراجع المباشر لهذا المجال في حلقة المعلم والطالب، ويتمثل الحل في فصل كل قناة إلى صناديق K = 32، وإعادة صياغة التنبؤ بالحدود كتصنيف لكل بكسل – مما يسمح للفرع الحدودي بأن يرث نفس آلية التوسيط والشحذ التي تعمل على استقرار التقطير الذاتي الحديث.
الشكل القاطع له تأثير جانبي أنيق. في ظل فرضية العدم العكسي الكلاسيكية المتمثلة في “عدم وجود بنية”، يتم توزيع اتجاهات الحدود بشكل موحد – وهذا الصفر هو الآن حرفيًا التوزيع الموحد على الصناديق. الانحراف عن التماثل هو دليل على وجود حدود حقيقية، لذا فإن اختبار عدد الإنذارات الكاذبة (NFA) الخالي من المعلمات يتحقق من صحة كل مقطع تم فك تشفيره دون أي تكلفة إضافية. يستغل المعلم هذا في كل تكرار: فهو يفك تشفير المقاطع المرشحة من الحقل الخاص به التنبؤ، ويحتفظ فقط بالناجين المعتمدين من قبل NFA، ويعيد تقديمهم إلى المجال المستهدف – لذلك لا تصبح البنية غير المدعومة أبدًا إشارة تعليمية.
الهدف الكامل يلخص أربعة مصطلحات:
L = L_DINO + λámic  · L_iBOT + λámic¦ · L_bnd + λₖ  · L_KoLeo
المعايير والأداء
تستخدم جميع النتائج الكثيفة أدناه ميزات مجمدة بطبقة خطية واحدة، لذا يُعزى الأداء إلى التمثيل بدلاً من وحدة فك التشفير.
| نموذج | بارامس | NYUv2 RMSE †” | كيتي RMSE †” | ADE20K ميكرو وحدة دولية | مناظر المدينة mIoU | المركبات العضوية المتطايرة mIoU |
| لينجبوت-فيجن ViT-g | 1ب/16 | 0.296 | 2.552 | 53.5 | 79.6 | 87.5 |
| دينوv3 | 7ب/16 | 0.309 | 2.346 | 55.9 | 81.1 | 86.6 |
| V-JEPA 2.1 ViT-G | 2ب/16 | 0.307 | 2.461 | 47.9 | 73.5 | 85.0 |
| AM-RADIOv2.5 | 1ب/14 | 0.340 | 2.918 | 53.0 | 78.4 | 85.4 |
| دينوv2 | 1ب/14 | 0.372 | 2.624 | 49.5 | 75.6 | 83.1 |
| سيجليب 2 | 1ب/16 | 0.494 | 3.273 | 42.7 | 64.8 | 72.7 |
في NYU-Depth v2، تنشر LingBot-Vision أفضل RMSE للمقارنة بأكملها (0.296)، قبل 7B DINOv3 (0.309) مع معلمات أقل بحوالي 7 ×، وقبل 2B V-JEPA 2.1 (0.307). في KITTI هو أفضل نموذج تحت معلمات 2B. في التجزئة الدلالية، فهو على قدم المساواة مع DINOv3 ViT-H+ المقطر – 1.3 mIoU متأخر عن ADE20K، مطابق في Cityscapes، متقدم على VOC12 – مع تحسينه على DINOv2 بنفس الحجم بمقدار 4+ mIoU في جميع المعايير الثلاثة؛ والفجوة الوحيدة المتبقية هي عائلة DINOv3 نفسها (2.4 ميكرو مولار على ADE20K إلى الطراز 7B)، التي تأتي قوتها الكثيفة من التقطير وأهداف الميزات الكثيفة المخصصة.
يستخدم تجزئة كائن الفيديو نشر الملصقات بدون تدريب على الميزات المجمدة. وصلت LingBot-Vision إلى 70.0 J&F على DAVIS-2017 و73.5 على YouTube-VOS – على قدم المساواة مع DINOv3 ViT-H+ (71.1 / 74.0) و7B DINOv3 (71.1 / 74.1)، والأفضل بين جميع النماذج المتبقية على أي نطاق. الرموز المميزة نفسها مستقرة بما يكفي لتتبعها عبر الفيديو بشكل عادي تشابه جيب التمام للميزات المجمدة، دون إشراف زمني.
المقايضة هي التعرف على مستوى الصورة: يصل المسبار الخطي ImageNet-1K إلى 86.32 وk-NN 83.39، متخلفًا عن DINOv3-7B، الذي ينفق قدرته على ثبات مستوى الصورة. تستمر المزايا أيضًا في التقطير – يتطابق طالب 0.3B ViT-L مع 7B DINOv3 على عمق NYUv2 (0.310 مقابل 0.309) مع معلمات أقل بحوالي 23 ×.
حالات الاستخدام وكيفية تحميلها
تخدم رموز التصحيح المجمدة العديد من أعباء العمل الكثيفة مباشرة: يقرأ تقدير العمق الهندسة مباشرة من الميزات، ويستفيد التجزئة الدلالية من انتقالات الميزات التي تصل بالضبط إلى محيط الكائن، ويعمل تجزئة كائن الفيديو من خلال مطابقة رمز تشابه جيب التمام. يعمل جهاز التشفير أيضًا بمثابة التهيئة للتدريب على إكمال العمق في اتجاه مجرى النهر.
تحميل العمود الفقري يتبع المستودع الرسمي:
git clone https://github.com/robbyant/lingbot-vision.git
cd lingbot-vision
conda create -n lingbot-vision python=3.10 -y
conda activate lingbot-vision
python -m pip install -r requirements.txt
python -m pip install -e .
import torch
from lingbot_vision import load_pretrained_backbone, extract_patch_tokens, load_image
device = "cuda" if torch.cuda.is_available() else "cpu"
dtype = torch.bfloat16 if device == "cuda" else torch.float32
# Downloads model.pt from Hugging Face on first use.
backbone, embed_dim = load_pretrained_backbone(
variant="small", # giant | large | base | small; defaults to large
device=device,
dtype=dtype,
)
img_norm, _, _ = load_image(
"examples/example.png",
size=512,
patch_size=backbone.patch_size,
mode="square",
)
patch_tokens, patch_grid = extract_patch_tokens(backbone, img_norm, device, dtype)
print(patch_tokens.shape, patch_grid, embed_dim)
# torch.Size([1, 1024, 384]) (32, 32) 384
تحدد الوسيطة المتغيرة الحجم وتختار الحجم الافتراضي على أنه كبير. patch_tokens الناتج له شكل [B, H*W, C]. المتطلبات هي Python ‰¥ 3.10 وPyTorch ‰¥ 2.0، مع وحدة معالجة الرسومات الموصى بها للأعمدة الأساسية الأكبر حجمًا.
LingBot-Depth 2.0: المردود النهائي
لإظهار ما يشتريه جهاز تشفير الإدراك المكاني الأصلي في اتجاه مجرى النهر، قام الفريق بترقية نظام إكمال العمق الخاص به إلى عمق LingBot 2.0. لم تتغير وصفة نمذجة العمق المقنع عن الإصدار 1.0؛ تم نقل مكونين بالضبط: تم تحويل تهيئة جهاز التشفير من DINOv2 إلى LingBot-Vision (في متغيرات ViT-L وViT-g)، ونمت بيانات التدريب المنسقة من عينات 3M التي تم إصدارها للعامة إلى 150 مليونًا.
حقق هذان التغييران نتائج رائدة عبر 14 معيارًا لإكمال العمق تشمل أنظمة قناع الكتلة والمتفرقة وأجهزة الاستشعار الحقيقية. على DIODE-Indoor المقنع، يتم تخفيض RMSE إلى النصف من 0.132 إلى 0.062. يكون النظام أقوى ما يكون عند التقاط ClearGrasp للأشياء الشفافة (0.010 / 0.012 RMSE) – وهي حالة الفشل الكلاسيكية لاستشعار العمق النشط.
ومن الجدير بالذكر أن التغييرين يتضاعفان بدلاً من الإلغاء: مع نمو بيانات التدريب من 3 مليون إلى 150 مليون، فإن المنحنى الذي تم تهيئة DINOv2 يتشبع بما يتجاوز 20 مليون عينة بينما يستمر منحنى LingBot-Vision في التحسن. فالمزيد من البيانات يؤدي إلى تضخيم ميزة نقطة البداية الأفضل، بدلاً من محوها.
الوجبات السريعة الرئيسية
- تجعل LingBot-Vision الحدود بمثابة إشارة تدريب مسبقة أصلية، يتم تمهيدها من صور أولية بدون تسميات أو كاشفات حواف أو أعمدة أساسية مدربة مسبقًا.
- يتيح فرض الحدود بالإضافة إلى حقل الحدود الفئوي ظهور الهندسة والدلالات معًا – ويؤدي إلى اختبار التحقق من صحة NFA بدون معلمات مجانًا.
- ينشر العمود الفقري 1B أفضل NYU-Depth v2 RMSE في مقارنته، قبل 7B DINOv3، أثناء التدريب على مجموعة أصغر حجمًا.
- تستمر المزايا في التقطير: يتطابق 0.3B ViT-L مع 7B DINOv3 في NYUv2 مع معلمات أقل بحوالي 23 ×.
- يؤدي تبديل بيانات التشفير والقياس فقط إلى وصول LingBot-Depth 2.0 إلى نتائج رائدة في 14 معيارًا لإكمال العمق، وتتسع حافة التشفير بمزيد من البيانات.
- يتم شحن الأوزان ضمن Apache-2.0 بأحجام ViT-g/L/B/S لكل ميزانية نشر.
الشرح الديناميكي التفاعلي
تحقق من ورق و الأوزان النموذجية. أيضًا، لا تتردد في متابعتنا على تغريد ولا تنسى الانضمام إلينا 150 ألف + مل§ والاشتراك في النشرة الإخبارية لدينا. انتظر! هل أنت على برقية؟ الآن يمكنك الانضمام إلينا على التليجرام أيضًا.
هل تحتاج إلى الشراكة معنا للترويج لصفحة GitHub Repo أو صفحة الوجه المعانقة أو إصدار المنتج أو الندوة عبر الويب وما إلى ذلك؟ تواصل معنا
ملحوظة: شكرًا لفريق Ant Research على القيادة الفكرية/الموارد الخاصة بهذه المقالة. لقد دعم فريق Ant Research هذا المحتوى/المقالة للترقية.
اكتشاف المزيد من كحيل | أخبار التقنية
اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.
