أصدرت Liquid AI جهازي تشفير ثنائي الاتجاه مفتوحي الوزن، LFM2.5-Encoder-230M وLFM2.5-Encoder-350M. كلاهما عبارة عن نماذج لغة مقنعة مبنية على العمود الفقري الهجين LFM2. كلاهما يحمل سياقًا مكونًا من 8192 رمزًا.
توجد أجهزة التشفير أسفل المصنفات وأجهزة توجيه الأهداف ومرشحات الأمان وكاشفات معلومات تحديد الهوية الشخصية (PII). تعمل هذه المهام بشكل مستمر، عادةً بدون وحدة معالجة الرسومات، وبشكل متزايد على مدخلات أطول. أنشأ بيرت الفصل. لقد عززت ModernBERT دقتها وسرعتها وسياقها. حجة Liquid AI هي أن بنية LFM2 تواصل هذا الخط، لأن تكلفتها تنمو بشكل أبطأ مع زيادة طول المدخلات.
كيف أصبح جهاز فك التشفير جهاز تشفير
لم يتم تدريب أجهزة التشفير من الصفر. تتم تهيئتها من العمود الفقري لجهاز فك التشفير LFM2.5-230M وLFM2.5-350M، ثم تم التحويل بثلاثة تغييرات:
- أولاً، يتم استبدال قناع الاهتمام السببي بقناع ثنائي الاتجاه، بحيث ينتبه كل رمز إلى كلا الجانبين.
- ثانيًا، يتم إنشاء التلافيف القصيرة لـ LFM2 بشكل غير سببي باستخدام حشوة مركزية متماثلة، بحيث يتم خلط تلافيف كل رمز مميز في الجيران على كلا الجانبين.
- ثالثًا، يتم تدريب النموذج باستخدام هدف نمذجة لغة مقنعة بمعدل قناع يبلغ 30%. وهذا أكثر كثافة من 15% الخاصة بـ BERT، بعد الأدلة التي تشير إلى أن معدل القناع الأعلى يساعد على هذا المقياس.
يتم التدريب على مرحلتين:
- تحدد المرحلة الأولى الكفاءة اللغوية العامة من خلال هدف الامتيازات والرهونات البحرية ذو السياق القصير على مجموعة كبيرة من الويب تحتوي على 1024 رمزًا.
- تعمل المرحلة الثانية على توسيع السياق إلى 8,192 رمزًا مميزًا في مزيج البيانات الكامل، مما يعزز الكفاءة الواقعية والقانونية ومتعددة اللغات.
من الناحية المعمارية، يقوم العمود الفقري بتشذير كتل الالتواء القصيرة ذات البوابات مع الاهتمام بالاستعلام المجمع، وهو نفس التصميم الموضح في التقرير الفني لـ LFM2. تستخدم نقطتا التفتيش حجمًا مخفيًا يبلغ 1024 ومفردات مكونة من 65,536 رمزًا، وتدعمان 15 لغة. الترخيص هو ترخيص LFM المفتوح v1.0.
يشرح التضمين أدناه التحويل، وجدول التصنيف الكامل، ونتائج كل مهمة، وأرقام زمن استجابة وحدة المعالجة المركزية.
النتائج المرجعية
قام Liquid AI بتقييم 14 نموذجًا في 17 مهمة مأخوذة من GLUE وSuperGLUE والتصنيف متعدد اللغات. يتم ضبط كل نموذج بشكل كامل لكل مهمة، والنتيجة المبلغ عنها هي نتيجة ذلك النموذج الذي تم ضبطه بدقة.
يسجل LFM2.5-Encoder-350M متوسط 17 مهمة يبلغ 81.02 (±1.00)، ليحتل المرتبة الرابعة. النماذج الثلاثة التي أمامها كلها أكبر. هم XLM-R XL عند 3.5B (83.06)، ModernBERT-كبير عند 395M (81.68)، و XLM-R كبير عند 560M (81.34). النموذج العلوي هو ما يقرب من 10 أضعاف حجمه.
سجل LFM2.5-Encoder-230M 79.29 (±1.02)، ليحتل المرتبة السادسة. إنه يتفوق على قاعدة ModernBERT عند 78.19 وكل طراز EuroBERT في الجدول، بما في ذلك EuroBERT-610M (75.87) وEuroBERT-2.1B (72.19). يسجل كلا التشفيرين الجديدين أيضًا نتائج أعلى من نظيرات الاسترجاع الخاصة بـ Liquid AI، LFM2.5-ColBERT-350M (76.18) وLFM2.5-Embedding-350M (75.68). هذه الفجوة هي السبب المعلن وراء قيام Liquid AI ببناء برنامج تشفير للأغراض العامة بدلاً من إعادة استخدام المستردات.
المنهجية هي الجزء الأكثر إثارة للاهتمام، وهي مفتوحة المصدر ضمن Apache-2.0. يتم تحميل كل طراز بأوزان رئيسية fp32 وبث تلقائي bf16، لذا يقارن الجدول بين النماذج بدلاً من تنسيقات الأرقام. يستخدم كل نموذج نفس وصفة AdamW، المأخوذة من بطاقة EuroBERT. يتم تحديد معدل التعلم لكل نموذج ومهمة عبر 10 معدلات و3 بذور. يتم بعد ذلك تسجيل الدرجات كمتوسط لأكثر من 5 بذور طازجة لم تمس الاختيار مطلقًا. ال transformers تم تثبيت الإصدار على 4.56.2 لذا فإن انحراف التبعية ليس متغيرًا غير متحكم فيه.
حالات الاستخدام وبيئات النشر
يسمي الإصدار ثلاثة إعدادات. تأتي الأجهزة الطرفية والأجهزة المدمجة في المقام الأول. لا تحتوي الحوسبة الموجودة على متن السيارة أو وحدة التحكم الصناعية على وحدة معالجة رسومات احتياطية، ولا يمكنها تحمل تكلفة رحلة ذهابًا وإيابًا على السحابة. الأنظمة المنظمة والمحلية في مجالات التمويل والرعاية الصحية والقانونية، حيث تكون المستندات طويلة وحساسة ولا يمكن أن تترك البنية التحتية الداخلية. وخطوط الأنابيب ذات الحجم الكبير والحساسة للتكلفة، حيث يعمل جهاز التشفير الصغير بمثابة ممر أول رخيص أمام نموذج أكبر.
يضع Liquid AI أيضًا رقمًا مفيدًا في نافذة السياق: 8,192 رمزًا مميزًا تقريبًا من 13 إلى 15 صفحة. يغطي التمرير الأمامي عقدًا كاملاً أو سجلًا كاملاً للمريض.
لإظهار الشكل الذي يبدو عليه جهاز التشفير الدقيق، أرسل فريق البحث خمسة عروض توضيحية. يعمل كل منها في مساحة تعانق وحدة المعالجة المركزية فقط. وهي تغطي التوجيه الفوري بدون إطلاق النار، وفحص سياسة الإطلاق الصفري، والتدقيق الإملائي. يتعامل كاشف PII مع 40 نوعًا من المعلومات عبر 16 لغة. يعمل العرض التوضيحي الإضافي للنشر المقنع على تشغيل برنامج التشفير كبرنامج دردشة آلي يتم إنشاؤه عن طريق الكشف المتكرر.
جعلهم يركضون
يتم تحميل كلا التشفيرين transformers. الجسم مكشوف كما هو Lfm2BidirectionalModel واستخدامات التحميل المقنعة LM Lfm2BidirectionalForMaskedLM. كلاهما سلكي من خلال auto_map، لذا trust_remote_code=True مطلوب في كل مكالمة تحميل.
ينتج برنامج التشفير الأساسي تمثيلات للأغراض العامة، وليس مخرجات المهام، لذا يعد الضبط الدقيق أمرًا إلزاميًا. يستعرض البرنامج التعليمي للضبط الدقيق لـ Liquid AI المستندات القانونية الطويلة بتكوين سياق 8K. إن إرشادات اختيار النموذج واضحة ومباشرة: 350 ميجا بايت عندما تكون الدقة أكثر أهمية، و230 ميجا بايت للأجهزة الأكثر إحكامًا أو الإنتاجية الأعلى.
اكتشاف المزيد من كحيل | أخبار التقنية
اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.
