تتباطأ معظم نماذج التعرف الضوئي على الحروف (OCR) الشاملة مع نمو الإنتاج. يضيف كل رمز مميز تم إنشاؤه إلى ذاكرة التخزين المؤقت KV. ترتفع الذاكرة ويتأخر الجيل. يصبح تحليل عشرات الصفحات غير عملي. بايدو التعرف الضوئي على الحروف غير محدود يعالج هذا مباشرة. يقوم بتبديل انتباه وحدة فك التشفير لتصميم يحافظ على ثبات الذاكرة.
ليرة تركية؛ د
- يعد OCR غير المحدود نموذجًا لمزيج من الخبراء مكون من 3B معلمات، مع 500 مليون معلمة نشطة فقط.
- فهو يستبدل انتباه وحدة فك التشفير بميزة تنبيه النافذة المنزلقة المرجعية (R-SWA)، مما يحافظ على ثبات ذاكرة التخزين المؤقت KV.
- يقوم النموذج بتوزيع عشرات الصفحات في تمريرة أمامية واحدة بحد أقصى يبلغ 32 كيلو بايت.
- لقد سجل 93.23 على OmniDocBench v1.5، متغلبًا على خط الأساس DeepSeek OCR بمقدار 6.22 نقطة.
- إنه يعتمد على DeepSeek OCR من خلال التدريب المستمر، وليس من الصفر.
ما هو التعرف الضوئي على الحروف غير المحدود؟
يأخذ برنامج OCR غير المحدود DeepSeek OCR كخط أساس له. إنه يحتفظ بـ DeepEncoder ووحدة فك ترميز Mixture-of-Experts. يحتوي تصميم MoE على إجمالي 3B من المعلمات ولكنه ينشط 500M فقط عند الاستدلال.
DeepEncoder هو محرك الضغط. إنه يتسلسل SAM-ViT تحت انتباه النافذة مع CLIP-ViT تحت الاهتمام العالمي. عند الجسر، يتم تطبيق ضغط الرمز المميز بمقدار 16×. تصبح صورة PDF مقاس 1024×1024 مجرد 256 رمزًا مرئيًا. عدد أقل من رموز الإدخال يعني تعبئة مسبقة أصغر.
يدعم DeepEncoder أصلاً خمسة أوضاع للدقة، ويحتفظ برنامج Unlimited OCR بوضعين. يعمل الوضع “الأساسي” على 1024×1024 للعمل متعدد الصفحات. يستخدم وضع “Gundam” الدقة الديناميكية للصفحات الفردية.

كيف يحافظ R-SWA على ثبات ذاكرة التخزين المؤقت
المساهمة هي مرجع النافذة المنزلقة. يقوم نظام Multi-Head Attention القياسي بتخزين مفتاح وقيمة لكل رمز مميز. مع نمو طول الإخراج T، تنمو ذاكرة التخزين المؤقت معه. الحجم هو CMHA(ت) = لم + T. الذاكرة وتسلق الكمون بلا حدود.
يكسر R-SWA هذا الارتباط. يعتني كل رمز مميز يتم إنشاؤه بجميع الرموز المميزة، أي الرموز المرئية والموجه. كما أنه يهتم أيضًا برموز الإخراج n السابقة، حيث يكون n افتراضيًا هو 128. ويتم إخلاء كل شيء أقدم. تصبح ذاكرة التخزين المؤقت قائمة انتظار ثابتة بحجم m + n.
الحجم هو Cآر-سوا(ت) = لم + دقيقة (ن، تي) ≥ لترم + ن. ويحدها ثابت. ومع نمو T إلى ما هو أبعد من n، تتجه نسبة ذاكرة التخزين المؤقت نحو الصفر. لذلك تظل الذاكرة ثابتة ويظل زمن الوصول لكل خطوة ثابتًا.
وقارن فريق البحث هذا بالنسيان الناعم. يقوم الشخص الذي ينسخ كتابًا بإلقاء نظرة سريعة على المصدر والكلمات القليلة الأخيرة. إنهم لا يعيدون قراءة كل ما تم نسخه حتى الآن. لا تخضع الرموز المرئية مطلقًا لتحديثات الحالة. وهذا يتجنب التشويش التدريجي الذي يظهر في الانتباه الخطي. يتيح لك جهاز المحاكاة التفاعلي أدناه تغيير T ومشاهدة استجابة كلا ذاكرة التخزين المؤقت.
كيف تم تدريبه
لم يتم تدريب تقنية OCR غير المحدودة من البداية. واصل فريق البحث تدريبه من نقطة تفتيش DeepSeek OCR لمسافة 4000 خطوة. لقد قاموا بتجميد DeepEncoder وقاموا بتدريب وحدة فك التشفير فقط. تم استخدام حوالي مليوني عينة من المستندات في التدريب على وحدات معالجة الرسومات 8×16 A800. فضل التقسيم بنسبة 9:1 بيانات الصفحة الواحدة، مع عينات متعددة الصفحات تم إنشاؤها عن طريق التسلسل.
المعيار
يقوم فريق البحث بالتقييم على OmniDocBench v1.5 وv1.6. النتيجة/الإحصائيات الرئيسية هي 93.23 بشكل عام على الإصدار 1.5. وهذا يتفوق على خط الأساس DeepSeek OCR بمقدار 6.22 نقطة. يقارن الجدول أدناه النماذج الثلاثة ذات الصلة. الثلاثة يشتركون في نفس الحجم 3B-A0.5B.
| متري (الإصدار 1.5) | ديب سيك-التعرف الضوئي على الحروف | ديب سيك- التعرف الضوئي على الحروف 2 | غير محدود التعرف الضوئي على الحروف |
|---|---|---|---|
| الشامل ↑ | 87.01 | 89.17 | 93.23 |
| تحرير النص ↓ | 0.073 | 0.049 | 0.038 |
| صيغة آلية التنمية النظيفة ↑ | 83.37 | 86.85 | 92.61 |
| جدول TEDS ↑ | 84.97 | 85.60 | 90.93 |
| قراءة ترتيب التحرير ↓ | 0.086 | 0.060 | 0.045 |
في الإصدار 1.6 من OmniDocBench، يصل معدل التعرف الضوئي على الحروف غير المحدود إلى 93.92 بشكل عام. هذه هي أعلى نتيجة في مقارنة الإصدار 1.6 من الورقة البحثية. يتم الاحتفاظ بالمكاسب عبر التعرف على النص والصيغة والجدول.
تتحسن السرعة أيضًا. في OmniDocBench في الوضع الأساسي، تصل سرعة Unlimited OCR إلى 5,580 إطارًا في الثانية مقابل 4,951 إطارًا في الثانية لـ DeepSeek OCR. أي بزيادة قدرها 12.7%. وتتسع الفجوة مع إنتاج أطول. عند سقف إنتاج يبلغ 6000 رمز، يتخلف DeepSeek OCR عن Unlimited OCR بنسبة 35%.
حيث يناسب: حالات الاستخدام
تناسب ذاكرة التخزين المؤقت الثابتة أعباء العمل التي تتعامل معها الأنظمة صفحة تلو الأخرى بشكل سيئ.
- نسخ الكتاب كاملا: قم بتغذية أكثر من 40 صفحة وتحليلها في مسار واحد مستمر. تظل مسافة التحرير المُبلغ عنها أقل من 0.11 عند أكثر من 40 صفحة، مع نسبة 96.90% مميزة -35.
- وثيقة تحليل خطوط الأنابيب: استخراج النص والجداول والصيغ وترتيب القراءة في تمريرة أمامية واحدة.
- تحليل دفعة عالية الإنتاجية: المتضمنة
infer.pyيقوم بتشغيل خادم SGLang ويرسل طلبات متزامنة عبر مجلد أو ملف PDF. - ما وراء التعرف الضوئي على الحروف: أطلق فريق البحث على R-SWA اهتمامًا تحليليًا عامًا، ينطبق على ASR والترجمة.
تشغيله: الحد الأدنى من التعليمات البرمجية
يحتاج مسار المحولات trust_remote_code=True ووحدة معالجة الرسومات CUDA. يستخدم تحليل الصورة الفردية وضع Gundam.
import torch
from transformers import AutoModel, AutoTokenizer
name = "baidu/Unlimited-OCR"
tokenizer = AutoTokenizer.from_pretrained(name, trust_remote_code=True)
model = AutoModel.from_pretrained(
name, trust_remote_code=True, use_safetensors=True,
torch_dtype=torch.bfloat16,
).eval().cuda()
model.infer(
tokenizer,
prompt="<image>document parsing.",
image_file="your_image.jpg",
output_path="your/output/dir",
base_size=1024, image_size=640, crop_mode=True, # gundam mode
max_length=32768,
no_repeat_ngram_size=35, ngram_window=128,
save_results=True,
)
مكالمة تحليل متعددة الصفحات وPDF model.infer_multi في الوضع الأساسي في image_size=1024. بالنسبة لإنتاجية الإنتاج، تقدم SGLang واجهة برمجة تطبيقات متوافقة مع OpenAI باستخدام fa3 الخلفية الاهتمام.
نقاط القوة والضعف
نقاط القوة:
- تحافظ ذاكرة التخزين المؤقت KV الثابتة على الذاكرة وزمن الوصول بشكل ثابت عبر المخرجات الطويلة.
- نتائج SOTA شاملة على OmniDocBench v1.5 وv1.6.
- فقط 500 مليون معلمة نشطة تجعل الاستدلال رخيصًا.
- ترخيص MIT والأوزان المفتوحة والمحولات المزدوجة بالإضافة إلى دعم SGLang.
- تصل مكاسب R-SWA دون تكلفة دقة مُقاسة على الصفحات الفردية.
نقاط الضعف:
- التحليل ليس غير محدود حقًا؛ لا يزال سياق 32 كيلو بايت يحد من التعبئة المسبقة.
- تتزايد عمليات التعبئة المسبقة الطويلة مع تراكم عدد الصفحات، على الرغم من الضغط الشديد.
- يستخدم التشغيل متعدد الصفحات الوضع الأساسي فقط، لذلك يمكن تفويت النص الصغير جدًا.
- ويظل ASR ونقل الترجمة بمثابة عمل مستقبلي، وليس نتيجة مشحونة.
تحقق من ورق, الريبو و الأوزان النموذجية. أيضا، لا تتردد في متابعتنا على تغريد ولا تنسى الانضمام إلينا 150 ألف + مل والاشتراك في النشرة الإخبارية لدينا. انتظر! هل أنت على برقية؟ الآن يمكنك الانضمام إلينا على التليجرام أيضًا.
هل تحتاج إلى الشراكة معنا للترويج لصفحة GitHub Repo أو صفحة الوجه المعانقة أو إصدار المنتج أو الندوة عبر الويب وما إلى ذلك؟ تواصل معنا
اكتشاف المزيد من كحيل | أخبار التقنية
اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.
