لا تزال معظم بيانات المؤسسة موجودة داخل ملفات PDF وعمليات المسح الضوئي ومجموعات الشرائح. لا يمكن لنماذج اللغة الكبيرة والوكلاء استخدام تلك البيانات حتى تصبح JSON منظمة. أصبح استخراج المستندات مفتوحة المصدر الطريقة القياسية لإجراء هذا التحويل على أجهزتك الخاصة.
هناك مشكلتان مختلفتان تختبئان تحت العبارة “PDF to JSON”. الأول هو استخراج يحركها المخطط: تقوم بتحديد الحقول، ويقوم النموذج بملئها بالقيم. والثاني هو تحليل الوثيقة: يقوم النموذج بإعادة بناء الصفحة إلى JSON أو Markdown منظم. تحتاج معظم الفرق إلى واحد، وفي بعض الأحيان تحتاج إلى كليهما. اختيار الفئة الخاطئة يكلف الوقت الحقيقي.
الأوزان المفتوحة مهمة هنا من حيث التكلفة والخصوصية. يمكن أن تكلف واجهات برمجة التطبيقات الخاصة آلاف الدولارات لكل مليون صفحة، وتتطلب إرسال المستندات خارج الشركة. تعمل النماذج المحلية على إزالة كلا القيود. فيما يلي النماذج ومجموعات الأدوات التي تستحق التقييم، مجمعة حسب ما يفعلونه بالفعل.
فئتان، عبارة واحدة
يأخذ الاستخراج المستند إلى المخطط مستندًا ومخطط JSON، ثم يُرجع قيمًا لحقولك. استخدمه للفواتير والنماذج والعقود والإيصالات، حيث تعرف الحقول مسبقًا.
تحليل المستند يعيد بناء المستند نفسه. يكتشف التخطيط وترتيب القراءة والجداول والصيغ والتعليمات البرمجية، ثم يصدر JSON أو Markdown. استخدمه لإعداد مجموعة نظيفة من أجل توليد الاسترجاع المعزز (RAG) والوكلاء.
رفع Datalab
المصعد هو نموذج رؤية 9B من Datalab، الفريق الذي يقف وراء Marker وSurya. يمكنك تمرير مخطط JSON ورفع إرجاعات JSON التي تطابقه. يضمن فك التشفير المقيد بالمخطط أن يكون الإخراج صالحًا لـ JSON. تم بناء النموذج على Qwen 3.5 ويتم تشغيله محليًا من خلال Hugging Face أو عن بعد من خلال خادم vLLM.
فهو يتعامل مع المستندات متعددة الصفحات في مسار واحد، بما في ذلك القيم التي تمتد عبر الصفحات. إنه يشحن CLI، وPython API، وSchema Studio Streamlit لبناء المخططات واختبارها.
pip install lift-pdf
# Start the vLLM server, then extract to your schema
lift_vllm
lift_extract input.pdf ./output --schema schema.json
from lift import extract
result = extract("document.pdf", "schema.json")
if result.extraction is not None:
data = result.extraction # dict matching your schema
في معيار Datalab المكون من 225 مستندًا، يصل الرفع إلى دقة ميدانية تصل إلى 90.2% عند زمن وصول متوسط يبلغ 9.5 ثانية. وهو يتفوق على NuExtract3 (81.5%) وQwen3.5-9B (76.3%) في الدقة الميدانية. وهو يتخلف عن Gemini Flash 3.5 (91.3%) وDatalab API المستضاف (95.9%). لاحظ أن دقة المستند الكامل تظل منخفضة بالنسبة لجميع الطرز المحلية، حيث يصل الرفع إلى 20.9%. يظل الحصول على كل حقل بشكل صحيح في مستند واحد أمرًا صعبًا.
الرمز هو أباتشي-2.0. تستخدم الأوزان ترخيص OpenRAIL-M المعدل، وهو مجاني للبحث والاستخدام الشخصي والشركات الناشئة التي تقل قيمتها عن 5 ملايين دولار من التمويل أو الإيرادات. تحتاج الاستضافة الذاتية التجارية إلى ترخيص، ولا يمكن استخدام الأوزان بشكل تنافسي مع Datalab API.
NuExtract 3 هو نموذج لغة رؤية 4B من NuMind. إنه يوحد مهمتين في نموذج واحد: الاستخراج المنظم (المستند إلى JSON) واستخراج المحتوى (OCR إلى Markdown). يمكنك تقديم مدخلات وقالب JSON يصف الحقول التي تحتاجها. تم تدريب النموذج من خلال التعلم المعزز لإضافة منطق خاص بالاستخراج، والذي يمكنك تشغيله أو إيقافه حسب الطلب.
NuExtract 3 متعدد الوسائط ومتعدد اللغات ويعتمد على العمود الفقري Qwen. إنه يعمل من خلال vLLM مع واجهة برمجة التطبيقات المتوافقة مع OpenAI، كما يتوفر Python SDK عبر pip install numind. تضعه NuMind كنموذج مرجعي مفتوح لكل من استخراج المحتوى والمنظم بحجمه. تحقق من البطاقة النموذجية لمعرفة شروط الترخيص الدقيقة قبل الاستخدام التجاري.
الفئة 2: تحليل المستند إلى JSON وMarkdown المنظمين
آي بي إم دوكلينج
بدأ Docling في IBM Research ويتم استضافته الآن بواسطة LF AI & Data Foundation. يقوم بتحليل ملفات PDF وDOCX وPPTX وXLSX وHTML والصور والمزيد. تتضمن تنسيقات الإخراج Markdown وHTML وJSON بدون فقدان البيانات وDocTags. جوهرها هو تمثيل DoclingDocument، الذي يحافظ على التخطيط وترتيب القراءة والجداول والصيغ مثل LaTeX.
يعمل Docling محليًا في البيئات ذات الفجوات الهوائية. فهو يتكامل مع LangChain وLlamaIndex وCrew AI وHaystack، ويشحن خادم MCP ووضع Docling Service. يحمل المشروع رخصة MIT متساهلة. تقدم IBM أيضًا إصدارًا مُدارًا من خلال Watsonx.
آي بي إم جرانيت-دوكلينج-258M
Granite-Docling-258M هو نموذج مدمج للغة الرؤية يبلغ طوله 258 مليونًا من شركة IBM. يقوم بإجراء تحويل مستند مرة واحدة داخل خطوط أنابيب Docling. على الرغم من حجمه، فإنه يتعامل مع التعرف الضوئي على الحروف والتخطيط والجداول والتعليمات البرمجية والمعادلات ويخرج DocTags. على وحدة معالجة الرسوميات A100، يبلغ متوسطها حوالي 0.35 ثانية لكل صفحة.
يعتمد النموذج على بنية Idefics3، مع جهاز تشفير SigLIP2 وعمود فقري للغة Granite 165M. تم إصداره ضمن Apache 2.0. تنص شركة IBM على أنها مصممة لتحويل المستندات، وليس لفهم الصور بشكل عام.
OpenDataLab MinerU
يقوم MinerU، من OpenDataLab وShanghai AI Laboratory، بتحويل مدخلات PDF، والصور، وDOCX، وPPTX، وXLSX إلى Markdown وJSON. فهو يجمع بين خط أنابيب المعالجة ونموذج لغة الرؤية. يستهدف النموذج الحالي، MinerU2.5-Pro، التحليل عالي الدقة للتخطيطات المعقدة، بما في ذلك الجداول والمخططات عبر الصفحات.
قامت MinerU مؤخرًا بتغيير ترخيصها. لقد انتقل من AGPL-3.0 إلى “ترخيص MinerU مفتوح المصدر”، وهو ترخيص مخصص يعتمد على Apache 2.0 مع شروط إضافية. وهذا التغيير يقلل من الاحتكاك بالنشر التجاري.
علامة داتالاب
Marker هو خط أنابيب Datalab لتحويل المستندات إلى Markdown وJSON وchunks وHTML. وهو يدعم ملفات PDF، والصور، وPPTX، وDOCX، وXLSX، وHTML، وEPUB. يقوم بتنسيق الجداول والنماذج والمعادلات والرياضيات المضمنة والروابط والتعليمات البرمجية. اختياري --use_llm يضيف العلم نموذج لغة لتحسين الجداول والنماذج.
في مجموعة olmOCR-Bench التابعة لجهة خارجية، سجل Marker حوالي 76.1. رمزها هو GPL-3.0، وتستخدم أوزان طرازها ترخيص AI Pubs OpenRAIL-M المعدل. ترخيص الوزن هذا مجاني للبحث والاستخدام الشخصي والشركات الناشئة التي تقل قيمتها عن 2 مليون دولار من التمويل أو الإيرادات. تعمل منصة Datalab المُدارة الآن على تشغيل نموذج التعرف الضوئي على الحروف الأحدث، Chandra، وهو Apache-2.0 ويقوم بإخراج HTML وMarkdown وJSON.
Ai2 أولموكر 2
olmOCR 2 هو نموذج لغة رؤية متخصص 7B OCR من معهد Allen للذكاء الاصطناعي (Ai2). يقوم بتحويل ملفات PDF إلى نص نظيف وMarkdown مع الحفاظ على ترتيب القراءة. فهو يتعامل مع الجداول والمعادلات والكتابة اليدوية عبر تخطيطات معقدة متعددة الأعمدة. تم تدريب النموذج من خلال التعلم المعزز من المكافآت التي يمكن التحقق منها، وذلك باستخدام اختبارات الوحدة الاصطناعية كإشارة للمكافأة.
حصل olmOCR 2 على 82.4 نقطة على منصة olmOCR-Bench الخاصة به، من بين أعلى النتائج المنشورة في تلك المجموعة. تقدر Ai2 التكلفة بحوالي 178 دولارًا لكل مليون صفحة على وحدات معالجة الرسومات الخاصة بك. مجموعة الأدوات و allenai/olmOCR-2-7B-1025 الأوزان هي Apache-2.0. النموذج الحالي يركز على اللغة الإنجليزية.
DeepSeek DeepSeek-OCR
DeepSeek-OCR هو نموذج OCR مفتوح من DeepSeek، تم إصداره في أكتوبر 2025. وهو يقدم “الضغط البصري للسياقات”، والذي يمثل الصفحات الغنية بالنص كرموز رؤية مدمجة، ثم يقوم بفك تشفيرها مرة أخرى إلى نص. يتيح ذلك لها معالجة المستندات الطويلة برموز أقل بكثير من نماذج لغة الرؤية النموذجية.
يستخدم DeepEncoder بالإضافة إلى وحدة فك ترميز 3B Mixture-of-Experts التي تقوم بتنشيط حوالي 570 مليون معلمة لكل رمز مميز. اعتمادًا على الموجه، يقوم بإخراج نص عادي أو Markdown أو جداول HTML أو JSON منظم، ويدعم أكثر من 100 لغة. يتم إصدار الكود بموجب ترخيص MIT. وصلت المتابعة، DeepSeek-OCR2، في يناير 2026.
خيار الأغراض العامة: Qwen3-VL
Qwen3-VL من Alibaba ليس نموذجًا خاصًا بالمستند. إنها سلسلة عامة متعددة الوسائط تستخدمها العديد من نماذج الاستخراج كقاعدة. يمكنك مطالبته بإرجاع Markdown أو JSON أو التعليمات البرمجية من الصفحة. يتم شحن معظم الأحجام ضمن Apache 2.0. إنه بديل مرن عندما لا يكون النموذج المتخصص مناسبًا، على الرغم من أنه يحتاج إلى المزيد من الهندسة السريعة ويقدم ضمانات أقل للإنتاج.
كيف تقارن الخيارات
| نموذج | منظمة | مقاس | ماذا يفعل | الإخراج الأساسي | رخصة |
|---|---|---|---|---|---|
| يرفع | داتالاب | 9 ب | استخراج يحركها المخطط | JSON إلى المخطط الخاص بك | كود Apache-2.0 / أوزان OpenRAIL-M |
| نو اكستراكت 3 | نوميند | 4 ب | استخراج المخطط + التعرف الضوئي على الحروف | JSON + تخفيض السعر | الأوزان المفتوحة (انظر البطاقة) |
| التوثيق | IBM/LF الذكاء الاصطناعي والبيانات | خط أنابيب | تحليل التخطيط | تخفيض السعر، JSON، DocTags | معهد ماساتشوستس للتكنولوجيا |
| الجرانيت دوكلينغ | آي بي إم | 258 م | تحويل طلقة واحدة | DocTags، تخفيض السعر | أباتشي-2.0 |
| مينر يو | OpenDataLab | ~1.2B VLM | تحليل التخطيط | تخفيض السعر، JSON | ترخيص MinerU مفتوح المصدر |
| علامة | داتالاب | خط أنابيب | تحليل التخطيط | تخفيض السعر، JSON، HTML | كود GPL-3.0 / أوزان OpenRAIL-M |
| أولم أو سي آر 2 | Ai2 | 7 ب | التعرف الضوئي على الحروف إلى النص | نص عادي، تخفيض السعر | أباتشي-2.0 |
| ديب سيك-التعرف الضوئي على الحروف | ديب سيك | 3B MoE (حوالي 570 مليونًا نشطًا) | التعرف الضوئي على الحروف (OCR) مع ضغط الرمز المميز | النص، تخفيض السعر، JSON | معهد ماساتشوستس للتكنولوجيا (رمز) |
| Qwen3-VL | علي بابا | 2ب-235ب | عام VLM | تخفيض السعر، JSON، الكود | أباتشي-2.0 (معظم الأحجام) |
ملاحظة حول المعايير: تأتي هذه الأرقام من مجموعات مختلفة ولا يمكن مقارنتها بشكل مباشر. نسبة الرفع 90.2% هي الدقة الميدانية وفقًا لمعيار استخراج مخطط Datalab. تقيس درجات olmOCR-Bench لـ olmOCR 2 (82.4) وMarker (76.1) استخلاص المحتوى من خلال تسجيل نقاط اختبار الوحدة. قم بتشغيل المستندات الخاصة بك من خلال كل مرشح قبل اتخاذ القرار.
شرح Marktechpost
يخفي “PDF to JSON” وظيفتين مختلفتين. يقوم الاستخراج المعتمد على المخطط بملء الحقول التي تحددها. يؤدي تحليل المستند إلى إعادة بناء الصفحة إلى JSON أو Markdown. قم بالتصفية حسب المهمة والترخيص، ثم افتح أي ريبو.
استخراج يحركها المخطط
تحليل الوثيقة
VLM للأغراض العامة
المعايير ليست قابلة للمقارنة مباشرة. نسبة الرفع 90.2% هي الدقة الميدانية وفقًا لمعيار مخطط Datalab. تقيس درجات olmOCR-Bench لـ olmOCR 2 (82.4) وMarker (76.1) استخلاص المحتوى من خلال اختبارات الوحدة. قم بتشغيل المستندات الخاصة بك قبل الاختيار.
الوجبات السريعة الرئيسية
- يعد الاستخراج المعتمد على المخطط (الحقول إلى القيم) وتحليل المستندات (التخطيط إلى JSON) مهمتين مختلفتين.
- رفع وNuExtract 3 الهدف JSON يحركها المخطط؛ بقية تحليل الوثيقة الهدف.
- تقوم Docling وMinerU وMarker وolmOCR 2 وDeepSeek-OCR بتحليل المستندات إلى Markdown أو JSON منظم.
- التراخيص تختلف على نطاق واسع. انتقلت MinerU من AGPL-3.0 في عام 2026، ورخصت كود تقسيم الرفع والعلامة وتراخيص وزن النموذج.
- تأتي المعايير المنشورة من مجموعات مختلفة، لذا تعامل مع النتائج المشتركة بين النماذج على أنها إرشادية وليست قابلة للمقارنة.
ميشال سوتر متخصص في علوم البيانات وحاصل على درجة الماجستير في علوم البيانات من جامعة بادوفا. بفضل أساس متين في التحليل الإحصائي والتعلم الآلي وهندسة البيانات، تتفوق ميشال في تحويل مجموعات البيانات المعقدة إلى رؤى قابلة للتنفيذ.
اكتشاف المزيد من كحيل | أخبار التقنية
اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.
