Mistral OCR 4؛ هوش سند ساخت‌یافته

پ

پژوهش ژرف ای‌آی

میز انتشار مدل

۲ تیر ۱۴۰۵به‌روزرسانی ۱۵ مرداد ۱۴۰۵۶ دقیقه مطالعه
Mistral OCR 4؛ هوش سند ساخت‌یافته

Mistral AI در ۲۳ ژوئن ۲۰۲۶، برابر با ۲ تیر ۱۴۰۵ OCR 4 را به‌عنوان مدل متمرکز فهم سند منتشر کرد. اعلام رسمی امتیاز ۸۵٫۲۰ در OlmOCRBench، امتیاز ۹۳٫۰۷ در OmniDocBench و نرخ برد متوسط ۷۲ درصد در ترجیح انسانی کور را گزارش می‌کند. مدل ۱۷۰ زبان را می‌گیرد، کادر، نوع بلوک و اطمینان درون‌خطی می‌دهد و برای سازمان در یک کانتینر قابل خودمیزبانی است.

مستند رسمی OCR ورودی سند و تصویر و قرارداد پاسخ ساخت‌یافته را تعریف می‌کند. این قرارداد به‌اندازه معیار عملیاتی است، زیرا تعیین می‌کند شاهد صفحه در استخراج، retrieval و review بعدی باقی می‌ماند یا نه.

این مدل در مجموعه عمومی مدل‌ها جای دارد چون سند وجه پایه جست‌وجو، RAG و عامل است. مدل عمومی شاید صفحه را بفهمد، ولی ingestion تولیدی به layout، مختصات، اطمینان و توان عملیاتی تکرارپذیر نیاز دارد. میسترال همچنین می‌پذیرد معیار OCR خطای ground truth و فرمت دارد؛ پس عدد تجمیعی جهت‌نماست.

فراتر از استخراج متن

OCR قدیمی متن یا Markdown می‌داد. OCR 4 مکان و نوع هر بلوک—عنوان، جدول، معادله، امضا—را هم برمی‌گرداند و اطمینان صفحه و واژه دارد. سامانه می‌تواند ناحیه استناد را highlight، span کم‌اطمینان را به بازبین و جدول را یک واحد chunk کند.

PDF، DOC، PPT و OpenDocument پشتیبانی می‌شوند. ۱۷۰ زبان در ده گروه‌اند. خودمیزبانی برای اقامت داده و آرشیو خصوصی است؛ API و Document AI مسیر مدیریت‌شده‌اند.

برای عامل، دانستن «کجا» و «با چه اطمینانی» به اندازه متن اهمیت دارد. ساختار مسیر شاهد را ممکن می‌کند.

آرشیوی چندزبانه از دستگاه نوری دقیق عبور و به لایه سند ساخت‌یافته تبدیل می‌شود.
آرشیوی چندزبانه از دستگاه نوری دقیق عبور و به لایه سند ساخت‌یافته تبدیل می‌شود.

معیار و محدودیت

سه دید مکمل منتشر شده است:

ارزیابینتیجهسهماحتیاط
OlmOCRBench۸۵٫۲۰تجمیع عمومی parsingخطای مرجع و فرمت دارد
OmniDocBench۹۳٫۰۷ساختار سندخروجی هم‌ارز ممکن است جریمه شود
Crawl Multilingual۰٫۹۸ارزیابی داخلی چندزبانهمستقل بازتولید نمی‌شود
ترجیح انسانیبرد متوسط ۷۲٪۶۰۰+ سند و ۱۲+ زبانبه ترکیب سند وابسته است
پوشش۱۷۰ زبانعرض ورودیکیفیت برابر تضمین نیست

میسترال ground truth غلط، LaTeX هم‌ارز، قطعه‌بندی معادله، ترتیب ستون و attribution بلوک را مثال می‌زند. مدل ممکن است صفحه را درست بخواند ولی با مرجع غلط امتیاز از دست بدهد یا برعکس.

ترجیح انسان و صحت فیلد

مطالعه انسانی بیش از ۶۰۰ سند و دوازده زبان با داور مستقل دارد. ترجیح، خوانایی و ساختار را می‌بیند که تطبیق رشته از دست می‌دهد.

داور ممکن است فرمت زیبا را ترجیح دهد و مبلغ عوض‌شده را نبیند. در مالی، حقوقی یا پزشکی، صحت فیلد و شدت حذف از زیبایی مهم‌تر است. ارزیابی محلی باید فیلد دقیق، ترتیب، layout و ترجیح را ترکیب کند.

نمونه واقعی مجاز از اسکن، عکس، چرخش، دست‌خط، چندستون، جدول، امضا و فرم فارسی بسازید. PDF دیجیتال آسان آمادگی را اغراق می‌کند.

کادر و مسیر شاهد

مختصات پاسخ را به ناحیه صفحه پیوند می‌دهد و برای citation، redaction و بازبینی مفید است. اطمینان fallback و صف دستی می‌سازد. نوع بلوک chunk بهتر می‌دهد.

اطمینان باید calibrate شود. عدد بالا اثبات نیست. خطا را در band اطمینان روی داده محلی رسم و threshold را با خطر انتخاب کنید. مبلغ فاکتور کم‌اطمینان باید بازبینی شود؛ footer تزئینی شاید نه.

layout نیز حساس است. حذف باید روی تصویر و متن اعمال شود و log سند را بی‌نیاز نگه ندارد.

فارسی و چندزبانه

میسترال برتری داخلی در گروه زبان و فاصله بیشتر روی کم‌منبع را می‌گوید. فارسی باید اتصال حروف، نیم‌فاصله، شکل عربی/فارسی، رقم، تاریخ، مهر، شناسه انگلیسی و ترتیب جدول RTL را پوشش دهد.

یک صفحه می‌تواند متن فارسی، کد لاتین، فرمول و نقل عربی داشته باشد. دقت نویسه association فیلد را ثابت نمی‌کند. شناسه باید دقیق حفظ شود حتی اگر متن اطراف محلی شود.

گزارش خطا را به زبان تفکیک کنید. پشتیبانی ۱۷۰ زبان وعده دسترسی است، نه عبور یک threshold مشترک.

API، محصول و خودمیزبانی

API چهار دلار برای هزار صفحه و batch با ۵۰ درصد تخفیف است. Document AI پنج دلار است. self-host سازمانی یک کانتینر دارد. این مسیرها اقتصاد و حاکمیت متفاوت دارند.

API برای خروجی ساخت‌یافته خام، Document AI برای اپ مدیریت‌شده و self-host برای اقامت و حجم است. صفحه بر ثانیه، صدک تأخیر، حد فایل، retry و هزینه پذیرفته‌شده را بسنجید.

گزارش مشتری درباره هشت برابر هزینه کمتر و هفده برابر تأخیر کمتر در مالی testimonial است، نه معیار جهانی. همان workload را محلی تکرار کنید.

استخراج تصمیم نیست

میسترال صریحاً OCR 4 را تصمیم‌گیر پزشکی، حقوقی یا مالی نمی‌داند. خروجی ساخت‌یافته باید وارد فرایند بازبینی شود. اطمینان مجوز پرداخت نیست.

در RAG، retrieval را جدا از extraction؛ در فرم، فیلد را با box؛ و در عامل، عمل را با اعتبارسنجی و تأیید کنترل کنید. راهنمای هوش سند چندوجهی زنجیره صفحه تا تصمیم را شرح می‌دهد.

پذیرش را بر اساس کلاس سند بسازید، نه یک امتیاز کلی OCR. مجموعه پنهان برای قرارداد فارسی و انگلیسی، فاکتور، رسید، جدول، دست‌خط، اسکن چرخیده، عکس کم‌کیفیت موبایل، مهر، نمودار و صفحه bidirectional ایجاد کنید. خطای نویسه و واژه، ترتیب خواندن، ساختار جدول، دقت فیلد، هم‌پوشانی box، calibration اطمینان و سرعت یافتن منبع هر مقدار توسط بازبین را بسنجید.

همان suite باید API و کانتینر self-host را روی revision ثابت مقایسه کند. پیش‌پردازش، resolution، تقسیم صفحه، timeout و نسخه container ثبت شود. استقرار فقط زمانی عبور می‌کند که fidelity شاهد و کیفیت downstream زیر قید واقعی privacy و latency بماند. راهنمای ارزیابی مدل مرزی ساختار آستانه خاص workload را می‌دهد.

برای فارسی، نیم‌فاصله، رقم فارسی و لاتین، تاریخ شمسی، جداکننده هزار، واحد پول، جهت ستون و ترکیب متن راست‌به‌چپ با شناسه لاتین نمونه جدا داشته باشد. normalizer نباید شناسه یا مبلغ را بی‌صدا عوض کند. مقدار خام، مقدار normalized و box منبع کنار هم نگه داشته شوند.

تزریق دستور می‌تواند داخل سند باشد. متن استخراج‌شده داده است، نه system prompt. عامل نباید اختیار را از صفحه اسکن‌شده بگیرد.

حکم

OCR 4 تخصصی مهمی است چون معیار قوی، ساختار شاهد، زبان گسترده و استقرار خصوصی را جمع می‌کند. پذیرش نقص معیار اعتبار اعلام را بالا می‌برد.

پذیرش درست با سند محلی، شدت خطای فیلد، calibration، اقتصاد صفحه و RTL انجام می‌شود. مدل می‌تواند لایه ingestion قوی باشد، ولی عمل حساس پایین‌دست تطبیق منبع و اختیار انسان می‌ماند.

یادداشت منابع — بازبینی ۲۰۲۶

#Mistral OCR 4#میسترال#هوش سند#OCR#چندزبانه

مطالب مرتبط

آماده شروع پروژه هوش مصنوعی خود هستید؟

با تیم ما تماس بگیرید و درباره نحوه کمک به کسب‌وکار خود صحبت کنید.