
Command A+؛ مدل سازمانی باز روی دو H100
انتشار Apache-2.0 کوهیر، استدلال، تصویر، ابزار، بازیابی و ۴۸ زبان را در مدل ۲۱۸ میلیاردی با تنها ۲۵ میلیارد پارامتر فعال یکپارچه میکند.
ادامه مطلبپژوهش ژرف ایآی
میز انتشار مدل

Mistral AI در ۲۳ ژوئن ۲۰۲۶، برابر با ۲ تیر ۱۴۰۵ OCR 4 را بهعنوان مدل متمرکز فهم سند منتشر کرد. اعلام رسمی امتیاز ۸۵٫۲۰ در OlmOCRBench، امتیاز ۹۳٫۰۷ در OmniDocBench و نرخ برد متوسط ۷۲ درصد در ترجیح انسانی کور را گزارش میکند. مدل ۱۷۰ زبان را میگیرد، کادر، نوع بلوک و اطمینان درونخطی میدهد و برای سازمان در یک کانتینر قابل خودمیزبانی است.
مستند رسمی OCR ورودی سند و تصویر و قرارداد پاسخ ساختیافته را تعریف میکند. این قرارداد بهاندازه معیار عملیاتی است، زیرا تعیین میکند شاهد صفحه در استخراج، retrieval و review بعدی باقی میماند یا نه.
این مدل در مجموعه عمومی مدلها جای دارد چون سند وجه پایه جستوجو، RAG و عامل است. مدل عمومی شاید صفحه را بفهمد، ولی ingestion تولیدی به layout، مختصات، اطمینان و توان عملیاتی تکرارپذیر نیاز دارد. میسترال همچنین میپذیرد معیار OCR خطای ground truth و فرمت دارد؛ پس عدد تجمیعی جهتنماست.
OCR قدیمی متن یا Markdown میداد. OCR 4 مکان و نوع هر بلوک—عنوان، جدول، معادله، امضا—را هم برمیگرداند و اطمینان صفحه و واژه دارد. سامانه میتواند ناحیه استناد را highlight، span کماطمینان را به بازبین و جدول را یک واحد chunk کند.
PDF، DOC، PPT و OpenDocument پشتیبانی میشوند. ۱۷۰ زبان در ده گروهاند. خودمیزبانی برای اقامت داده و آرشیو خصوصی است؛ API و Document AI مسیر مدیریتشدهاند.
برای عامل، دانستن «کجا» و «با چه اطمینانی» به اندازه متن اهمیت دارد. ساختار مسیر شاهد را ممکن میکند.

سه دید مکمل منتشر شده است:
| ارزیابی | نتیجه | سهم | احتیاط |
|---|---|---|---|
| OlmOCRBench | ۸۵٫۲۰ | تجمیع عمومی parsing | خطای مرجع و فرمت دارد |
| OmniDocBench | ۹۳٫۰۷ | ساختار سند | خروجی همارز ممکن است جریمه شود |
| Crawl Multilingual | ۰٫۹۸ | ارزیابی داخلی چندزبانه | مستقل بازتولید نمیشود |
| ترجیح انسانی | برد متوسط ۷۲٪ | ۶۰۰+ سند و ۱۲+ زبان | به ترکیب سند وابسته است |
| پوشش | ۱۷۰ زبان | عرض ورودی | کیفیت برابر تضمین نیست |
میسترال ground truth غلط، LaTeX همارز، قطعهبندی معادله، ترتیب ستون و attribution بلوک را مثال میزند. مدل ممکن است صفحه را درست بخواند ولی با مرجع غلط امتیاز از دست بدهد یا برعکس.
مطالعه انسانی بیش از ۶۰۰ سند و دوازده زبان با داور مستقل دارد. ترجیح، خوانایی و ساختار را میبیند که تطبیق رشته از دست میدهد.
داور ممکن است فرمت زیبا را ترجیح دهد و مبلغ عوضشده را نبیند. در مالی، حقوقی یا پزشکی، صحت فیلد و شدت حذف از زیبایی مهمتر است. ارزیابی محلی باید فیلد دقیق، ترتیب، layout و ترجیح را ترکیب کند.
نمونه واقعی مجاز از اسکن، عکس، چرخش، دستخط، چندستون، جدول، امضا و فرم فارسی بسازید. PDF دیجیتال آسان آمادگی را اغراق میکند.
مختصات پاسخ را به ناحیه صفحه پیوند میدهد و برای citation، redaction و بازبینی مفید است. اطمینان fallback و صف دستی میسازد. نوع بلوک chunk بهتر میدهد.
اطمینان باید calibrate شود. عدد بالا اثبات نیست. خطا را در band اطمینان روی داده محلی رسم و threshold را با خطر انتخاب کنید. مبلغ فاکتور کماطمینان باید بازبینی شود؛ footer تزئینی شاید نه.
layout نیز حساس است. حذف باید روی تصویر و متن اعمال شود و log سند را بینیاز نگه ندارد.
میسترال برتری داخلی در گروه زبان و فاصله بیشتر روی کممنبع را میگوید. فارسی باید اتصال حروف، نیمفاصله، شکل عربی/فارسی، رقم، تاریخ، مهر، شناسه انگلیسی و ترتیب جدول RTL را پوشش دهد.
یک صفحه میتواند متن فارسی، کد لاتین، فرمول و نقل عربی داشته باشد. دقت نویسه association فیلد را ثابت نمیکند. شناسه باید دقیق حفظ شود حتی اگر متن اطراف محلی شود.
گزارش خطا را به زبان تفکیک کنید. پشتیبانی ۱۷۰ زبان وعده دسترسی است، نه عبور یک threshold مشترک.
API چهار دلار برای هزار صفحه و batch با ۵۰ درصد تخفیف است. Document AI پنج دلار است. self-host سازمانی یک کانتینر دارد. این مسیرها اقتصاد و حاکمیت متفاوت دارند.
API برای خروجی ساختیافته خام، Document AI برای اپ مدیریتشده و self-host برای اقامت و حجم است. صفحه بر ثانیه، صدک تأخیر، حد فایل، retry و هزینه پذیرفتهشده را بسنجید.
گزارش مشتری درباره هشت برابر هزینه کمتر و هفده برابر تأخیر کمتر در مالی testimonial است، نه معیار جهانی. همان workload را محلی تکرار کنید.
میسترال صریحاً OCR 4 را تصمیمگیر پزشکی، حقوقی یا مالی نمیداند. خروجی ساختیافته باید وارد فرایند بازبینی شود. اطمینان مجوز پرداخت نیست.
در RAG، retrieval را جدا از extraction؛ در فرم، فیلد را با box؛ و در عامل، عمل را با اعتبارسنجی و تأیید کنترل کنید. راهنمای هوش سند چندوجهی زنجیره صفحه تا تصمیم را شرح میدهد.
پذیرش را بر اساس کلاس سند بسازید، نه یک امتیاز کلی OCR. مجموعه پنهان برای قرارداد فارسی و انگلیسی، فاکتور، رسید، جدول، دستخط، اسکن چرخیده، عکس کمکیفیت موبایل، مهر، نمودار و صفحه bidirectional ایجاد کنید. خطای نویسه و واژه، ترتیب خواندن، ساختار جدول، دقت فیلد، همپوشانی box، calibration اطمینان و سرعت یافتن منبع هر مقدار توسط بازبین را بسنجید.
همان suite باید API و کانتینر self-host را روی revision ثابت مقایسه کند. پیشپردازش، resolution، تقسیم صفحه، timeout و نسخه container ثبت شود. استقرار فقط زمانی عبور میکند که fidelity شاهد و کیفیت downstream زیر قید واقعی privacy و latency بماند. راهنمای ارزیابی مدل مرزی ساختار آستانه خاص workload را میدهد.
برای فارسی، نیمفاصله، رقم فارسی و لاتین، تاریخ شمسی، جداکننده هزار، واحد پول، جهت ستون و ترکیب متن راستبهچپ با شناسه لاتین نمونه جدا داشته باشد. normalizer نباید شناسه یا مبلغ را بیصدا عوض کند. مقدار خام، مقدار normalized و box منبع کنار هم نگه داشته شوند.
تزریق دستور میتواند داخل سند باشد. متن استخراجشده داده است، نه system prompt. عامل نباید اختیار را از صفحه اسکنشده بگیرد.
OCR 4 تخصصی مهمی است چون معیار قوی، ساختار شاهد، زبان گسترده و استقرار خصوصی را جمع میکند. پذیرش نقص معیار اعتبار اعلام را بالا میبرد.
پذیرش درست با سند محلی، شدت خطای فیلد، calibration، اقتصاد صفحه و RTL انجام میشود. مدل میتواند لایه ingestion قوی باشد، ولی عمل حساس پاییندست تطبیق منبع و اختیار انسان میماند.

انتشار Apache-2.0 کوهیر، استدلال، تصویر، ابزار، بازیابی و ۴۸ زبان را در مدل ۲۱۸ میلیاردی با تنها ۲۵ میلیارد پارامتر فعال یکپارچه میکند.
ادامه مطلب
معماری عملی برای سنجش عاملهای سایبری هوش مصنوعی، بدون آنکه سندباکس ارزیابی مسیری زنجیرهای به سامانههای تولیدی پیدا کند.
ادامه مطلب
بررسی فنی اینکه چگونه توجه تنک، هسته پایدار CUDA، تقطیر چهارمرحلهای و NVFP4 یک خط لوله ۱۳۳ ثانیهای را به تولید ویدیوی نزدیک به بلادرنگ رساندند.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.