
MiniMax M3؛ عامل چندوجهی باز با زمینه یکمیلیونی
مینیمکس توجه تنک، تصویر و ویدیوی بومی، استفاده از رایانه و کدنویسی مرزی را در یک مدل وزنباز برای کار طولانی ترکیب میکند.
ادامه مطلبپژوهش ژرف ایآی
میز انتشار مدل

Z.ai در ۱۶ ژوئن ۲۰۲۶، برابر با ۲۶ خرداد ۱۴۰۵ GLM-5.2 را با مجوز MIT و زمینه یکمیلیون توکن برای عامل بلندمدت منتشر کرد. اعلام رسمی امتیاز ۸۱٫۰ در Terminal-Bench 2.1 با Terminus-2، امتیاز ۶۲٫۱ در SWE-bench Pro، امتیاز ۷۶٫۸ در MCP Atlas، امتیاز ۳۴٫۳ در PostTrainBench و ۱۳٫۰ در SWE-Marathon را گزارش میکند.
نوآوری IndexShare است: یک indexer میان چهار لایه توجه تنک مشترک میشود. Z.ai کاهش ۲٫۹ برابری FLOP هر توکن در یک میلیون زمینه و رشد ۲۰ درصدی پذیرش پیشبینی چندتوکنی را میگوید. effort نیز برای مبادله زمان و عمق قابل تنظیم است.
انتخاب معیار داستان را روشن میکند. Terminal، SWE، MCP، PostTrain و Marathon همه عمل در زمان میخواهند. مدل برای حفظ برنامه، ابزار و artifact است، نه پرسش جدا.
وزن MIT امکان خصوصی و تغییر را میدهد. دسترسی میزبانی effort و ابزار مدیریتشده دارد. وزن خام، API و عامل ثالث سه سامانهاند.
یک میلیون توکن مخزن و ردپای بلند را میگیرد. انتشار با نمایه تنک تلاش میکند پنجره را قابل استفاده کند، نه فقط عدد مشخصات.

مقایسه GLM-5.1 و 5.2 جزئی است:
| ارزیابی | GLM-5.2 | GLM-5.1 | تغییر |
|---|---|---|---|
| Terminal 2.1، Terminus-2 | ۸۱٫۰ | ۶۳٫۵ | جهش عامل ترمینال |
| SWE-bench Pro | ۶۲٫۱ | ۵۸٫۴ | حل مخزن سخت بهتر |
| NL2Repo | ۴۸٫۹ | ۴۲٫۷ | ساخت مخزن از زبان بهتر |
| ProgramBench | ۶۳٫۷ | ۵۰٫۹ | بازسازی رفتار بهتر |
| MCP Atlas | ۷۶٫۸ | ۷۱٫۸ | ابزار بهتر |
| PostTrainBench | ۳۴٫۳ | ۲۰٫۱ | بهبود مدل توسط عامل |
| SWE-Marathon | ۱۳٫۰ | ۱٫۰ | کار بسیار بلند بهتر ولی زیر ۲۶ Opus |
| GPQA Diamond | ۹۱٫۲ | ۸۶٫۲ | استدلال علمی بهتر |
ستون رقیب اجرای شرکت و رقم منتشرشده را مخلوط میکند. شاهد پاک، مقایسه همسان خانواده است. تفکیک Terminus-2 و best harness نیز روش خوب است.
توجه تنک نخست بلوک مهم را انتخاب میکند. اگر هر لایه index تازه بسازد، انتخاب خود پرهزینه میشود. IndexShare یک نمایه را در چهار لایه مصرف و هزینه را سرشکن میکند.
کاهش ۲٫۹ برابر FLOP تأخیر دیواری نیست. ساخت index، حافظه، ارتباط، هسته و batch اثر دارند. اشتراک نیز آزادی دید متفاوت لایه را محدود میکند و آموزش باید جبران کند.
prefill، decode و کیفیت بازیابی را جدا بسنجید. شاهد مرتبط را دور قرار دهید و اصلاح اضافه کنید. index سریع تنها با انتخاب درست ارزش دارد.
جهش ۶۳٫۵ به ۸۱٫۰ روشنترین پیشرفت است. Terminus-2 پوسته همین ردیف است. ردیف بهترین پوسته عدد دیگر دارد و سهم agent را ثابت میکند.
SWE Pro به ۶۲٫۱ و ProgramBench به ۶۳٫۷ میرسند. این اعداد محیط و رفتار بهتر را نشان میدهند، نه کیفیت خودکار patch. diff کمینه، آزمون، امنیت و بازبینی را محلی بسنجید.
راهنمای عامل مهندسی نرمافزار محیط ایزوله، مرز مخزن و تأیید عینی را توضیح میدهد.
PostTrainBench یک H100 برای بهبود مدل کوچک میدهد. SWE-Marathon شامل compiler، kernel و سرویس است. رشد نسبت به 5.1 بزرگ است، ولی ۱۳ هنوز زیر ۲۶ Opus در جدول Z.ai است.
شفافیت مفید است. کار بلند drift، checkpoint بد و جستوجوی ناکارا را بزرگ میکند. مدل دوساعته قوی شاید در چند روز شکست بخورد.
پایلوت باید وقفه، سقف بودجه، ادامه و artifact میانی داشته باشد. ارزش جزئی و recovery را بسنجید. شکست پس از ۲۰ ساعت با شکست پنج دقیقهای یکسان نیست.
GLM-5.2 سطح effort از جمله Max دارد. نمودار کیفیت بهتر از 5.1 در توکن مشابه و جایگاه میان نسل Opus را در تنظیم گزارششده نشان میدهد.
effort ابزار routing است. طبقهبندی معمول Max نمیخواهد؛ مهاجرت سخت شاید بخواهد. هر tier را در کیفیت پذیرفتهشده یکسان و با توکن، ابزار و زمان بسنجید.
پذیرش MTP بیست درصد بالا رفته و میتواند decode را سریع کند. نرخ به workload و drafter وابسته است و باید در موتور انتخابی اندازهگیری شود.
MIT خودمیزبانی و fine-tune را ممکن میکند، اما مقیاس و زمینه زیرساخت میخواهند. revision، توکنایزر، template، هسته تنک و دقت را ثابت کنید. کوانتیزه رگرسیون زبان و ابزار لازم دارد.
کارت رسمی GLM-5.2 رکورد artifact است. پیش از یکسان دانستن API و self-host، prompt و revision را تطبیق دهید. تغییر توکنایزر یا effort پیشفرض میتواند هزینه و معیار را عوض کند.
مدل برای عامل کد باز، مخزن بلند، MCP و پژوهش پسآموزش مناسب و برای دستگاه کوچک نامناسب است. رابط شاید در حجم پایین اقتصادیتر باشد. راهنمای عملیات مدل باز و ارزیابی مدل مرزی artifact و پوسته را کنترل میکنند.
GLM-5.2 یکی از قویترین وزنبازهای بازه است؛ ایده سیستم روشن و پیشرفت همسان بزرگ دارد. ۸۱ رهبری جهانی بیقید نیست. ترمینال، بازیابی یکمیلیونی و مأموریت روزانه را روی سختافزار هدف بازتولید کنید.
پذیرش زمینه باید نام فایل تکراری، خلاصه کهنه، اصلاح دیرهنگام و دستور داخل سند بازیابیشده داشته باشد. span استنادشده را ثبت و بررسی کنید IndexShare جزئیات اقلیت را تکراری از دست نمیدهد. در عامل، rate limit، ابزار خراب و ادامه پس از وقفه را شبیهسازی کنید.
مقایسه effort را با یک سقف کیفیت انجام دهید. اگر Max ده درصد وظیفه بیشتر حل میکند ولی چند برابر توکن و زمان میگیرد، فقط رده پرخطر باید به آن مسیریابی شود. توزیع هزینه و شکست را نشان دهید، نه فقط میانگین.
برای فارسی، retrieval در متن RTL، شناسه لاتین و رقمهای متفاوت را بیازمایید. کوانتیزه ممکن است افت نامتقارن زبان داشته باشد. نسخه BF16 مرجع لازم است تا افت مدل از خطای index یا tokenizer جدا شود.
عامل بلند باید commit یا artifact میانی، heartbeat و سقف بودجه داشته باشد. اگر هدف دیگر ممکن نیست، توقف و گزارش وضعیت بهتر از ادامه بیپایان است. این رفتار در Marathon خام دیده نمیشود ولی برای تولید تعیینکننده است.
manifest پوسته محلی را کنار نتیجه منتشر کنید: نسخه مدل، موتور، دقت، ابزار، timeout و سختافزار. بدون این رکورد، ارتقای بعدی با همان عدد نام معیار هم قابل مقایسه نیست و اختلاف سامانه به اشتباه پیشرفت مدل تلقی میشود.

مینیمکس توجه تنک، تصویر و ویدیوی بومی، استفاده از رایانه و کدنویسی مرزی را در یک مدل وزنباز برای کار طولانی ترکیب میکند.
ادامه مطلب
مدل ۲۲ خرداد Moonshot معیار کد و ابزار MCP را نسبت به K2.6 بالا میبرد و مصرف توکن استدلال را حدود ۳۰ درصد کم میکند.
ادامه مطلب
مدل ۱۴ خرداد انویدیا وزن، داده و دستور را برای MoE با ۵۵ میلیارد پارامتر فعال، زمینه بلند، NVFP4 و عامل پرسرعت باز میکند.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.