
GLM-5.2؛ عامل بلندمدت باز با زمینه یکمیلیونی
انتشار MIT در ۲۶ خرداد Z.ai با نمایه تنک مشترک و effort قابل تنظیم، ترمینال، مخزن، ابزار و کار طولانی را نسبت به GLM-5.1 بهبود میدهد.
ادامه مطلبپژوهش ژرف ایآی
میز انتشار مدل

مینیمکس در ۱ ژوئن ۲۰۲۶، برابر با ۱۱ خرداد ۱۴۰۵ M3 را بهعنوان مدل وزنبازی عرضه کرد که سه توان را یکجا دارد: کدنویسی و عامل مرزی، زمینه یکمیلیون توکن و فهم بومی تصویر و ویدیو همراه استفاده از رایانه. اعلام رسمی امتیاز ۵۹٫۰ در SWE-bench Pro، امتیاز ۶۶٫۰ در Terminal-Bench 2.1، امتیاز ۳۴٫۸ در SWE-fficiency، امتیاز ۲۸٫۸ در KernelBench Hard و ۷۴٫۲ در MCP Atlas را گزارش میکند.
نوآوری معماری MiniMax Sparse Attention یا MSA است. شرکت میگوید در یکمیلیون توکن، محاسبه هر توکن به یکبیستم مدل قبل میرسد، prefill بیش از ۹ برابر و decode بیش از ۱۵ برابر سریع میشود و در بیشتر آزمونهای حذف مؤلفه کیفیت توجه کامل را حفظ میکند. این اعداد گزارش فروشندهاند، ولی گلوگاه واقعی زمینه بلند را هدف میگیرند.
M3 از روز نخست در محصولات و رابط مینیمکس بود و شرکت وعده وزن و گزارش فنی در ده روز داد. سازمان رسمی MiniMaxAI محل بررسی فایل و مجوز است. برچسب دقیق «وزنباز» است؛ این عبارت انتشار همه داده و دستور آموزش را تضمین نمیکند.
MiniMax Code نیز با مدل تازه بهروز شد و برای آن همآموزش دیده است. مدل خام، M3 در MiniMax Code و M3 با Claude Code در معیار سه سامانه متفاوتاند. یادداشت ارزیابی میگوید چند آزمون کد با Claude Code و پیام جایگزین اجرا شدهاند.
این افشا نقطه قوت است، چون تصور چهارچوب خنثی را از بین میبرد. استقرار محلی بدون بازسازی عامل نباید امتیاز یکسان را انتظار داشته باشد.

نتیجههای اصلی چنیناند:
| ارزیابی | نتیجه M3 | موضوع | تنظیم گزارششده |
|---|---|---|---|
| SWE-bench Pro | ۵۹٫۰٪ | مسئله سخت مخزن | زیرساخت داخلی با Claude Code |
| Terminal-Bench 2.1 | ۶۶٫۰٪ | عامل خط فرمان | Terminus 2، محیط 8C16G، دو ساعت |
| SWE-fficiency | ۳۴٫۸٪ | درستی و کارایی نرمافزار | گردش داخلی Claude Code |
| KernelBench Hard | ۲۸٫۸٪ | بهینهسازی هسته GPU | Blackwell و نسبت اوج |
| MCP Atlas | ۷۴٫۲٪ | ابزار MCP | کد رسمی و داور گزارششده |
| OSWorld-Verified | ۷۰٫۰۶٪ | استفاده گرافیکی از رایانه | ۳۶۱ نمونه و ۲۰۰ گام |
| Video-MME | ۸۴٫۶ در ۵۱۲ فریم | فهم ویدیوی بلند | نمونهبرداری و حد ارائهدهنده متفاوت است |
مقاله رسمی ارزیابی بیشتری دارد، اما روش ردیفها فرق میکند. عدد Terminal با پوسته بهترین گزارششده قابل ترکیب نیست. جدول کوچک منشأ را واضحتر نگه میدارد.
توجه کامل در پردازش ورودی هر پرسش را با هر کلید مقایسه و بهصورت درجه دوم رشد میکند. توجه تنک مرحله انتخاب میافزاید تا هر پرسش فقط بلوکهای مهم را بخواند. مینیمکس میگوید MSA تاریخچه را دقیقتر بخشبندی و ترتیب gather سازگار با سختافزار استفاده میکند.
ادعای یکبیستم محاسبه، ۹ برابر prefill و ۱۵ برابر decode به پیادهسازی و پیکربندی داخلی وابسته است. طول، شتابدهنده، هسته، دسته و الگوی تنکی نتیجه واقعی را تعیین میکنند.
زمینه بلند باید از نظر سرعت و بازیابی آزموده شود. واقعیت را در عمق مختلف قرار دهید، اصلاح متناقض اضافه کنید و پیروی از آخرین قید را بسنجید. قرار گرفتن مخزن و مقاله در پنجره تضمین توجه درست نیست.
M3 از آغاز با داده درهمتنیده وجهها آموزش دیده است. تصویر و ویدیو آداپتور دیرهنگام نیستند. مدل میتواند شکل، رابط و فریم را همراه متن و ابزار یک مأموریت بلند نگه دارد. بازتولید دوازدهساعته مقاله نمونه نمایشی این ترکیب است.
نمونه چشمگیر است ولی معیار بستهتر لازم دارد. Video-MME، OSWorld، OmniDocBench و MMMU-Pro بخشهای متفاوت را میسنجند. نرخ فریم و سقف تعداد فریم حیاتی است؛ رابطهای بیرونی گاهی ورودی کمتری گرفتهاند.
رایانه باید در حساب ایزوله، ویدیو با رویداد نادر و سند با استناد ناحیهای آزمایش شود. یک ستون فقرات واحد زمینه را ساده و همزمان شکست را متمرکز میکند.
مینیمکس M3 را همکار چندساعته معرفی میکند. در نمونه هسته FP8، مدل طی ۲۴ ساعت ۱۴۷ ارسال و ۱٬۹۵۹ فراخوانی ابزار داشته و بهرهبرداری سختافزار را از ۷٫۶ به ۷۱٫۳ درصد رسانده است.
این نمایش نیاز به حالت پایدار، نقطه ذخیره، ابزار محدود، سقف هزینه و تأیید عینی را آشکار میکند. عامل ۲۴ ساعته بدون ادامهپذیری و ردپای قابل بازرسی آماده تولید نیست.
مدل باید commit یا خروجی میانی بسازد، عدم قطعیت را بگوید و در مرز اختیار توقف کند. خلاصه مسیر باید به رویداد ابزار پیوند داشته باشد تا بازبین مجبور به خواندن یک میلیون توکن نشود.
مدل یکمیلیونی چندوجهی حتی با توجه تنک نیازمند حافظه، موتور، کوانتیزه و پیشپردازش دقیق است. prefill و decode را جدا و در طول واقعی بسنجید. KV، تداخل دسته، صدک تأخیر و کیفیت عددی را ثبت و توکنایزر و قالب گفتگو را ثابت کنید.
راهنمای عملیات مدل باز منشأ، دروازه ارزیابی و بازگشت را پوشش میدهد. رابط ابری زیرساخت را کم ولی حاکمیت را تغییر میدهد؛ endpoint و سطح سرویس هر ردپا باید معلوم باشد.
M3 برای مخزن بلند، پژوهش چندوجهی، رایانه و نیاز وزنباز جذاب است. برای دستگاه کوچک یا طبقهبندی کوتاه مناسب نیست. زمینه بزرگ همچنین سطح تزریق دستور را گسترش میدهد؛ فایل بازیابیشده داده نامطمئن است، نه دستور.
پیش از ورود داده، منبع و مجوز هر فایل را ثبت کنید و متن کنترل را از محتوای بازیابیشده جدا نگه دارید. برای پروژه طولانی سقف زمان و هزینه، توقف اضطراری و گزارش heartbeat تعیین کنید. این کنترلها به اندازه امتیاز نهایی برای پذیرش عامل اهمیت دارند.
سه سطح را مقایسه کنید: مدل خام، پوسته باز منتخب و تجربه مدیریتشده MiniMax. کار، ابزار و پذیرش ثابت بمانند. حل، یادآوری بلند، grounding بصری، شکست ابزار، توکن، زمان، هزینه شتابدهنده و بازبینی را اندازه بگیرید.
مسئله مخزن، کار یکساعته با وقفه، سند و ویدیوی دارای پاسخ و رایانه با عمل محافظتشده اضافه کنید. آزمون، استناد و تأیید انسان لازم است. راهنمای ارزیابی مدل مرزی فهرست مقایسه را ارائه میکند.
M3 نشان میدهد وزنباز میتواند زمینه بلند، عامل کد و چندوجهی بومی را جمع کند. انتخاب تولیدی تنها با بازتولید این ترکیب روی سختافزار و مرز حاکمیتی هدف ممکن است.

انتشار MIT در ۲۶ خرداد Z.ai با نمایه تنک مشترک و effort قابل تنظیم، ترمینال، مخزن، ابزار و کار طولانی را نسبت به GLM-5.1 بهبود میدهد.
ادامه مطلب
مدل ۲۲ خرداد Moonshot معیار کد و ابزار MCP را نسبت به K2.6 بالا میبرد و مصرف توکن استدلال را حدود ۳۰ درصد کم میکند.
ادامه مطلب
مدل ۱۴ خرداد انویدیا وزن، داده و دستور را برای MoE با ۵۵ میلیارد پارامتر فعال، زمینه بلند، NVFP4 و عامل پرسرعت باز میکند.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.