
GLM-5.2؛ عامل بلندمدت باز با زمینه یکمیلیونی
انتشار MIT در ۲۶ خرداد Z.ai با نمایه تنک مشترک و effort قابل تنظیم، ترمینال، مخزن، ابزار و کار طولانی را نسبت به GLM-5.1 بهبود میدهد.
ادامه مطلبپژوهش ژرف ایآی
میز انتشار مدل

SpaceXAI در ۱۶ ژوئیه ۲۰۲۶، برابر با ۲۵ تیر ۱۴۰۵ Grok 4.5 را برای کدنویسی، عامل و کار دانشی عرضه کرد. اعلام رسمی امتیاز ۸۳٫۳ درصد در Terminal-Bench 2.1، ۶۴٫۷ درصد در SWE-bench Pro و نرخ حل pass@1 برابر ۲۹٫۰ درصد در SWE Marathon را گزارش میکند. مدل از API، Grok Build و Cursor در دسترس است.
انتشار یک ادعای بهرهوری دقیق هم دارد: سرعت ۸۰ توکن خروجی در ثانیه و میانگین ۱۵٬۹۵۴ توکن خروجی برای هر مسئله SWE-bench Pro، در برابر ۶۷٬۰۲۰ توکن Claude Opus 4.8 با تنظیم حداکثر مورد استناد؛ یعنی ۴٫۲ برابر کمتر در اجرای فروشنده. قابلیت و بهرهوری باید با هم بازتولید شوند، چون trace کوتاهتر اگر بیشتر شکست بخورد کار ارزانتری نیست.
Grok 4.5 مدل مرزی میزبانیشده است و وزن دانلودی در اعلام عرضه نمیشود. SpaceXAI میگوید مدل همراه Cursor و با داده کد، علوم، مهندسی و ریاضی آموزش دیده است. rolloutهای RL صدها هزار کار چندگامی را پوشش داده و ساعتها بهصورت ناهمگام روی دهها هزار GPU از نوع NVIDIA GB300 اجرا شدهاند.
جایگاه محصول مهندسی و کار اداری را ترکیب میکند. Grok 4.5 مدل پیشفرض Grok Build است و ساخت صفحه گسترده، ارائه، سند و وباپ کامل نمایش داده میشود. دمو دامنه مطلوب را نشان میدهد، ولی شواهد عددی برای کد و ترمینال قویتر است.
سند رسمی مدل نام grok-4.5 و توصیه کلید cache سطح مکالمه را ثبت میکند. هویت مدل و رابط را ثابت کنید، زیرا پیشفرض محصول ممکن است بدون حفظ مقایسهپذیری تغییر کند.

SpaceXAI این مقادیر و harnessها را منتشر کرده است:
| معیار | Grok 4.5 | نشانه ارزیابی |
|---|---|---|
| DeepSWE 1.0 | ۶۲٫۰٪ | عامل نرمافزار با harness فروشندگان و اجرای Artificial Analysis |
| DeepSWE 1.1 | ۵۳٫۰٪ | اجرای Datacurve با mini-swe-agent |
| SWE Marathon | ۲۹٫۰٪ pass@1 | مسئله مخزن بلندمدت |
| Terminal-Bench 2.1 | ۸۳٫۳٪ | تکمیل وظیفه خط فرمان |
| SWE-bench Pro | ۶۴٫۷٪ | حل issue در مجموعه سختتر |
| سرعت سروینگ | ۸۰ TPS | throughput اعلامشده |
| توکن خروجی میانگین SWE Pro | ۱۵٬۹۵۴ | سنجه بهرهوری فروشنده |
| قیمت API | ۲ دلار ورودی / ۶ دلار خروجی | برای هر یک میلیون توکن |
ردیف رقبا از system card یا leaderboard آنان آمده است. این زمینه مفید است، نه رتبهبندی کنترلشده همگانی. امتیاز Grok قابلحملترین واقعیت است؛ مقایسه باید effort، harness، ابزار، context و تاریخ را حفظ کند.
DeepSWE 1.0 به Grok امتیاز ۶۲٫۰ میدهد. طبق اعلام، معیار را Datacurve ساخته، harness هر ارائهدهنده استفاده و Artificial Analysis اجرا کرده است. نسخه 1.1 با mini-swe-agent امتیاز ۵۳٫۰ دارد. افت به معنای پسرفت نیست؛ نسخه و آرایش عامل متفاوتاند.
نمودار Fable و GPT-5.5 را در هر دو نسخه جلوتر نشان میدهد و Grok رقابتی است. این روایت از ادعای «بهترین در همهچیز» معتبرتر و یادآور انتخاب مدل و scaffold بهعنوان یک سیستم است.
در آزمون داخلی، یک harness خنثی کنار harness بومی نگه دارید. اولی قابلیت انتقال و دومی ارزش قابل دستیابی محصول را میسنجد. راهنمای عامل مهندسی نرمافزار اعتبار patch، test، regression و زمان بازبین را فراتر از نرخ حل ثبت میکند.
نتیجه pass@1 برابر ۲۹٫۰ در SWE Marathon تنها نموداری است که Grok در مجموعه مورد استناد جلوست: Opus 4.8 برابر ۲۶٫۰، Fable برابر ۲۴٫۰ و Opus 4.7 برابر ۱۶٫۰. کار طولانی drift برنامه، فشار context، dependency اشتباه و retry بیفایده را آشکار میکند.
Pass@1 عملیاتی است، چون sampling تکراری برای یک جواب خوششانس نمیدهد. اما همه سقف هزینه و timeoutها در صفحه کاملاً همسان نیستند. بازتولید محلی باید زمان دیواری، سقف ابزار، بودجه محاسبه و snapshot مخزن یکسان داشته باشد.
پیشرفت ناقص را هم ثبت کنید. عاملی که subsystem درست را پیدا و test مفید مینویسد، حتی با timeout برای گردشکار کمکی ارزش دارد؛ patch مبهمی که اتفاقی عبور میکند هنوز ریسک نگهداری است.
Grok در Terminal-Bench 2.1 امتیاز ۸۳٫۳ دارد، نزدیک GPT-5.5 با ۸۳٫۴ و Fable با ۸۴٫۳. این وظایف بررسی محیط، بسته، فرایند و راستیآزمایی را پاداش میدهند. پروژه Terminal-Bench برای دیدن تحول task و harness مناسبتر از نگهداری عدد بینسخه است.
SWE-bench Pro برای Grok برابر ۶۴٫۷ است. نمودار Fable را ۸۰٫۴، Opus 4.8 را ۶۹٫۲، Opus 4.7 را ۶۴٫۳، GLM 5.2 را ۶۲٫۱ و GPT-5.5 را ۵۸٫۶ نشان میدهد. پروژه SWE-bench خانواده معیار را شرح میدهد، اما Pro میتواند subset تجاری و scaffold متفاوت داشته باشد.
هیچ عددی جای آزمون مخزن خصوصی را نمیگیرد. monorepo، کد تولیدی، migration، test ضعیف، مرز secret و dependency خراب را اضافه و پیش از merge توضیح شاهد و عدمقطعیت را الزام کنید.
SpaceXAI سرعت ۸۰ TPS و ۱۵٬۹۵۴ توکن خروجی میانگین در SWE Pro را گزارش میکند. Opus 4.8 max مورد استناد ۶۷٬۰۲۰ مصرف کرده، پس trace حدود ۴٫۲ برابر کوچکتر است. صفحه بهطور کلی نیز نزدیک دو برابر بهرهوری نسبت به مدلهای همرده میگوید.
توکن خروجی تنها بخشی از هزینه عامل است. ورودی context، خواندن cached، ابزار، container، retry و اصلاح انسان میتواند بیشتر باشد. trace فشرده ممکن است reasoning سمت سرور را بسته به صورتحساب پنهان کند. task پذیرفتهشده را مقایسه کنید، نه call خام.
قیمت عرضه برای هر میلیون توکن ۲ دلار ورودی و ۶ دلار خروجی است. توزیع هزینه هر کار پذیرفتهشده را با شکستها بسازید. راهنمای تأخیر استنتاج TTFT، سرعت تولید، انتظار ابزار و تکمیل انتهابهانتها را جدا میکند.
اعلام از دهها هزار GB300، dedup و امتیاز کیفیت داده، و RL ناهمگام روی صدها هزار کار میگوید. اینها منبع عملکرد را توضیح میدهند، ولی recipe یا وزن قابل بازتولید نیستند.
بنابراین ممیزی از رفتار API و ارزیابی منتشرشده انجام میشود، نه پارامتر. prompt، خروجی، نام مدل، تاریخ، قیمت، تنظیم ایمنی و commit harness را آرشیو و پس از هر تغییر رفتار canary را تکرار کنید.
نبود system card اختصاصی Grok 4.5 در ماده عرضه، مقایسه ایمنی را محدود میکند. قابلیت یک سوی پذیرش است؛ prompt injection، secret، ابزار مخرب، فریب و refusal باید با مجوز واقعی جدا آزموده شوند.
با تحلیل read-only و container ترمینال محدود شروع کنید. تولید patch پس از ثبات در scope، test و گزارش صادقانه شکست فعال شود. ارسال، merge، deploy، credential و حذف مجوزهای جدا باقی بمانند.
سه سطح کوتاه، feature چندفایلی و نگهداری روزانه را بسنجید. نرخ عبور و regression، زمان، توکن و ابزار، دقیقه بازبین، تلاش ناامن و بازیابی session قطعشده ثبت شود. مدل کوچکتر مبنا بماند.
Prompt cache برای مکالمه طولانی مفید است، اما هویت آن نباید میان کاربر، مخزن یا سطح مجوز مشترک شود. secret پیش از ارسال حذف و cache پروژه هنگام تغییر دسترسی منقضی شود.
Grok 4.5 انتشار مهم عامل کد است، چون نتیجه قوی ترمینال و مخزن را با عدد شفاف سرعت، قیمت و توکن همراه میکند. ترکیب اصلی ۸۳٫۳ درصد Terminal-Bench 2.1 و ۶۴٫۷ درصد SWE-bench Pro در سرعت اعلامی ۸۰ TPS است، نه پیروزی در همه معیارها.
گام درست ارزیابی سیستمی روی مخزن و ابزار سازمان است. تفاوت harness را حفظ، شکست را قیمتگذاری و عمل مادی را پشت تأیید نگه دارید. اگر میانگین ۱۵٬۹۵۴ توکن بدون افت حل یا ایمنی بازتولید شود، Grok 4.5 میتواند برای کار کدنویسی بلندمدت بسیار کارآمد باشد.

انتشار MIT در ۲۶ خرداد Z.ai با نمایه تنک مشترک و effort قابل تنظیم، ترمینال، مخزن، ابزار و کار طولانی را نسبت به GLM-5.1 بهبود میدهد.
ادامه مطلب
مدل ۲۲ خرداد Moonshot معیار کد و ابزار MCP را نسبت به K2.6 بالا میبرد و مصرف توکن استدلال را حدود ۳۰ درصد کم میکند.
ادامه مطلب
مینیمکس توجه تنک، تصویر و ویدیوی بومی، استفاده از رایانه و کدنویسی مرزی را در یک مدل وزنباز برای کار طولانی ترکیب میکند.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.