Grok 4.5؛ معیار کدنویسی، سرعت ۸۰ TPS و بهره‌وری توکن

پ

پژوهش ژرف ای‌آی

میز انتشار مدل

۲۵ تیر ۱۴۰۵به‌روزرسانی ۱۵ مرداد ۱۴۰۵۷ دقیقه مطالعه
Grok 4.5؛ معیار کدنویسی، سرعت ۸۰ TPS و بهره‌وری توکن

SpaceXAI در ۱۶ ژوئیه ۲۰۲۶، برابر با ۲۵ تیر ۱۴۰۵ Grok 4.5 را برای کدنویسی، عامل و کار دانشی عرضه کرد. اعلام رسمی امتیاز ۸۳٫۳ درصد در Terminal-Bench 2.1، ۶۴٫۷ درصد در SWE-bench Pro و نرخ حل pass@1 برابر ۲۹٫۰ درصد در SWE Marathon را گزارش می‌کند. مدل از API، Grok Build و Cursor در دسترس است.

انتشار یک ادعای بهره‌وری دقیق هم دارد: سرعت ۸۰ توکن خروجی در ثانیه و میانگین ۱۵٬۹۵۴ توکن خروجی برای هر مسئله SWE-bench Pro، در برابر ۶۷٬۰۲۰ توکن Claude Opus 4.8 با تنظیم حداکثر مورد استناد؛ یعنی ۴٫۲ برابر کمتر در اجرای فروشنده. قابلیت و بهره‌وری باید با هم بازتولید شوند، چون trace کوتاه‌تر اگر بیشتر شکست بخورد کار ارزان‌تری نیست.

آنچه در ۱۶ ژوئیه عرضه شد

Grok 4.5 مدل مرزی میزبانی‌شده است و وزن دانلودی در اعلام عرضه نمی‌شود. SpaceXAI می‌گوید مدل همراه Cursor و با داده کد، علوم، مهندسی و ریاضی آموزش دیده است. rolloutهای RL صدها هزار کار چندگامی را پوشش داده و ساعت‌ها به‌صورت ناهمگام روی ده‌ها هزار GPU از نوع NVIDIA GB300 اجرا شده‌اند.

جایگاه محصول مهندسی و کار اداری را ترکیب می‌کند. Grok 4.5 مدل پیش‌فرض Grok Build است و ساخت صفحه گسترده، ارائه، سند و وب‌اپ کامل نمایش داده می‌شود. دمو دامنه مطلوب را نشان می‌دهد، ولی شواهد عددی برای کد و ترمینال قوی‌تر است.

سند رسمی مدل نام grok-4.5 و توصیه کلید cache سطح مکالمه را ثبت می‌کند. هویت مدل و رابط را ثابت کنید، زیرا پیش‌فرض محصول ممکن است بدون حفظ مقایسه‌پذیری تغییر کند.

موتور استدلال پرسرعت، کد، فرمان ترمینال و سیگنال معیار را در کارگاه برقی هدایت می‌کند.
موتور استدلال پرسرعت، کد، فرمان ترمینال و سیگنال معیار را در کارگاه برقی هدایت می‌کند.

جدول معیار رسمی

SpaceXAI این مقادیر و harnessها را منتشر کرده است:

معیارGrok 4.5نشانه ارزیابی
DeepSWE 1.0۶۲٫۰٪عامل نرم‌افزار با harness فروشندگان و اجرای Artificial Analysis
DeepSWE 1.1۵۳٫۰٪اجرای Datacurve با mini-swe-agent
SWE Marathon۲۹٫۰٪ pass@1مسئله مخزن بلندمدت
Terminal-Bench 2.1۸۳٫۳٪تکمیل وظیفه خط فرمان
SWE-bench Pro۶۴٫۷٪حل issue در مجموعه سخت‌تر
سرعت سروینگ۸۰ TPSthroughput اعلام‌شده
توکن خروجی میانگین SWE Pro۱۵٬۹۵۴سنجه بهره‌وری فروشنده
قیمت API۲ دلار ورودی / ۶ دلار خروجیبرای هر یک میلیون توکن

ردیف رقبا از system card یا leaderboard آنان آمده است. این زمینه مفید است، نه رتبه‌بندی کنترل‌شده همگانی. امتیاز Grok قابل‌حمل‌ترین واقعیت است؛ مقایسه باید effort، harness، ابزار، context و تاریخ را حفظ کند.

وابستگی DeepSWE به harness

DeepSWE 1.0 به Grok امتیاز ۶۲٫۰ می‌دهد. طبق اعلام، معیار را Datacurve ساخته، harness هر ارائه‌دهنده استفاده و Artificial Analysis اجرا کرده است. نسخه 1.1 با mini-swe-agent امتیاز ۵۳٫۰ دارد. افت به معنای پسرفت نیست؛ نسخه و آرایش عامل متفاوت‌اند.

نمودار Fable و GPT-5.5 را در هر دو نسخه جلوتر نشان می‌دهد و Grok رقابتی است. این روایت از ادعای «بهترین در همه‌چیز» معتبرتر و یادآور انتخاب مدل و scaffold به‌عنوان یک سیستم است.

در آزمون داخلی، یک harness خنثی کنار harness بومی نگه دارید. اولی قابلیت انتقال و دومی ارزش قابل دستیابی محصول را می‌سنجد. راهنمای عامل مهندسی نرم‌افزار اعتبار patch، test، regression و زمان بازبین را فراتر از نرخ حل ثبت می‌کند.

SWE Marathon و کار بلندمدت

نتیجه pass@1 برابر ۲۹٫۰ در SWE Marathon تنها نموداری است که Grok در مجموعه مورد استناد جلوست: Opus 4.8 برابر ۲۶٫۰، Fable برابر ۲۴٫۰ و Opus 4.7 برابر ۱۶٫۰. کار طولانی drift برنامه، فشار context، dependency اشتباه و retry بی‌فایده را آشکار می‌کند.

Pass@1 عملیاتی است، چون sampling تکراری برای یک جواب خوش‌شانس نمی‌دهد. اما همه سقف هزینه و timeoutها در صفحه کاملاً همسان نیستند. بازتولید محلی باید زمان دیواری، سقف ابزار، بودجه محاسبه و snapshot مخزن یکسان داشته باشد.

پیشرفت ناقص را هم ثبت کنید. عاملی که subsystem درست را پیدا و test مفید می‌نویسد، حتی با timeout برای گردش‌کار کمکی ارزش دارد؛ patch مبهمی که اتفاقی عبور می‌کند هنوز ریسک نگهداری است.

معیار ترمینال و مخزن

Grok در Terminal-Bench 2.1 امتیاز ۸۳٫۳ دارد، نزدیک GPT-5.5 با ۸۳٫۴ و Fable با ۸۴٫۳. این وظایف بررسی محیط، بسته، فرایند و راستی‌آزمایی را پاداش می‌دهند. پروژه Terminal-Bench برای دیدن تحول task و harness مناسب‌تر از نگهداری عدد بی‌نسخه است.

SWE-bench Pro برای Grok برابر ۶۴٫۷ است. نمودار Fable را ۸۰٫۴، Opus 4.8 را ۶۹٫۲، Opus 4.7 را ۶۴٫۳، GLM 5.2 را ۶۲٫۱ و GPT-5.5 را ۵۸٫۶ نشان می‌دهد. پروژه SWE-bench خانواده معیار را شرح می‌دهد، اما Pro می‌تواند subset تجاری و scaffold متفاوت داشته باشد.

هیچ عددی جای آزمون مخزن خصوصی را نمی‌گیرد. monorepo، کد تولیدی، migration، test ضعیف، مرز secret و dependency خراب را اضافه و پیش از merge توضیح شاهد و عدم‌قطعیت را الزام کنید.

سرعت و اقتصاد توکن

SpaceXAI سرعت ۸۰ TPS و ۱۵٬۹۵۴ توکن خروجی میانگین در SWE Pro را گزارش می‌کند. Opus 4.8 max مورد استناد ۶۷٬۰۲۰ مصرف کرده، پس trace حدود ۴٫۲ برابر کوچک‌تر است. صفحه به‌طور کلی نیز نزدیک دو برابر بهره‌وری نسبت به مدل‌های هم‌رده می‌گوید.

توکن خروجی تنها بخشی از هزینه عامل است. ورودی context، خواندن cached، ابزار، container، retry و اصلاح انسان می‌تواند بیشتر باشد. trace فشرده ممکن است reasoning سمت سرور را بسته به صورتحساب پنهان کند. task پذیرفته‌شده را مقایسه کنید، نه call خام.

قیمت عرضه برای هر میلیون توکن ۲ دلار ورودی و ۶ دلار خروجی است. توزیع هزینه هر کار پذیرفته‌شده را با شکست‌ها بسازید. راهنمای تأخیر استنتاج TTFT، سرعت تولید، انتظار ابزار و تکمیل انتهابه‌انتها را جدا می‌کند.

ادعای آموزش و محدودیت شاهد

اعلام از ده‌ها هزار GB300، dedup و امتیاز کیفیت داده، و RL ناهمگام روی صدها هزار کار می‌گوید. این‌ها منبع عملکرد را توضیح می‌دهند، ولی recipe یا وزن قابل بازتولید نیستند.

بنابراین ممیزی از رفتار API و ارزیابی منتشرشده انجام می‌شود، نه پارامتر. prompt، خروجی، نام مدل، تاریخ، قیمت، تنظیم ایمنی و commit harness را آرشیو و پس از هر تغییر رفتار canary را تکرار کنید.

نبود system card اختصاصی Grok 4.5 در ماده عرضه، مقایسه ایمنی را محدود می‌کند. قابلیت یک سوی پذیرش است؛ prompt injection، secret، ابزار مخرب، فریب و refusal باید با مجوز واقعی جدا آزموده شوند.

برنامه پذیرش تولید

با تحلیل read-only و container ترمینال محدود شروع کنید. تولید patch پس از ثبات در scope، test و گزارش صادقانه شکست فعال شود. ارسال، merge، deploy، credential و حذف مجوزهای جدا باقی بمانند.

سه سطح کوتاه، feature چندفایلی و نگهداری روزانه را بسنجید. نرخ عبور و regression، زمان، توکن و ابزار، دقیقه بازبین، تلاش ناامن و بازیابی session قطع‌شده ثبت شود. مدل کوچک‌تر مبنا بماند.

Prompt cache برای مکالمه طولانی مفید است، اما هویت آن نباید میان کاربر، مخزن یا سطح مجوز مشترک شود. secret پیش از ارسال حذف و cache پروژه هنگام تغییر دسترسی منقضی شود.

جمع‌بندی

Grok 4.5 انتشار مهم عامل کد است، چون نتیجه قوی ترمینال و مخزن را با عدد شفاف سرعت، قیمت و توکن همراه می‌کند. ترکیب اصلی ۸۳٫۳ درصد Terminal-Bench 2.1 و ۶۴٫۷ درصد SWE-bench Pro در سرعت اعلامی ۸۰ TPS است، نه پیروزی در همه معیارها.

گام درست ارزیابی سیستمی روی مخزن و ابزار سازمان است. تفاوت harness را حفظ، شکست را قیمت‌گذاری و عمل مادی را پشت تأیید نگه دارید. اگر میانگین ۱۵٬۹۵۴ توکن بدون افت حل یا ایمنی بازتولید شود، Grok 4.5 می‌تواند برای کار کدنویسی بلندمدت بسیار کارآمد باشد.

یادداشت منابع — بازبینی ۲۰۲۶

#Grok 4.5#SpaceXAI#عامل کدنویسی#SWE-bench#Terminal-Bench

مطالب مرتبط

آماده شروع پروژه هوش مصنوعی خود هستید؟

با تیم ما تماس بگیرید و درباره نحوه کمک به کسب‌وکار خود صحبت کنید.