GLM-5.2؛ عامل بلندمدت باز با زمینه یک‌میلیونی

پ

پژوهش ژرف ای‌آی

میز انتشار مدل

۲۶ خرداد ۱۴۰۵به‌روزرسانی ۱۵ مرداد ۱۴۰۵۶ دقیقه مطالعه
GLM-5.2؛ عامل بلندمدت باز با زمینه یک‌میلیونی

Z.ai در ۱۶ ژوئن ۲۰۲۶، برابر با ۲۶ خرداد ۱۴۰۵ GLM-5.2 را با مجوز MIT و زمینه یک‌میلیون توکن برای عامل بلندمدت منتشر کرد. اعلام رسمی امتیاز ۸۱٫۰ در Terminal-Bench 2.1 با Terminus-2، امتیاز ۶۲٫۱ در SWE-bench Pro، امتیاز ۷۶٫۸ در MCP Atlas، امتیاز ۳۴٫۳ در PostTrainBench و ۱۳٫۰ در SWE-Marathon را گزارش می‌کند.

نوآوری IndexShare است: یک indexer میان چهار لایه توجه تنک مشترک می‌شود. Z.ai کاهش ۲٫۹ برابری FLOP هر توکن در یک میلیون زمینه و رشد ۲۰ درصدی پذیرش پیش‌بینی چندتوکنی را می‌گوید. effort نیز برای مبادله زمان و عمق قابل تنظیم است.

مدل برای تکمیل، نه چت

انتخاب معیار داستان را روشن می‌کند. Terminal، SWE، MCP، PostTrain و Marathon همه عمل در زمان می‌خواهند. مدل برای حفظ برنامه، ابزار و artifact است، نه پرسش جدا.

وزن MIT امکان خصوصی و تغییر را می‌دهد. دسترسی میزبانی effort و ابزار مدیریت‌شده دارد. وزن خام، API و عامل ثالث سه سامانه‌اند.

یک میلیون توکن مخزن و ردپای بلند را می‌گیرد. انتشار با نمایه تنک تلاش می‌کند پنجره را قابل استفاده کند، نه فقط عدد مشخصات.

یک نمایه تنک مشترک چهار ماژول زمینه بلند را به بازیابی مرکزی متصل می‌کند.
یک نمایه تنک مشترک چهار ماژول زمینه بلند را به بازیابی مرکزی متصل می‌کند.

جدول معیار رسمی

مقایسه GLM-5.1 و 5.2 جزئی است:

ارزیابیGLM-5.2GLM-5.1تغییر
Terminal 2.1، Terminus-2۸۱٫۰۶۳٫۵جهش عامل ترمینال
SWE-bench Pro۶۲٫۱۵۸٫۴حل مخزن سخت بهتر
NL2Repo۴۸٫۹۴۲٫۷ساخت مخزن از زبان بهتر
ProgramBench۶۳٫۷۵۰٫۹بازسازی رفتار بهتر
MCP Atlas۷۶٫۸۷۱٫۸ابزار بهتر
PostTrainBench۳۴٫۳۲۰٫۱بهبود مدل توسط عامل
SWE-Marathon۱۳٫۰۱٫۰کار بسیار بلند بهتر ولی زیر ۲۶ Opus
GPQA Diamond۹۱٫۲۸۶٫۲استدلال علمی بهتر

ستون رقیب اجرای شرکت و رقم منتشرشده را مخلوط می‌کند. شاهد پاک، مقایسه همسان خانواده است. تفکیک Terminus-2 و best harness نیز روش خوب است.

IndexShare و هزینه انتخاب

توجه تنک نخست بلوک مهم را انتخاب می‌کند. اگر هر لایه index تازه بسازد، انتخاب خود پرهزینه می‌شود. IndexShare یک نمایه را در چهار لایه مصرف و هزینه را سرشکن می‌کند.

کاهش ۲٫۹ برابر FLOP تأخیر دیواری نیست. ساخت index، حافظه، ارتباط، هسته و batch اثر دارند. اشتراک نیز آزادی دید متفاوت لایه را محدود می‌کند و آموزش باید جبران کند.

prefill، decode و کیفیت بازیابی را جدا بسنجید. شاهد مرتبط را دور قرار دهید و اصلاح اضافه کنید. index سریع تنها با انتخاب درست ارزش دارد.

ترمینال و مخزن

جهش ۶۳٫۵ به ۸۱٫۰ روشن‌ترین پیشرفت است. Terminus-2 پوسته همین ردیف است. ردیف بهترین پوسته عدد دیگر دارد و سهم agent را ثابت می‌کند.

SWE Pro به ۶۲٫۱ و ProgramBench به ۶۳٫۷ می‌رسند. این اعداد محیط و رفتار بهتر را نشان می‌دهند، نه کیفیت خودکار patch. diff کمینه، آزمون، امنیت و بازبینی را محلی بسنجید.

راهنمای عامل مهندسی نرم‌افزار محیط ایزوله، مرز مخزن و تأیید عینی را توضیح می‌دهد.

کار بسیار بلند و فاصله باقی‌مانده

PostTrainBench یک H100 برای بهبود مدل کوچک می‌دهد. SWE-Marathon شامل compiler، kernel و سرویس است. رشد نسبت به 5.1 بزرگ است، ولی ۱۳ هنوز زیر ۲۶ Opus در جدول Z.ai است.

شفافیت مفید است. کار بلند drift، checkpoint بد و جست‌وجوی ناکارا را بزرگ می‌کند. مدل دو‌ساعته قوی شاید در چند روز شکست بخورد.

پایلوت باید وقفه، سقف بودجه، ادامه و artifact میانی داشته باشد. ارزش جزئی و recovery را بسنجید. شکست پس از ۲۰ ساعت با شکست پنج دقیقه‌ای یکسان نیست.

effort و اقتصاد توکن

GLM-5.2 سطح effort از جمله Max دارد. نمودار کیفیت بهتر از 5.1 در توکن مشابه و جایگاه میان نسل Opus را در تنظیم گزارش‌شده نشان می‌دهد.

effort ابزار routing است. طبقه‌بندی معمول Max نمی‌خواهد؛ مهاجرت سخت شاید بخواهد. هر tier را در کیفیت پذیرفته‌شده یکسان و با توکن، ابزار و زمان بسنجید.

پذیرش MTP بیست درصد بالا رفته و می‌تواند decode را سریع کند. نرخ به workload و drafter وابسته است و باید در موتور انتخابی اندازه‌گیری شود.

استقرار باز و حکم

MIT خودمیزبانی و fine-tune را ممکن می‌کند، اما مقیاس و زمینه زیرساخت می‌خواهند. revision، توکنایزر، template، هسته تنک و دقت را ثابت کنید. کوانتیزه رگرسیون زبان و ابزار لازم دارد.

کارت رسمی GLM-5.2 رکورد artifact است. پیش از یکسان دانستن API و self-host، prompt و revision را تطبیق دهید. تغییر توکنایزر یا effort پیش‌فرض می‌تواند هزینه و معیار را عوض کند.

مدل برای عامل کد باز، مخزن بلند، MCP و پژوهش پس‌آموزش مناسب و برای دستگاه کوچک نامناسب است. رابط شاید در حجم پایین اقتصادی‌تر باشد. راهنمای عملیات مدل باز و ارزیابی مدل مرزی artifact و پوسته را کنترل می‌کنند.

GLM-5.2 یکی از قوی‌ترین وزن‌بازهای بازه است؛ ایده سیستم روشن و پیشرفت همسان بزرگ دارد. ۸۱ رهبری جهانی بی‌قید نیست. ترمینال، بازیابی یک‌میلیونی و مأموریت روزانه را روی سخت‌افزار هدف بازتولید کنید.

پذیرش زمینه باید نام فایل تکراری، خلاصه کهنه، اصلاح دیرهنگام و دستور داخل سند بازیابی‌شده داشته باشد. span استنادشده را ثبت و بررسی کنید IndexShare جزئیات اقلیت را تکراری از دست نمی‌دهد. در عامل، rate limit، ابزار خراب و ادامه پس از وقفه را شبیه‌سازی کنید.

مقایسه effort را با یک سقف کیفیت انجام دهید. اگر Max ده درصد وظیفه بیشتر حل می‌کند ولی چند برابر توکن و زمان می‌گیرد، فقط رده پرخطر باید به آن مسیریابی شود. توزیع هزینه و شکست را نشان دهید، نه فقط میانگین.

برای فارسی، retrieval در متن RTL، شناسه لاتین و رقم‌های متفاوت را بیازمایید. کوانتیزه ممکن است افت نامتقارن زبان داشته باشد. نسخه BF16 مرجع لازم است تا افت مدل از خطای index یا tokenizer جدا شود.

عامل بلند باید commit یا artifact میانی، heartbeat و سقف بودجه داشته باشد. اگر هدف دیگر ممکن نیست، توقف و گزارش وضعیت بهتر از ادامه بی‌پایان است. این رفتار در Marathon خام دیده نمی‌شود ولی برای تولید تعیین‌کننده است.

manifest پوسته محلی را کنار نتیجه منتشر کنید: نسخه مدل، موتور، دقت، ابزار، timeout و سخت‌افزار. بدون این رکورد، ارتقای بعدی با همان عدد نام معیار هم قابل مقایسه نیست و اختلاف سامانه به اشتباه پیشرفت مدل تلقی می‌شود.

یادداشت منابع — بازبینی ۲۰۲۶

#GLM-5.2#Z.ai#وزن باز#عامل کدنویسی#زمینه بلند

مطالب مرتبط

آماده شروع پروژه هوش مصنوعی خود هستید؟

با تیم ما تماس بگیرید و درباره نحوه کمک به کسب‌وکار خود صحبت کنید.