
GLM-5.2؛ عامل بلندمدت باز با زمینه یکمیلیونی
انتشار MIT در ۲۶ خرداد Z.ai با نمایه تنک مشترک و effort قابل تنظیم، ترمینال، مخزن، ابزار و کار طولانی را نسبت به GLM-5.1 بهبود میدهد.
ادامه مطلبپژوهش ژرف ایآی
میز انتشار مدل

Moonshot AI در ۱۲ ژوئن ۲۰۲۶، برابر با ۲۲ خرداد ۱۴۰۵ Kimi K2.7 Code را بهعنوان مدل عامل کدنویسی وزنباز بر پایه K2.6 منتشر کرد. کارت رسمی حدود ۳۰ درصد توکن استدلال کمتر و بهبود در مهندسی نرمافزار و ابزار را گزارش میکند. مجوز modified MIT و حالت thinking اجباری است.
مدل ترکیب متخصصان با یک تریلیون پارامتر کل، ۳۲ میلیارد فعال، ۶۱ لایه، ۳۸۴ متخصص، هشت متخصص منتخب و یک مشترک، زمینه ۲۵۶ هزار، بینایی با MoonViT چهارصد میلیونی و INT4 بومی دارد. معماری از K2.6 آمده و تغییر اصلی پسآموزش و بهرهوری عامل است.
Moonshot تکمیل بلندمدت را هدف گرفت، نه نحو کد جدا. مدل در بازسازی برنامه، رخداد تولید، ابزار MCP و کار پایدار Claw بهتر میشود. کاهش توکن thinking میتواند هزینه را پایین آورد اگر کیفیت ثابت باشد.
راهنمای رسمی فقط thinking را پشتیبانی میکند؛ پس مقایسه instant وجود ندارد. سروینگ ثالث باید دما، top-p، قالب و preserve_thinking را حفظ کند.
وزن برای vLLM، SGLang و KTransformers است. یک تریلیون پارامتر حتی با INT4 بار سیستم توزیعشده است. باز بودن به معنای آسان بودن عملیات نیست.

مقایسه همسان K2.6 و K2.7 روشن است:
| معیار | K2.6 | K2.7 Code | نشانه |
|---|---|---|---|
| Kimi Code Bench v2 | ۵۰٫۹ | ۶۲٫۰ | +۱۱٫۱ در کد تولیدمانند داخلی |
| Program Bench | ۴۸٫۳ | ۵۳٫۶ | بازسازی رفتار بهتر |
| MLS Bench Lite | ۲۶٫۷ | ۳۵٫۱ | مهندسی پژوهش ML بهتر |
| Kimi Claw 24/7 | ۴۲٫۹ | ۴۶٫۹ | کار حرفهای پایدار بهتر |
| MCP Atlas | ۶۹٫۴ | ۷۶٫۰ | هماهنگی ابزار بهتر |
| MCP Mark Verified | ۷۲٫۸ | ۸۱٫۱ | اجرای بهتر در پنج سرور واقعی |
| توکن استدلال | مرجع | حدود ۳۰٪ کمتر | میانگین فروشنده و وابسته به کار |
مقایسه GPT-5.5 و Opus 4.8 با Codex یا Claude Code و effort متفاوت است. نتیجه دفاعپذیر، پیشرفت در شرایط همسان نسبت به K2.6 است.
Program Bench فایل اجرایی و سند را میدهد، ولی source، decompiler و اینترنت را نه. عامل باید رفتار را بازسازی و بیش از ۲۴۸ هزار آزمون fuzz را در ۲۰۰ برنامه عبور دهد.
۵۳٫۶ در برابر ۴۸٫۳ استدلال بهتر درباره قرارداد پنهان را نشان میدهد و برای مهاجرت و سازگاری مهم است. این عدد مجوز reverse engineering خلاف قرارداد نیست.
در آزمون محلی میتوان source مرجع را پنهان، قرارداد و test را ارائه و رفتار را سنجید. کد باید نگهداشتپذیر و امن باشد. fuzz ممکن است performance یا undefined behavior را نبیند.
MCP Atlas به ۷۶٫۰ و MCP Mark Verified به ۸۱٫۱ میرسد. دومی Notion، GitHub، فایل، Postgres و Playwright را با وظیفه انسانی بررسیشده پوشش میدهد. بودجه ۱۰۰ گام و ۳۲K توکن در هر گام و میانگین سه اجراست.
این تنظیمها سخاوتمندانهاند و باید کنار امتیاز بمانند. تولید ممکن است سقف و timeout کمتر داشته باشد. schema، احراز، rate limit و حالت محیط اثر جدی دارند.
توان ابزار مجوز عمل نیست. read، write، send و delete جدا، argument و نتیجه log، idempotency و تأیید عمل مادی لازم است.
Kimi Claw 24/7 معیار داخلی با ۱۷ سناریو و ۶۱۰ نقطه در نرمافزار، پژوهش، جذب، معامله و بازاریابی است. OpenClaw اجرا و سه بار میانگین میشود.
رشد ۴۲٫۹ به ۴۶٫۹ کوچک ولی مرتبط است. کار پایدار سخت است و داده داخلی شاید به محصول نزدیکتر باشد، اما مستقل عمومی نیست. ایده آن را محلی بازسازی کنید.
شبیهسازی روزانه با وقفه، قید تازه و checkpoint لازم است. حفظ هدف، ثبت تصمیم و توقف در ابهام اختیار را بسنجید. پایان بدون مسیر قابل حسابرسی کافی نیست.
۳۰ درصد توکن کمتر میتواند هزینه و تأخیر را کاهش دهد، ولی شاید روی بعضی کارها فکر کوتاهتر و خطرناک باشد. کار و نتیجه پذیرفتهشده را ثابت کنید.
ورودی، خروجی، reasoning صورتحسابی، ابزار، زمان و اصلاح بازبین را ثبت کنید. K2.6 و K2.7 را با پوسته و زمینه یکسان مقایسه کنید. کاهش همراه افت حل بهرهوری نیست. راهنمای تأخیر استنتاج مدل هزینه کامل را میدهد.
INT4 مدل تریلیونی را عملیتر میکند، نه کوچک. ذخیره و سروینگ چندگره، interconnect و expert parallel لازماند. تصویر و ۲۵۶K نیز حافظه میافزایند. revision، custom code، توکنایزر، دقت و موتور را ثابت و با endpoint مرجع مقایسه کنید.
تغییرات رسمی Kimi Code شاهد تاریخ ۱۲ ژوئن است، نه زمان بهروزرسانی بعدی مخزن. رکورد باید هم تاریخ اعلام و هم revision دقیق وزن را نگه دارد؛ اولی ترتیب بازار و دومی artifact قابل اجرا را پاسخ میدهد.
راهنمای عملیات مدل باز زنجیره تأمین و rollout را پوشش میدهد. مجوز modified MIT باید از فایل دقیق بررسی شود، نه MIT عادی فرض شود.
K2.7 Code بهدلیل مقایسه همسان، رشد ابزار و بهرهوری توکن انتشار مهمی است. سازمان توانمند در اجرای مدل بزرگ و عامل MCP باید Program Bench، سرور واقعی و کار پایدار را بازتولید کند. برای معماری نسل بعد، تحلیل Kimi K3 را بخوانید.
پذیرش باید شکست dependency، مشخصات مبهم، فایل باینری بزرگ و ابزار با وضعیت کهنه را شامل شود. بررسی کنید مدل آزمون ناقص را تشخیص میدهد و پیش از بازنویسی وسیع سؤال میپرسد. در MCP اعتبارنامه منقضی و session قطعشده را شبیهسازی کنید. عامل خوب عمل مخرب را پشت retry بیپایان تکرار نمیکند.
برای بهرهوری، سه هزینه را جدا کنید: توکن مدل، زیرساخت ابزار و زمان انسان. کاهش reasoning ممکن است با ابزار بیشتر جبران شود. نمودار هزینه هر task پذیرفتهشده را برای K2.6، K2.7 و مدل کوچکتر بسازید و صدکها را نشان دهید؛ میانگین میتواند چند اجرای بسیار طولانی را پنهان کند.
در self-host، checksum و license را پیش از انتقال به رجیستری داخلی تأیید و بارگذاری custom code را در sandbox انجام دهید. مدل بسیار بزرگ زنجیره تأمین طولانیتری دارد و هر shard یا کانتینر باید قابل ردگیری باشد.
یک مدل کوچکتر را نیز در همان آزمون نگه دارید. K2.7 زمانی هزینه زیرساخت را توجیه میکند که رشد تکمیل یا صرفهجویی توکن از پیچیدگی سروینگ بیشتر باشد. بزرگی پارامتر بهتنهایی هدف خرید نیست.

انتشار MIT در ۲۶ خرداد Z.ai با نمایه تنک مشترک و effort قابل تنظیم، ترمینال، مخزن، ابزار و کار طولانی را نسبت به GLM-5.1 بهبود میدهد.
ادامه مطلب
مینیمکس توجه تنک، تصویر و ویدیوی بومی، استفاده از رایانه و کدنویسی مرزی را در یک مدل وزنباز برای کار طولانی ترکیب میکند.
ادامه مطلب
مدل ۲۵ تیر SpaceXAI در Terminal-Bench 2.1 امتیاز ۸۳٫۳ و SWE-bench Pro امتیاز ۶۴٫۷ را با میانگین ۱۵٬۹۵۴ توکن خروجی گزارش میکند.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.