Kimi K2.7 Code؛ وزن باز برای کدنویسی بلندمدت

پ

پژوهش ژرف ای‌آی

میز انتشار مدل

۲۲ خرداد ۱۴۰۵به‌روزرسانی ۱۵ مرداد ۱۴۰۵۶ دقیقه مطالعه
Kimi K2.7 Code؛ وزن باز برای کدنویسی بلندمدت

Moonshot AI در ۱۲ ژوئن ۲۰۲۶، برابر با ۲۲ خرداد ۱۴۰۵ Kimi K2.7 Code را به‌عنوان مدل عامل کدنویسی وزن‌باز بر پایه K2.6 منتشر کرد. کارت رسمی حدود ۳۰ درصد توکن استدلال کمتر و بهبود در مهندسی نرم‌افزار و ابزار را گزارش می‌کند. مجوز modified MIT و حالت thinking اجباری است.

مدل ترکیب متخصصان با یک تریلیون پارامتر کل، ۳۲ میلیارد فعال، ۶۱ لایه، ۳۸۴ متخصص، هشت متخصص منتخب و یک مشترک، زمینه ۲۵۶ هزار، بینایی با MoonViT چهارصد میلیونی و INT4 بومی دارد. معماری از K2.6 آمده و تغییر اصلی پس‌آموزش و بهره‌وری عامل است.

تغییر چک‌پوینت ژوئن

Moonshot تکمیل بلندمدت را هدف گرفت، نه نحو کد جدا. مدل در بازسازی برنامه، رخداد تولید، ابزار MCP و کار پایدار Claw بهتر می‌شود. کاهش توکن thinking می‌تواند هزینه را پایین آورد اگر کیفیت ثابت باشد.

راهنمای رسمی فقط thinking را پشتیبانی می‌کند؛ پس مقایسه instant وجود ندارد. سروینگ ثالث باید دما، top-p، قالب و preserve_thinking را حفظ کند.

وزن برای vLLM، SGLang و KTransformers است. یک تریلیون پارامتر حتی با INT4 بار سیستم توزیع‌شده است. باز بودن به معنای آسان بودن عملیات نیست.

کارگاه کد، هزارتوی استدلال، ابزار و قرقره توکن فشرده را ترکیب می‌کند.
کارگاه کد، هزارتوی استدلال، ابزار و قرقره توکن فشرده را ترکیب می‌کند.

جدول رسمی معیار

مقایسه همسان K2.6 و K2.7 روشن است:

معیارK2.6K2.7 Codeنشانه
Kimi Code Bench v2۵۰٫۹۶۲٫۰+۱۱٫۱ در کد تولیدمانند داخلی
Program Bench۴۸٫۳۵۳٫۶بازسازی رفتار بهتر
MLS Bench Lite۲۶٫۷۳۵٫۱مهندسی پژوهش ML بهتر
Kimi Claw 24/7۴۲٫۹۴۶٫۹کار حرفه‌ای پایدار بهتر
MCP Atlas۶۹٫۴۷۶٫۰هماهنگی ابزار بهتر
MCP Mark Verified۷۲٫۸۸۱٫۱اجرای بهتر در پنج سرور واقعی
توکن استدلالمرجعحدود ۳۰٪ کمترمیانگین فروشنده و وابسته به کار

مقایسه GPT-5.5 و Opus 4.8 با Codex یا Claude Code و effort متفاوت است. نتیجه دفاع‌پذیر، پیشرفت در شرایط همسان نسبت به K2.6 است.

Program Bench و رفتار مخفی

Program Bench فایل اجرایی و سند را می‌دهد، ولی source، decompiler و اینترنت را نه. عامل باید رفتار را بازسازی و بیش از ۲۴۸ هزار آزمون fuzz را در ۲۰۰ برنامه عبور دهد.

۵۳٫۶ در برابر ۴۸٫۳ استدلال بهتر درباره قرارداد پنهان را نشان می‌دهد و برای مهاجرت و سازگاری مهم است. این عدد مجوز reverse engineering خلاف قرارداد نیست.

در آزمون محلی می‌توان source مرجع را پنهان، قرارداد و test را ارائه و رفتار را سنجید. کد باید نگهداشت‌پذیر و امن باشد. fuzz ممکن است performance یا undefined behavior را نبیند.

MCP و هماهنگی عملی

MCP Atlas به ۷۶٫۰ و MCP Mark Verified به ۸۱٫۱ می‌رسد. دومی Notion، GitHub، فایل، Postgres و Playwright را با وظیفه انسانی بررسی‌شده پوشش می‌دهد. بودجه ۱۰۰ گام و ۳۲K توکن در هر گام و میانگین سه اجراست.

این تنظیم‌ها سخاوتمندانه‌اند و باید کنار امتیاز بمانند. تولید ممکن است سقف و timeout کمتر داشته باشد. schema، احراز، rate limit و حالت محیط اثر جدی دارند.

توان ابزار مجوز عمل نیست. read، write، send و delete جدا، argument و نتیجه log، idempotency و تأیید عمل مادی لازم است.

پایداری Claw

Kimi Claw 24/7 معیار داخلی با ۱۷ سناریو و ۶۱۰ نقطه در نرم‌افزار، پژوهش، جذب، معامله و بازاریابی است. OpenClaw اجرا و سه بار میانگین می‌شود.

رشد ۴۲٫۹ به ۴۶٫۹ کوچک ولی مرتبط است. کار پایدار سخت است و داده داخلی شاید به محصول نزدیک‌تر باشد، اما مستقل عمومی نیست. ایده آن را محلی بازسازی کنید.

شبیه‌سازی روزانه با وقفه، قید تازه و checkpoint لازم است. حفظ هدف، ثبت تصمیم و توقف در ابهام اختیار را بسنجید. پایان بدون مسیر قابل حسابرسی کافی نیست.

اقتصاد توکن

۳۰ درصد توکن کمتر می‌تواند هزینه و تأخیر را کاهش دهد، ولی شاید روی بعضی کارها فکر کوتاه‌تر و خطرناک باشد. کار و نتیجه پذیرفته‌شده را ثابت کنید.

ورودی، خروجی، reasoning صورتحسابی، ابزار، زمان و اصلاح بازبین را ثبت کنید. K2.6 و K2.7 را با پوسته و زمینه یکسان مقایسه کنید. کاهش همراه افت حل بهره‌وری نیست. راهنمای تأخیر استنتاج مدل هزینه کامل را می‌دهد.

عملیات باز و حکم

INT4 مدل تریلیونی را عملی‌تر می‌کند، نه کوچک. ذخیره و سروینگ چندگره، interconnect و expert parallel لازم‌اند. تصویر و ۲۵۶K نیز حافظه می‌افزایند. revision، custom code، توکنایزر، دقت و موتور را ثابت و با endpoint مرجع مقایسه کنید.

تغییرات رسمی Kimi Code شاهد تاریخ ۱۲ ژوئن است، نه زمان به‌روزرسانی بعدی مخزن. رکورد باید هم تاریخ اعلام و هم revision دقیق وزن را نگه دارد؛ اولی ترتیب بازار و دومی artifact قابل اجرا را پاسخ می‌دهد.

راهنمای عملیات مدل باز زنجیره تأمین و rollout را پوشش می‌دهد. مجوز modified MIT باید از فایل دقیق بررسی شود، نه MIT عادی فرض شود.

K2.7 Code به‌دلیل مقایسه همسان، رشد ابزار و بهره‌وری توکن انتشار مهمی است. سازمان توانمند در اجرای مدل بزرگ و عامل MCP باید Program Bench، سرور واقعی و کار پایدار را بازتولید کند. برای معماری نسل بعد، تحلیل Kimi K3 را بخوانید.

پذیرش باید شکست dependency، مشخصات مبهم، فایل باینری بزرگ و ابزار با وضعیت کهنه را شامل شود. بررسی کنید مدل آزمون ناقص را تشخیص می‌دهد و پیش از بازنویسی وسیع سؤال می‌پرسد. در MCP اعتبارنامه منقضی و session قطع‌شده را شبیه‌سازی کنید. عامل خوب عمل مخرب را پشت retry بی‌پایان تکرار نمی‌کند.

برای بهره‌وری، سه هزینه را جدا کنید: توکن مدل، زیرساخت ابزار و زمان انسان. کاهش reasoning ممکن است با ابزار بیشتر جبران شود. نمودار هزینه هر task پذیرفته‌شده را برای K2.6، K2.7 و مدل کوچک‌تر بسازید و صدک‌ها را نشان دهید؛ میانگین می‌تواند چند اجرای بسیار طولانی را پنهان کند.

در self-host، checksum و license را پیش از انتقال به رجیستری داخلی تأیید و بارگذاری custom code را در sandbox انجام دهید. مدل بسیار بزرگ زنجیره تأمین طولانی‌تری دارد و هر shard یا کانتینر باید قابل ردگیری باشد.

یک مدل کوچک‌تر را نیز در همان آزمون نگه دارید. K2.7 زمانی هزینه زیرساخت را توجیه می‌کند که رشد تکمیل یا صرفه‌جویی توکن از پیچیدگی سروینگ بیشتر باشد. بزرگی پارامتر به‌تنهایی هدف خرید نیست.

یادداشت منابع — بازبینی ۲۰۲۶

#Kimi K2.7 Code#Moonshot AI#وزن باز#عامل کدنویسی#MCP

مطالب مرتبط

آماده شروع پروژه هوش مصنوعی خود هستید؟

با تیم ما تماس بگیرید و درباره نحوه کمک به کسب‌وکار خود صحبت کنید.