
Kimi K3؛ از حافظه GPT-2 تا عامل باز ۲٫۸ تریلیونی
انتشار وزنباز ۲۵ تیر Moonshot معماری هیبریدی ۲٫۸ تریلیونی را با معیار قوی کد، ابزار، پژوهش و چندوجهی ترکیب میکند.
ادامه مطلبپژوهش ژرف ایآی
میز انتشار مدل

DeepSeek خانواده وزنباز V4 Preview را در ۲۴ آوریل ۲۰۲۶، برابر با ۴ اردیبهشت ۱۴۰۵ منتشر کرد. این تاریخ دوازده روز پیش از بازه اصلی ۶ مه تا ۶ اوت مجموعه است. آن را بهعنوان استثنای زمینهای روشن میآوریم، زیرا بررسی آزمایشگاههای بزرگ اگر migration رابط یا بهروزرسانی مخزن را بهجای عرضه جا بزند از حفظ گاهشماری واقعی کمدقتتر خواهد بود.
یادداشت رسمی DeepSeek-V4-Pro با ۱٫۶ تریلیون پارامتر کل و ۴۹ میلیارد فعال، و V4-Flash با ۲۸۴ میلیارد کل و ۱۳ میلیارد فعال را معرفی کرد. هر دو زمینه یکمیلیون، حالت thinking و non-thinking، API و وزن MIT دارند.
تغییرات API V4-Pro و V4-Flash را در ۲۴ آوریل ثبت میکند. revision بعدی کارت، quantization و بازنشستگی aliasهای deepseek-chat و deepseek-reasoner در ۲۴ ژوئیه انتشار مدل تازه نیستند. در گذار، aliasها به حالت غیرتفکر و تفکر V4-Flash اشاره میکردند.
این تمایز برای گاهشماری و بازتولید مهم است. تاریخ اعلام زمان دسترسی خانواده و revision مخزن artifact آزمودهشده را پاسخ میدهد. رکورد ممیزی هر دو را میخواهد، اما publishedAt نباید برای جا دادن انتشار قدیمی جلو آورده شود.
پس دفتر تابستان V4 را در شمارش بازه نمیآورد و این مقاله زمینه DeepSeek خواستهشده را شفاف تکمیل میکند.

V4-Pro مدل MoE با ۱٫۶T ذخیره و 49B فعال در هر توکن است. Flash مقدار 284B ذخیره و 13B فعال دارد. هر دو یک میلیون توکن را پشتیبانی میکنند. DeepSeek از بیش از ۳۲ تریلیون توکن پیشآموزش، SFT و GRPO تخصصی و سپس distillation درونخط به مدل یکپارچه میگوید.
معماری Compressed Sparse Attention و Heavily Compressed Attention را ترکیب میکند. در context یکمیلیون، Pro طبق گزارش ۲۷ درصد FLOP استنتاج تکتوکن و ۱۰ درصد KV cache مدل V3.2 را میخواهد. mHC برای پایداری سیگنال و Muon برای همگرایی به کار رفتهاند.
کارت رسمی V4-Pro وزن base و instruct، encoding، راهنمای محلی، جدول و مجوز MIT را میدهد. وزن باز بازرسی و self-host را ممکن میکند، اما checkpoint 1.6T پروژه چندگرهای است.
DeepSeek برای V4-Pro با effort حداکثر گزارش میکند:
| معیار | V4-Pro Max | نشانه |
|---|---|---|
| MMLU-Pro | ۸۷٫۵ | دانش دشوار عمومی |
| GPQA Diamond | ۹۰٫۱ | استدلال علوم تحصیلات تکمیلی |
| Humanity's Last Exam | ۳۷٫۷ | دانش خبره بدون ابزار |
| LiveCodeBench | ۹۳٫۵ | کدنویسی رقابتی جاری |
| Codeforces rating | ۳۲۰۶ | برنامهنویسی مسابقهای |
| MRCR در 1M | ۸۳٫۵ | بازیابی چندسوزنی بلند |
| SWE-bench Verified | ۸۰٫۶ | حل issue مخزن |
| SWE-bench Pro | ۵۵٫۴ | مجموعه سختتر مخزن |
| BrowseComp | ۸۳٫۴ | پژوهش وب با عامل |
| MCPAtlas | ۷۳٫۶ | هماهنگی سرور ابزار |
این مقادیر از کارت DeepSeek با harness، sampling و بودجه Max میآیند. جدول رقبا نیز دارد، اما ردیف میان ارائهدهنده leaderboard خنثی نیست. effort و ابزار عامل نتیجه را جدی تغییر میدهند.
ماتریس درونخانواده مفید است. Flash در GPQA از ۷۱٫۲ بدون thinking به ۸۷٫۴ High و ۸۸٫۱ Max میرود؛ Pro از ۷۲٫۹ به ۸۹٫۱ و ۹۰٫۱. در LiveCodeBench، Flash از ۵۵٫۲ به ۹۱٫۶ و Pro از ۵۶٫۸ به ۹۳٫۵ میرسد.
زمینه بلند نیز به بودجه حساس است. MRCR یکمیلیون Flash برابر ۳۷٫۵، ۷۶٫۹ و ۷۸٫۷ و Pro برابر ۴۴٫۷، ۸۳٫۳ و ۸۳٫۵ است. پنجره یکمیلیونی بدون reasoning کافی امتیاز headline را نمیدهد.
Flash با بودجه بیشتر روی برخی استدلالها نزدیک Pro میشود، ولی Pro برتری دانش و سختترین عامل را نگه میدارد. routing باید هزینه هر task پذیرفته را بسنجد. Flash نامزد throughput و Pro تنها برای رشد قابل اندازهگیری باشد.
در Pro Max، SWE Verified برابر ۸۰٫۶، SWE Pro برابر ۵۵٫۴، Multilingual برابر ۷۶٫۲، Terminal 2.0 برابر ۶۷٫۹، BrowseComp برابر ۸۳٫۴، HLE با ابزار ۴۸٫۲، MCPAtlas برابر ۷۳٫۶ و Toolathlon برابر ۵۱٫۸ است. فاصله نشان میدهد وب و مخزن قوی مساوی ترمینال یا ابزار ناهمگون نیست.
مقایسه حالت میگوید امتیاز عامل با effort رشد میکند، اما همیشه یکنواخت نه. MCPAtlas در Pro بهترتیب ۶۹٫۴، ۷۴٫۲ و ۷۳٫۶ است. reasoning بیشتر هنگام ابزار و تأخیر خودکار بهتر نیست.
آزمون محلی یک scaffold خنثی و scaffold تولید با مخزن، schema و سقف یکسان داشته باشد. راهنمای عملیات مدل باز ثابت کردن revision، dependency، sandbox و rollout را پوشش میدهد.
بهرهوری context سهم اصلی معماری است. کاهش ۹۰ درصدی KV cache نسبت به V3.2 در یک میلیون میتواند امکان سروینگ را عوض کند، ولی درصد از مبنای عظیم هنوز حافظه، شبکه و cache قابل توجه میخواهد.
MRCR برابر ۸۳٫۵ و CorpusQA برابر ۶۲٫۰ هم قابلیت و هم خطا را نشان میدهند. context را تنها چون وجود دارد پر نکنید. retrieval، summary، provenance و working set محلی دقت و هزینه را بهتر میکند.
اعتبارسنجی self-host باید latency و memory را از prompt کوتاه تا 128K، 384K و 1M رسم کند. تراکم distractor، جای شاهد، ابزار چندنوبتی و eviction آزموده شود. راهنمای مهندسی زمینه مدل تفاوت سقف و یادآوری مؤثر را توضیح میدهد.
سند حالت thinking روشن و خاموش کردن و effort کم، زیاد و حداکثر را در رابطهای سازگار مستند میکند. thinking پیشفرض High است. mapping خاص مدل است؛ درخواست low در تنظیم مستند روی V4-Pro به High نگاشت میشود.
در ابزار، reasoning_content باید در subrequest بعدی برگردد یا API خطای 400 میدهد. temperature و top-p در thinking نادیده گرفته میشوند. این جزئیات SDK میتواند شکست عامل و معیار بازتولیدناپذیر را توضیح دهد.
DeepSeek برای Pro Max محلی حداقل context 384K را توصیه و پوشه encoding اختصاصی بهجای Jinja میدهد. آن کد با وزن ثابت و custom code پس از review در محیط ایزوله بار شود.
MIT مجوز باز است و DeepSeek checkpoint مخلوط FP4/FP8 instruct و FP8 base منتشر میکند. در Pro پارامتر خبره FP4 و اغلب بقیه FP8 است. عملیات همچنان storage، interconnect، expert parallel، kernel سازگار، checksum و مسیر quantization مستند میخواهد.
API از OpenAI Chat Completions و Anthropic-compatible با base URL ثابت پشتیبانی میکند. مهاجرت alias باید شناسه صریح deepseek-v4-pro یا deepseek-v4-flash بگیرد. بازنشستگی ۲۴ ژوئیه deadline عملیاتی است، نه خبر مدل تازه.
سرویس میزبانی را پیش از self-host معیار بگیرید و prompt و outcome دقیق را مقایسه کنید. manifest برای shard، tokenizer، encoding، container، kernel و engine نگه دارید.
DeepSeek V4 خانواده وزنباز مهمی است: نقاط 1.6T/49B و 284B/13B، context یکمیلیون، معیار قوی کد و عامل، ماتریس effort و artifact MIT دارد. در روایت مدلهای شکلدهنده تابستان ۲۰۲۶ جای دارد.
اما در شمارش عرضه ۶ مه تا ۶ اوت داخل بازه نیست؛ تاریخ درست ۲۴ آوریل است. این استثنا مجموعه را بدون جعل زمان کامل میکند. ارزیابی با Flash و Pro High در آزمون هزینه-کیفیت آغاز، Max برای مورد توجیهشده ذخیره و استقرار باز یک برنامه جدی سیستم توزیعشده تلقی شود.

انتشار وزنباز ۲۵ تیر Moonshot معماری هیبریدی ۲٫۸ تریلیونی را با معیار قوی کد، ابزار، پژوهش و چندوجهی ترکیب میکند.
ادامه مطلب
مدل Apache-2.0 در ۱۵ تیر بازخورد preview را به مسیر فعال کوچک، عامل قویتر، زمینه ۲۵۶K و پایداری عملی محصول تبدیل میکند.
ادامه مطلب
انتشار MIT در ۲۶ خرداد Z.ai با نمایه تنک مشترک و effort قابل تنظیم، ترمینال، مخزن، ابزار و کار طولانی را نسبت به GLM-5.1 بهبود میدهد.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.