DeepSeek V4 Pro و Flash؛ انتشار آوریل پشت چرخه تابستان

پ

پژوهش ژرف ای‌آی

میز انتشار مدل

۴ اردیبهشت ۱۴۰۵به‌روزرسانی ۱۵ مرداد ۱۴۰۵۷ دقیقه مطالعه
DeepSeek V4 Pro و Flash؛ انتشار آوریل پشت چرخه تابستان

DeepSeek خانواده وزن‌باز V4 Preview را در ۲۴ آوریل ۲۰۲۶، برابر با ۴ اردیبهشت ۱۴۰۵ منتشر کرد. این تاریخ دوازده روز پیش از بازه اصلی ۶ مه تا ۶ اوت مجموعه است. آن را به‌عنوان استثنای زمینه‌ای روشن می‌آوریم، زیرا بررسی آزمایشگاه‌های بزرگ اگر migration رابط یا به‌روزرسانی مخزن را به‌جای عرضه جا بزند از حفظ گاه‌شماری واقعی کم‌دقت‌تر خواهد بود.

یادداشت رسمی DeepSeek-V4-Pro با ۱٫۶ تریلیون پارامتر کل و ۴۹ میلیارد فعال، و V4-Flash با ۲۸۴ میلیارد کل و ۱۳ میلیارد فعال را معرفی کرد. هر دو زمینه یک‌میلیون، حالت thinking و non-thinking، API و وزن MIT دارند.

چرا ۲۴ آوریل تاریخ درست است

تغییرات API V4-Pro و V4-Flash را در ۲۴ آوریل ثبت می‌کند. revision بعدی کارت، quantization و بازنشستگی aliasهای deepseek-chat و deepseek-reasoner در ۲۴ ژوئیه انتشار مدل تازه نیستند. در گذار، aliasها به حالت غیرتفکر و تفکر V4-Flash اشاره می‌کردند.

این تمایز برای گاه‌شماری و بازتولید مهم است. تاریخ اعلام زمان دسترسی خانواده و revision مخزن artifact آزموده‌شده را پاسخ می‌دهد. رکورد ممیزی هر دو را می‌خواهد، اما publishedAt نباید برای جا دادن انتشار قدیمی جلو آورده شود.

پس دفتر تابستان V4 را در شمارش بازه نمی‌آورد و این مقاله زمینه DeepSeek خواسته‌شده را شفاف تکمیل می‌کند.

دو ساختار تنک DeepSeek در اقیانوس یک‌میلیون‌توکنی امتداد دارند و نشانگر بیرون بازه تابستان روشن است.
دو ساختار تنک DeepSeek در اقیانوس یک‌میلیون‌توکنی امتداد دارند و نشانگر بیرون بازه تابستان روشن است.

معماری و artifact باز

V4-Pro مدل MoE با ۱٫۶T ذخیره و 49B فعال در هر توکن است. Flash مقدار 284B ذخیره و 13B فعال دارد. هر دو یک میلیون توکن را پشتیبانی می‌کنند. DeepSeek از بیش از ۳۲ تریلیون توکن پیش‌آموزش، SFT و GRPO تخصصی و سپس distillation درون‌خط به مدل یکپارچه می‌گوید.

معماری Compressed Sparse Attention و Heavily Compressed Attention را ترکیب می‌کند. در context یک‌میلیون، Pro طبق گزارش ۲۷ درصد FLOP استنتاج تک‌توکن و ۱۰ درصد KV cache مدل V3.2 را می‌خواهد. mHC برای پایداری سیگنال و Muon برای همگرایی به کار رفته‌اند.

کارت رسمی V4-Pro وزن base و instruct، encoding، راهنمای محلی، جدول و مجوز MIT را می‌دهد. وزن باز بازرسی و self-host را ممکن می‌کند، اما checkpoint 1.6T پروژه چندگره‌ای است.

جدول رسمی Pro Max

DeepSeek برای V4-Pro با effort حداکثر گزارش می‌کند:

معیارV4-Pro Maxنشانه
MMLU-Pro۸۷٫۵دانش دشوار عمومی
GPQA Diamond۹۰٫۱استدلال علوم تحصیلات تکمیلی
Humanity's Last Exam۳۷٫۷دانش خبره بدون ابزار
LiveCodeBench۹۳٫۵کدنویسی رقابتی جاری
Codeforces rating۳۲۰۶برنامه‌نویسی مسابقه‌ای
MRCR در 1M۸۳٫۵بازیابی چندسوزنی بلند
SWE-bench Verified۸۰٫۶حل issue مخزن
SWE-bench Pro۵۵٫۴مجموعه سخت‌تر مخزن
BrowseComp۸۳٫۴پژوهش وب با عامل
MCPAtlas۷۳٫۶هماهنگی سرور ابزار

این مقادیر از کارت DeepSeek با harness، sampling و بودجه Max می‌آیند. جدول رقبا نیز دارد، اما ردیف میان ارائه‌دهنده leaderboard خنثی نیست. effort و ابزار عامل نتیجه را جدی تغییر می‌دهند.

Pro، Flash و effort

ماتریس درون‌خانواده مفید است. Flash در GPQA از ۷۱٫۲ بدون thinking به ۸۷٫۴ High و ۸۸٫۱ Max می‌رود؛ Pro از ۷۲٫۹ به ۸۹٫۱ و ۹۰٫۱. در LiveCodeBench، Flash از ۵۵٫۲ به ۹۱٫۶ و Pro از ۵۶٫۸ به ۹۳٫۵ می‌رسد.

زمینه بلند نیز به بودجه حساس است. MRCR یک‌میلیون Flash برابر ۳۷٫۵، ۷۶٫۹ و ۷۸٫۷ و Pro برابر ۴۴٫۷، ۸۳٫۳ و ۸۳٫۵ است. پنجره یک‌میلیونی بدون reasoning کافی امتیاز headline را نمی‌دهد.

Flash با بودجه بیشتر روی برخی استدلال‌ها نزدیک Pro می‌شود، ولی Pro برتری دانش و سخت‌ترین عامل را نگه می‌دارد. routing باید هزینه هر task پذیرفته را بسنجد. Flash نامزد throughput و Pro تنها برای رشد قابل اندازه‌گیری باشد.

شاهد عامل و کدنویسی

در Pro Max، SWE Verified برابر ۸۰٫۶، SWE Pro برابر ۵۵٫۴، Multilingual برابر ۷۶٫۲، Terminal 2.0 برابر ۶۷٫۹، BrowseComp برابر ۸۳٫۴، HLE با ابزار ۴۸٫۲، MCPAtlas برابر ۷۳٫۶ و Toolathlon برابر ۵۱٫۸ است. فاصله نشان می‌دهد وب و مخزن قوی مساوی ترمینال یا ابزار ناهمگون نیست.

مقایسه حالت می‌گوید امتیاز عامل با effort رشد می‌کند، اما همیشه یکنواخت نه. MCPAtlas در Pro به‌ترتیب ۶۹٫۴، ۷۴٫۲ و ۷۳٫۶ است. reasoning بیشتر هنگام ابزار و تأخیر خودکار بهتر نیست.

آزمون محلی یک scaffold خنثی و scaffold تولید با مخزن، schema و سقف یکسان داشته باشد. راهنمای عملیات مدل باز ثابت کردن revision، dependency، sandbox و rollout را پوشش می‌دهد.

زمینه یک‌میلیون ادعای مهندسی است

بهره‌وری context سهم اصلی معماری است. کاهش ۹۰ درصدی KV cache نسبت به V3.2 در یک میلیون می‌تواند امکان سروینگ را عوض کند، ولی درصد از مبنای عظیم هنوز حافظه، شبکه و cache قابل توجه می‌خواهد.

MRCR برابر ۸۳٫۵ و CorpusQA برابر ۶۲٫۰ هم قابلیت و هم خطا را نشان می‌دهند. context را تنها چون وجود دارد پر نکنید. retrieval، summary، provenance و working set محلی دقت و هزینه را بهتر می‌کند.

اعتبارسنجی self-host باید latency و memory را از prompt کوتاه تا 128K، 384K و 1M رسم کند. تراکم distractor، جای شاهد، ابزار چندنوبتی و eviction آزموده شود. راهنمای مهندسی زمینه مدل تفاوت سقف و یادآوری مؤثر را توضیح می‌دهد.

جزئیات یکپارچه‌سازی thinking

سند حالت thinking روشن و خاموش کردن و effort کم، زیاد و حداکثر را در رابط‌های سازگار مستند می‌کند. thinking پیش‌فرض High است. mapping خاص مدل است؛ درخواست low در تنظیم مستند روی V4-Pro به High نگاشت می‌شود.

در ابزار، reasoning_content باید در subrequest بعدی برگردد یا API خطای 400 می‌دهد. temperature و top-p در thinking نادیده گرفته می‌شوند. این جزئیات SDK می‌تواند شکست عامل و معیار بازتولیدناپذیر را توضیح دهد.

DeepSeek برای Pro Max محلی حداقل context 384K را توصیه و پوشه encoding اختصاصی به‌جای Jinja می‌دهد. آن کد با وزن ثابت و custom code پس از review در محیط ایزوله بار شود.

استقرار، مجوز و مهاجرت

MIT مجوز باز است و DeepSeek checkpoint مخلوط FP4/FP8 instruct و FP8 base منتشر می‌کند. در Pro پارامتر خبره FP4 و اغلب بقیه FP8 است. عملیات همچنان storage، interconnect، expert parallel، kernel سازگار، checksum و مسیر quantization مستند می‌خواهد.

API از OpenAI Chat Completions و Anthropic-compatible با base URL ثابت پشتیبانی می‌کند. مهاجرت alias باید شناسه صریح deepseek-v4-pro یا deepseek-v4-flash بگیرد. بازنشستگی ۲۴ ژوئیه deadline عملیاتی است، نه خبر مدل تازه.

سرویس میزبانی را پیش از self-host معیار بگیرید و prompt و outcome دقیق را مقایسه کنید. manifest برای shard، tokenizer، encoding، container، kernel و engine نگه دارید.

جمع‌بندی و وضعیت بازه

DeepSeek V4 خانواده وزن‌باز مهمی است: نقاط 1.6T/49B و 284B/13B، context یک‌میلیون، معیار قوی کد و عامل، ماتریس effort و artifact MIT دارد. در روایت مدل‌های شکل‌دهنده تابستان ۲۰۲۶ جای دارد.

اما در شمارش عرضه ۶ مه تا ۶ اوت داخل بازه نیست؛ تاریخ درست ۲۴ آوریل است. این استثنا مجموعه را بدون جعل زمان کامل می‌کند. ارزیابی با Flash و Pro High در آزمون هزینه-کیفیت آغاز، Max برای مورد توجیه‌شده ذخیره و استقرار باز یک برنامه جدی سیستم توزیع‌شده تلقی شود.

یادداشت منابع — بازبینی ۲۰۲۶

#DeepSeek V4#DeepSeek V4 Pro#DeepSeek V4 Flash#وزن باز#ترکیب خبرگان

مطالب مرتبط

آماده شروع پروژه هوش مصنوعی خود هستید؟

با تیم ما تماس بگیرید و درباره نحوه کمک به کسب‌وکار خود صحبت کنید.