Nemotron 3 Ultra؛ عامل باز ۵۵۰B با زمینه یک‌میلیونی

پ

پژوهش ژرف ای‌آی

میز انتشار مدل

۱۴ خرداد ۱۴۰۵به‌روزرسانی ۱۵ مرداد ۱۴۰۵۶ دقیقه مطالعه
Nemotron 3 Ultra؛ عامل باز ۵۵۰B با زمینه یک‌میلیونی

انویدیا در ۴ ژوئن ۲۰۲۶، برابر با ۱۴ خرداد ۱۴۰۵ Nemotron 3 Ultra را به‌عنوان مدل ترکیب متخصصان با ۵۵۰ میلیارد پارامتر کل، ۵۵ میلیارد فعال و زمینه یک‌میلیون توکن عرضه کرد. اعلام فنی رسمی وزن را با داده آموزش، دستور، محیط RL و دارایی ارزیابی همراه می‌کند؛ بسته‌ای بازتر از انتشار وزن تنها.

معماری لایه Mamba و Transformer، LatentMoE، پیش‌بینی چندتوکنی و NVFP4 را ترکیب می‌کند. انویدیا تا پنج برابر توان عملیاتی و تا ۳۰ درصد هزینه کمتر تکمیل وظیفه را گزارش می‌کند. این نسبت‌ها به Blackwell، دقت، دسته و مجموعه مقایسه وابسته‌اند و نباید به هر سخت‌افزار منتقل شوند.

معماری در زبان عملیات

مدل ۵۵۰B را ذخیره و ۵۵B را برای توکن فعال می‌کند. LatentMoE هزینه ارتباط مسیر‌دهی را کاهش می‌دهد. ترکیب Mamba-Transformer بیشتر توالی را با مسیر بازگشتی خطی و بخشی را با توجه دقیق پردازش می‌کند.

پنجره یک‌میلیونی برای مخزن و عامل بلند است. پیش‌بینی چندتوکنی سرعت decode را هدف می‌گیرد. NVFP4 وزن و محاسبه را برای Blackwell فشرده می‌کند. هر روش گلوگاه جدا—ظرفیت، زمینه، تولید یا سخت‌افزار—را حل می‌کند.

این طرح عملکرد انتهابه‌انتها را ثابت نمی‌کند. ۵۵۰B همچنان سیستم چند GPU، ارتباط سریع، کش و هسته سازگار می‌خواهد. پارامتر فعال معادل ردپای حافظه کل نیست.

توربینی ماژولار متخصص تنک، زمینه بلند و مسیر کم‌دقت پرسرعت را نشان می‌دهد.
توربینی ماژولار متخصص تنک، زمینه بلند و مسیر کم‌دقت پرسرعت را نشان می‌دهد.

تصویر معیار و سیستم

مواد عمومی ترکیبی از دقت و کارایی‌اند:

ارزیابی یا سنجهنتیجهتفسیر
PinchBench۹۱توان عامل چندمرحله‌ای در جدول NVIDIA
EnterpriseOps۳۳کار عملیاتی سازمانی
Terminal-Bench 2.0۵۴حل عامل خط فرمان در تنظیم نام‌برده
IFBench۸۲پیروی از دستور
GDPval-AA۱٬۴۴۸ Eloترجیح کارشناس در کار حرفه‌ای
ProfBench Search۵۶پژوهش و جست‌وجوی حرفه‌ای
RULER در 1M۹۵بازیابی مصنوعی زمینه بلند
توان عملیاتیتا ۵ برابروابسته به endpoint و سخت‌افزار
هزینه وظیفهتا ۳۰٪ کمتربرای آزمون‌های عامل منتخب

Terminal 2.0 با 2.1 فرق دارد. RULER کار کامل کسب‌وکار نیست. Elo به رقبا وابسته است و بیشینه‌های سرعت الزاماً هم‌زمان رخ نمی‌دهند. جدول پروفایل منبع است، نه رتبه جهان.

بسته باز فراتر از وزن

انویدیا وزن، داده پیش و پس‌آموزش، دستور، نرم‌افزار و محیط RL را توصیف می‌کند. OpenMDW و دارایی‌های مرتبط امکان بازرسی و تخصص‌دهی بیشتری فراهم می‌کنند.

هر دارایی مجوز و منشأ جدا دارد. «باز» یک کلید نیست. وزن، دیتاست، کد، کانتینر و جزء ثالث باید جدا فهرست شوند. مجوز داده می‌تواند با مدل فرق داشته باشد.

کارت رسمی مدل را با revision و هش ثابت کنید. چک‌پوینت کوانتیزه ارزیابی خود را لازم دارد. حتی تیمی که توان پیش‌آموزش ندارد از دستور باز برای تحقیق سود می‌برد.

زمینه بلند و سطح خطر

یک میلیون توکن می‌تواند مخزن، پرونده حقوقی یا ردپای طولانی را نگه دارد. RULER قوی نشان می‌دهد بازیابی کنترل‌شده خوب است. اما کار واقعی فایل تکراری، دستور قدیمی، اصلاح متناقض و log نامرتبط دارد.

واقعیت را در عمق مختلف، تغییر دیرهنگام و ارجاع چندفایل آزمایش کنید. prefill و کش را بسنجید. زمینه‌ای که چند دقیقه پیش از نخستین عمل مصرف کند شاید اقتصادی نباشد.

زمینه بلند سطح تزریق دستور را بزرگ می‌کند. فایل بازیابی‌شده داده نامطمئن است. محتوا را از کنترل جدا، ابزار را محدود و منبع تصمیم را در سطح فایل و ناحیه ثبت کنید.

توان NVFP4 و هزینه وظیفه

ادعای پنج برابر نتیجه هم‌طراحی سخت‌افزار و نرم‌افزار است. NVFP4 جابه‌جایی حافظه را کم و Tensor Core را روی Blackwell پرکارتر می‌کند. گزارش بعدی می‌گوید چک‌پوینت NVFP4 در decode سنگین تا ۵٫۹ برابر GLM-5.1 FP4 سریع‌تر بوده و بیشتر دقت BF16 را حفظ کرده است.

این نتیجه برای H100، Apple silicon یا موتور دلخواه نیست. حساسیت کوانتیزه در زبان و وظیفه فرق دارد. prefill زمینه بلند نیز گلوگاه دیگری است. کیفیت را در برابر توان عملیاتی برای دسته و طول واقعی رسم کنید.

هزینه وظیفه از توکن بر ثانیه بهتر است. صرفه‌جویی ۳۰ درصدی به توکن کل و هر turn کمتر نسبت داده می‌شود. آن را با کار، پذیرش و قیمت زیرساخت یکسان تأیید کنید.

تخصص‌دهی عامل و ریسک آن

Nemotron پایه عامل حوزه‌ای است. تقطیر on-policy چندمعلم از بیش از ده معلم تخصصی بازخورد می‌گیرد. داده و دستور باز توسعه حقوقی، مهندسی یا سازمانی را آسان می‌کنند.

تخصص‌دهی می‌تواند کیفیت عمومی را پایین آورد. fine-tune باید رگرسیون و ایمنی عمومی را حفظ کند. داده مصنوعی به منشأ، فیلتر و rubric نیاز دارد. امتیاز حوزه ممکن است هم‌زمان پیروی دستور یا چندزبانه را کاهش دهد.

کار بعدی RTL با ۹۷٫۱ درصد، شاهد سامانه ACE-RTL و گردش تخصصی است، نه مدل خام ژوئن. لایه عامل باید همیشه در برچسب معیار بماند.

واقعیت استقرار و حکم

مدل ۵۵۰B دسکتاپی نیست. استقرار به توزیع، شبکه پرسرعت، موازی‌سازی، بازیابی شکست و مشاهده‌پذیری نیاز دارد. ابتدا مرجع کوچک BF16 یا endpoint معتبر را بازتولید و بعد NVFP4 را در هم‌زمانی و زمینه هدف آزمایش کنید.

توان هر کاربر، توکن اول، انرژی، تکمیل و واریانس را ثبت و CUDA، driver، موتور و ابزار کوانتیزه را ثابت کنید. راهنمای عملیات مدل باز artifact و rollout و راهنمای ارزیابی مدل مرزی فهرست مقایسه را فراهم می‌کنند.

Nemotron برای سازمان دارای زیرساخت انویدیا و عامل خصوصی قابل تخصص مناسب است؛ مدل کوچک‌تر برای کار معمول اقتصادی‌تر است. ارزش انتشار در باز بودن فراتر از وزن و تمرکز بر هزینه وظیفه است. رهبری جهانی از جدول ثابت نمی‌شود؛ تصمیم با بازتولید روی سخت‌افزار و حلقه عامل هدف به دست می‌آید.

ارزش تحقیقاتی بسته باز را از ارزش اجرای ۵۵۰B جدا کنید. شاید سازمان خود مدل را سرو نکند، اما از داده، محیط RL یا دستور برای بهبود مدل کوچک‌تر بهره ببرد. این استفاده در جدول توان خام دیده نمی‌شود، ولی می‌تواند مهم‌ترین بازده انتشار باشد.

پایلوت تولیدی باید شکست گره، افت شبکه و بار هم‌زمان را نیز شبیه‌سازی کند. عامل چندساعته در صورت از دست رفتن یک shard نباید کل مسیر را بی‌صدا تکرار کند. checkpoint، idempotency و بودجه ابزار، هزینه عملیاتی را کنترل می‌کنند.

یادداشت منابع — بازبینی ۲۰۲۶

#Nemotron 3 Ultra#انویدیا#وزن باز#عامل هوش مصنوعی#زمینه بلند

مطالب مرتبط

آماده شروع پروژه هوش مصنوعی خود هستید؟

با تیم ما تماس بگیرید و درباره نحوه کمک به کسب‌وکار خود صحبت کنید.