
Tencent Hy3؛ مدل MoE باز ۲۹۵B با ۲۱B فعال
مدل Apache-2.0 در ۱۵ تیر بازخورد preview را به مسیر فعال کوچک، عامل قویتر، زمینه ۲۵۶K و پایداری عملی محصول تبدیل میکند.
ادامه مطلبپژوهش ژرف ایآی
میز انتشار مدل

انویدیا در ۴ ژوئن ۲۰۲۶، برابر با ۱۴ خرداد ۱۴۰۵ Nemotron 3 Ultra را بهعنوان مدل ترکیب متخصصان با ۵۵۰ میلیارد پارامتر کل، ۵۵ میلیارد فعال و زمینه یکمیلیون توکن عرضه کرد. اعلام فنی رسمی وزن را با داده آموزش، دستور، محیط RL و دارایی ارزیابی همراه میکند؛ بستهای بازتر از انتشار وزن تنها.
معماری لایه Mamba و Transformer، LatentMoE، پیشبینی چندتوکنی و NVFP4 را ترکیب میکند. انویدیا تا پنج برابر توان عملیاتی و تا ۳۰ درصد هزینه کمتر تکمیل وظیفه را گزارش میکند. این نسبتها به Blackwell، دقت، دسته و مجموعه مقایسه وابستهاند و نباید به هر سختافزار منتقل شوند.
مدل ۵۵۰B را ذخیره و ۵۵B را برای توکن فعال میکند. LatentMoE هزینه ارتباط مسیردهی را کاهش میدهد. ترکیب Mamba-Transformer بیشتر توالی را با مسیر بازگشتی خطی و بخشی را با توجه دقیق پردازش میکند.
پنجره یکمیلیونی برای مخزن و عامل بلند است. پیشبینی چندتوکنی سرعت decode را هدف میگیرد. NVFP4 وزن و محاسبه را برای Blackwell فشرده میکند. هر روش گلوگاه جدا—ظرفیت، زمینه، تولید یا سختافزار—را حل میکند.
این طرح عملکرد انتهابهانتها را ثابت نمیکند. ۵۵۰B همچنان سیستم چند GPU، ارتباط سریع، کش و هسته سازگار میخواهد. پارامتر فعال معادل ردپای حافظه کل نیست.

مواد عمومی ترکیبی از دقت و کاراییاند:
| ارزیابی یا سنجه | نتیجه | تفسیر |
|---|---|---|
| PinchBench | ۹۱ | توان عامل چندمرحلهای در جدول NVIDIA |
| EnterpriseOps | ۳۳ | کار عملیاتی سازمانی |
| Terminal-Bench 2.0 | ۵۴ | حل عامل خط فرمان در تنظیم نامبرده |
| IFBench | ۸۲ | پیروی از دستور |
| GDPval-AA | ۱٬۴۴۸ Elo | ترجیح کارشناس در کار حرفهای |
| ProfBench Search | ۵۶ | پژوهش و جستوجوی حرفهای |
| RULER در 1M | ۹۵ | بازیابی مصنوعی زمینه بلند |
| توان عملیاتی | تا ۵ برابر | وابسته به endpoint و سختافزار |
| هزینه وظیفه | تا ۳۰٪ کمتر | برای آزمونهای عامل منتخب |
Terminal 2.0 با 2.1 فرق دارد. RULER کار کامل کسبوکار نیست. Elo به رقبا وابسته است و بیشینههای سرعت الزاماً همزمان رخ نمیدهند. جدول پروفایل منبع است، نه رتبه جهان.
انویدیا وزن، داده پیش و پسآموزش، دستور، نرمافزار و محیط RL را توصیف میکند. OpenMDW و داراییهای مرتبط امکان بازرسی و تخصصدهی بیشتری فراهم میکنند.
هر دارایی مجوز و منشأ جدا دارد. «باز» یک کلید نیست. وزن، دیتاست، کد، کانتینر و جزء ثالث باید جدا فهرست شوند. مجوز داده میتواند با مدل فرق داشته باشد.
کارت رسمی مدل را با revision و هش ثابت کنید. چکپوینت کوانتیزه ارزیابی خود را لازم دارد. حتی تیمی که توان پیشآموزش ندارد از دستور باز برای تحقیق سود میبرد.
یک میلیون توکن میتواند مخزن، پرونده حقوقی یا ردپای طولانی را نگه دارد. RULER قوی نشان میدهد بازیابی کنترلشده خوب است. اما کار واقعی فایل تکراری، دستور قدیمی، اصلاح متناقض و log نامرتبط دارد.
واقعیت را در عمق مختلف، تغییر دیرهنگام و ارجاع چندفایل آزمایش کنید. prefill و کش را بسنجید. زمینهای که چند دقیقه پیش از نخستین عمل مصرف کند شاید اقتصادی نباشد.
زمینه بلند سطح تزریق دستور را بزرگ میکند. فایل بازیابیشده داده نامطمئن است. محتوا را از کنترل جدا، ابزار را محدود و منبع تصمیم را در سطح فایل و ناحیه ثبت کنید.
ادعای پنج برابر نتیجه همطراحی سختافزار و نرمافزار است. NVFP4 جابهجایی حافظه را کم و Tensor Core را روی Blackwell پرکارتر میکند. گزارش بعدی میگوید چکپوینت NVFP4 در decode سنگین تا ۵٫۹ برابر GLM-5.1 FP4 سریعتر بوده و بیشتر دقت BF16 را حفظ کرده است.
این نتیجه برای H100، Apple silicon یا موتور دلخواه نیست. حساسیت کوانتیزه در زبان و وظیفه فرق دارد. prefill زمینه بلند نیز گلوگاه دیگری است. کیفیت را در برابر توان عملیاتی برای دسته و طول واقعی رسم کنید.
هزینه وظیفه از توکن بر ثانیه بهتر است. صرفهجویی ۳۰ درصدی به توکن کل و هر turn کمتر نسبت داده میشود. آن را با کار، پذیرش و قیمت زیرساخت یکسان تأیید کنید.
Nemotron پایه عامل حوزهای است. تقطیر on-policy چندمعلم از بیش از ده معلم تخصصی بازخورد میگیرد. داده و دستور باز توسعه حقوقی، مهندسی یا سازمانی را آسان میکنند.
تخصصدهی میتواند کیفیت عمومی را پایین آورد. fine-tune باید رگرسیون و ایمنی عمومی را حفظ کند. داده مصنوعی به منشأ، فیلتر و rubric نیاز دارد. امتیاز حوزه ممکن است همزمان پیروی دستور یا چندزبانه را کاهش دهد.
کار بعدی RTL با ۹۷٫۱ درصد، شاهد سامانه ACE-RTL و گردش تخصصی است، نه مدل خام ژوئن. لایه عامل باید همیشه در برچسب معیار بماند.
مدل ۵۵۰B دسکتاپی نیست. استقرار به توزیع، شبکه پرسرعت، موازیسازی، بازیابی شکست و مشاهدهپذیری نیاز دارد. ابتدا مرجع کوچک BF16 یا endpoint معتبر را بازتولید و بعد NVFP4 را در همزمانی و زمینه هدف آزمایش کنید.
توان هر کاربر، توکن اول، انرژی، تکمیل و واریانس را ثبت و CUDA، driver، موتور و ابزار کوانتیزه را ثابت کنید. راهنمای عملیات مدل باز artifact و rollout و راهنمای ارزیابی مدل مرزی فهرست مقایسه را فراهم میکنند.
Nemotron برای سازمان دارای زیرساخت انویدیا و عامل خصوصی قابل تخصص مناسب است؛ مدل کوچکتر برای کار معمول اقتصادیتر است. ارزش انتشار در باز بودن فراتر از وزن و تمرکز بر هزینه وظیفه است. رهبری جهانی از جدول ثابت نمیشود؛ تصمیم با بازتولید روی سختافزار و حلقه عامل هدف به دست میآید.
ارزش تحقیقاتی بسته باز را از ارزش اجرای ۵۵۰B جدا کنید. شاید سازمان خود مدل را سرو نکند، اما از داده، محیط RL یا دستور برای بهبود مدل کوچکتر بهره ببرد. این استفاده در جدول توان خام دیده نمیشود، ولی میتواند مهمترین بازده انتشار باشد.
پایلوت تولیدی باید شکست گره، افت شبکه و بار همزمان را نیز شبیهسازی کند. عامل چندساعته در صورت از دست رفتن یک shard نباید کل مسیر را بیصدا تکرار کند. checkpoint، idempotency و بودجه ابزار، هزینه عملیاتی را کنترل میکنند.

مدل Apache-2.0 در ۱۵ تیر بازخورد preview را به مسیر فعال کوچک، عامل قویتر، زمینه ۲۵۶K و پایداری عملی محصول تبدیل میکند.
ادامه مطلب
انتشار MIT در ۲۶ خرداد Z.ai با نمایه تنک مشترک و effort قابل تنظیم، ترمینال، مخزن، ابزار و کار طولانی را نسبت به GLM-5.1 بهبود میدهد.
ادامه مطلب
مینیمکس توجه تنک، تصویر و ویدیوی بومی، استفاده از رایانه و کدنویسی مرزی را در یک مدل وزنباز برای کار طولانی ترکیب میکند.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.