
Nemotron 3 Ultra؛ عامل باز ۵۵۰B با زمینه یکمیلیونی
مدل ۱۴ خرداد انویدیا وزن، داده و دستور را برای MoE با ۵۵ میلیارد پارامتر فعال، زمینه بلند، NVFP4 و عامل پرسرعت باز میکند.
ادامه مطلبپژوهش ژرف ایآی
میز انتشار مدل

تنسنت در ۶ ژوئیه ۲۰۲۶، برابر با ۱۵ تیر ۱۴۰۵ Hy3 را پس از preview آوریل رسمی کرد. اعلام شرکت معماری ۲۹۵ میلیارد پارامتر کل، ۲۱ میلیارد فعال و زمینه ۲۵۶ هزار را شرح میدهد. وزن و FP8 با Apache 2.0 در دسترساند.
بازخورد بیش از پنجاه محصول برای کد، دفتر، مدل مالی، frontend، بازی و رایانه وارد پسآموزش شده است. تنسنت میگوید مصرف preview بیست برابر شد و آن ترافیک برای پایداری استفاده شد. شاهد ترکیبی از معیار عمومی، مطالعه کور کارشناس و نرخ عیب داخلی است.
کارت رسمی ۸۰ لایه، ۱۹۲ متخصص با انتخاب هشت، ۶۴ head و ۸ KV head، عرض ۴٬۰۹۶ و لایه MTP با ۳٫۸B را ثبت میکند. BF16 و FP8 توزیع شدهاند.
۲۱B از ۲۹۵B برای توکن فعال است؛ مسیر محاسبه نسبتاً کوچک و ظرفیت ذخیره بزرگ. MTP توکن آینده را پیشنهاد میدهد. زمینه ۲۵۶K مخزن و بسته دفتر را بدون بار یکمیلیونی میگیرد.
وزن باز self-host را ممکن میکند، ولی ۲۹۵B چند GPU میخواهد. عدد فعال ذخیره، ارتباط متخصص و کش را نشان نمیدهد.

کارت و metadata ارزیابی میگویند:
| ارزیابی | Hy3 | موضوع |
|---|---|---|
| SWE-bench Verified | ۷۸٫۰ | حل مسئله مخزن |
| SWE-bench Pro | ۵۷٫۹ | مخزن دشوارتر |
| GPQA Diamond | ۹۰٫۴ | علوم تحصیلات تکمیلی |
| HLE | ۵۳٫۲ | پرسش دشوار در تنظیم کارت |
| SkillsBench | ۵۵٫۳ | مهارت و ابزار |
| Long-Horizon Terminal | ۲۸٫۸ | کار ترمینال کشیده |
| مطالعه ۲۷۰ کارشناس | ۲٫۶۷ از ۴ | GLM-5.1 برابر ۲٫۵۱ |
| نرخ مسئله چندturn | ۷٫۹٪ | پایین از ۱۷٫۴٪ |
appendix تصویر ردیف بیشتری دارد. revision دقیق کارت را استفاده کنید چون metadata میتواند تغییر کند. مطالعه کارشناس به utility نزدیک است، ولی مستقل نیست.
preview در ۲۳ آوریل خارج بازه بود. نسخه ژوئیه پسآموزش تازه بر بازخورد محصول است، نه مقاله دیرهنگام. WorkBuddy، Yuanbao، ima و Marvis منبع سناریو بودهاند.
این بازخورد دستور و ابزار را بهتر میکند و ممکن است به توزیع محصول Tencent سوگیری دهد. تیم بیرونی وظیفه خود را لازم دارد.
رشد مصرف شاهد پذیرش است، نه کیفیت. official را با preview در پوسته همسان مقایسه کنید تا بهبود جدا شود.
تنسنت از اختلاط واقعیت، جعل، تناقض، coreference و حفظ قید میگوید. نرخ مسئله چندturn ۱۷٫۴ به ۷٫۹ میرسد. مطالعه کور ۲٫۶۷ در برابر ۲٫۵۱ GLM-5.1 و مزیت بیشتر در frontend، داده و CI/CD دارد.
این شکستها واقعیاند، ولی روش داخلی نیازمند تعریف denominator، تعداد، زبان و داور است. فارسی باید مکالمه بلند با تغییر تاریخ، مبلغ، نام و مجوز داشته باشد. آخرین دستور صریح باید بدون حذف شناسه قبلی دنبال شود.
نرخ عیب را به شدت تفکیک کنید. تناقض جزئی و تغییر مبلغ یک اثر ندارند.
Verified ۷۸ و Pro ۵۷٫۹ مدل را در رده باز معتبر قرار میدهند. فاصله نشان میدهد diff بزرگ هنوز سخت است. ترمینال بلند ۲۸٫۸ نیز دشواری امتداد را نشان میدهد.
آزمون، diff کم و review لازم است. فایل مالی و دفتر باید فرمول، reference و شاهد داشته باشد. ظاهر خوب ممکن است منطق پنهان غلط داشته باشد.
ابزار schema و مجوز میخواهد و رایانه حساب ایزوله و تأیید. راهنمای عامل مهندسی نرمافزار کنترل اجرا را ارائه میکند.
Apache 2.0 در Hugging Face و کانال رسمی است. TokenHub API و پلتفرم ثالث اضافه میشوند. self-host و API حریم، تأخیر و تکرار متفاوت دارند.
revision، مجوز، توکنایزر، template، دقت و موتور را ثابت کنید. BF16 و FP8 را روی کد، زبان، ابزار و زمینه مقایسه کنید. routing و MTP باید در runtime کار کنند.
راهنمای عملیات مدل باز زنجیره را میدهد. GGUF جامعه مشتق جدا با منشأ و آزمون خود است.
Hy3 برای سازمان خواهان مدل Apache با active متوسط، ۲۵۶K و پسآموزش محصول جذاب است. کوچک محلی نیست و نرخ داخلی تضمین جهانی نیست. معماری شفاف، وزن و داستان preview شواهد قویاند. مخزن سخت، ترمینال بلند و زبان محلی را پیش از تولید تکرار کنید.
اندازه کل 295B و مسیر فعال 21B، Hy3 را برای استقرار تنک جذاب میکند، اما پارامتر فعال کل footprint را تعیین نمیکند. عملیات باید همه وزن خبره را ذخیره و توزیع، توکن را میان دستگاهها route، KV cache زمینه 256K را نگهداری و لایه MTP با 3.8B پارامتر را پشتیبانی کند. checkpointهای BF16 و FP8 برنامه ظرفیت و کیفیت جدا میخواهند.
revision مخزن Tencent، مجوز، tokenizer، configuration، remote code، قالب عددی، engine سروینگ، kernel و digest کانتینر را ثابت کنید. checksum پیش از انتقال artifact به registry داخلی تأیید شود. custom code در build ایزوله اجرا و SBOM تولید شود. endpoint میزبانیشده را با هر دقت self-host روی prompt یکسان مقایسه کنید تا تغییر ناشی از سروینگ با تفاوت مدل اشتباه نشود.
ماتریس کدنویسی، ابزار، دانش، context بلند، چندزبانه و بازیابی شکست بسازید. در کد، test ضعیف، monorepo، فایل generated و dependency خراب؛ در ابزار، schema، خطای permission، وضعیت کهنه و rate limit؛ و در context، شاهد در موقعیتهای گوناگون میان distractor واقعی قرار گیرد. یادآوری مؤثر، latency و memory سنجیده شود، نه فقط پذیرش درخواست 256K.
موفقیت task، تلاش ناامن، ادعای تکمیل توهمی، توکن خروجی و reasoning قابل مشاهده، تعداد ابزار، زمان، حافظه شتابدهنده، throughput، انرژی و دقیقه بازبین را گزارش کنید. کار عامل nondeterministic چند seed داشته باشد. build self-host تنها وقتی پذیرفته است که کیفیت پس از restart بازتولید، failover امن و rollback به revision شناختهشده بدون از دست دادن trace ممکن باشد.
وزن Apache 2.0 اصلاح و توزیع را زیر شرایط خود پشتیبانی میکند، اما quantization، fine-tune، adapter و template سروینگ artifact حاکمیتی تازهاند. هرکدام ارزیابی، checksum، منشأ و رکورد مجوز جدا میخواهند. باز بودن کنترل استقرار میدهد و پاسخگویی عملیاتی را حذف نمیکند.
برای مقایسه اقتصادی، هزینه دانلود و نگهداری وزن، storage، شبکه expert parallel، زمان گرمشدن، ظرفیت idle و مهندس on-call را کنار قیمت API بگذارید. active 21B ممکن است محاسبه هر توکن را پایین آورد، ولی جابهجایی و نگهداری کل 295B رایگان نیست. نمودار هزینه باید در بار واقعی و صدک ترافیک ساخته شود.
در rollout، ابتدا endpoint سایه بدون action، سپس کار read-only و بعد patch برگشتپذیر فعال شود. ابزار write، ارسال، deploy و حذف مجوز مستقل داشته باشد. اگر مدل با timeout یا خطای سرور روبهرو شد، نتیجه action قبلی دوباره مشاهده شود و retry کور انجام نشود.
پذیرش فارسی باید دستور، کد، سند و ابزار با متن راستبهچپ، شناسه لاتین و عدد مختلط را پوشش دهد. پاسخ روان بهتنهایی کافی نیست؛ حفظ identifier، citation، schema JSON و معنای مجوز لازم است. fine-tune محلی نیز نباید معیار انگلیسی را تنها gate قرار دهد.

مدل ۱۴ خرداد انویدیا وزن، داده و دستور را برای MoE با ۵۵ میلیارد پارامتر فعال، زمینه بلند، NVFP4 و عامل پرسرعت باز میکند.
ادامه مطلب
انتشار ۱۹ اردیبهشت بایدو، ERNIE 5.0 را فشرده میکند، آموزش تقویتی را از نو میسازد و توان پرچمدار را با هزینه آموزشی بسیار کمتر گزارش میدهد.
ادامه مطلب
خانواده ۳۰ تیر Google یک مدل کاری قویتر، مدل حجمی با سرعت ۳۵۰ توکن و متخصص امنیت محدودشده را کنار هم میآورد.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.