
Tencent Hy3؛ مدل MoE باز ۲۹۵B با ۲۱B فعال
مدل Apache-2.0 در ۱۵ تیر بازخورد preview را به مسیر فعال کوچک، عامل قویتر، زمینه ۲۵۶K و پایداری عملی محصول تبدیل میکند.
ادامه مطلبپژوهش ژرف ایآی
میز انتشار مدل

کوهیر در ۲۰ مه ۲۰۲۶، برابر با ۳۰ اردیبهشت ۱۴۰۵ مدل Command A+ را با مجوز Apache 2.0 و امکان استقرار خصوصی عرضه کرد. مقاله فنی انتشار معماری تنک ترکیب متخصصان با ۲۱۸ میلیارد پارامتر کل و ۲۵ میلیارد فعال، زمینه ورودی ۱۲۸ هزار، خروجی حداکثر ۶۴ هزار، تصویر، استدلال، ابزار و پشتیبانی ۴۸ زبان را ثبت میکند.
این نسخه فقط Command A بزرگتر نیست. کوهیر توانهایی را که قبلاً میان مدل استدلال، بینایی و ترجمه تقسیم شده بودند در یک مدل جمع کرده است. اعلام حاکمیت زیرساخت هدف را روشن میکند: سازمان حساس باید بتواند مدل عامل را روی محیط خود اجرا کند و برای شروع به خوشه بسیار بزرگ نیاز نداشته باشد. کوانتیزه W4A4 طبق مشخصات میتواند روی دو H100 یا یک B200 اجرا شود.
وزن Command A+ با مجوز Apache 2.0 و در دقتهای BF16، FP8 و W4A4 توزیع شده است. سازمان میتواند فایل را دانلود، با موتور رایج سرو کند و تحت مجوز تغییر دهد. این انتشار وزنباز معناداری است.
وزن باز همه داده آموزش را آشکار نمیکند و مسئولیت سیاست، مجوز و ایمنی را حذف نمیسازد. سرویس میزبانی کوهیر و اجرای خودمدیریتشده حتی با نام یکسان دو محصول عملیاتیاند. منشأ فایل، هش، موتور، دقت و تنظیم باید ثبت شوند.
در یک متن روایی عدد ۲۴ میلیارد فعال دیده میشود، ولی جدول مشخصات و مستند ساختیافته ۲۵ میلیارد را میگویند؛ این مقاله مقدار ساختیافته را استفاده میکند. این اختلاف کوچک نشان میدهد هر عدد باید منبع و تاریخ داشته باشد.

طراحی ۲۱۸B/۲۵B ظرفیت ذخیره بزرگ را با محاسبه فعال نزدیک مدل متراکم کوچکتر ترکیب میکند. زمینه ۱۲۸ هزار برای بسته سند و بازیابی سازمانی مناسب است و خروجی ۶۴ هزار مسیر تحلیلی یا عامل طولانی را ممکن میسازد. ورودی تصویر نیز نمودار، اسلاید و صفحه را در همان مدل وارد میکند.
ادعای حداقل سختافزار بر کوانتیزه تهاجمی تکیه دارد. سرویس تولید به حافظه کش، دستهبندی، افزونگی و ظرفیت همزمانی نیاز دارد. افت W4A4 باید روی فارسی، جدول، عدد و ابزار محلی سنجیده شود.
کوهیر تا ۶۳ درصد توان خروجی بیشتر و ۱۷ درصد زمان توکن اول کمتر از Command A Reasoning را در تنظیم همسان گزارش میکند. این اندازهگیری روی HGX B200 انجام شده و وعده هر موتور نیست. رمزگشایی حدسی نیز ۱٫۵ تا ۱٫۶ برابر شتاب گزارششده دارد، اما پذیرش پیشنویس و اندازه دسته نتیجه را تعیین میکنند.
مجموعه نتیجه عمومی و ارزیابی داخلی North چنین تصویری میدهد:
| ارزیابی | Command A+ | مقایسه رسمی | معنا |
|---|---|---|---|
| τ²-Bench Telecom | ۸۵٪ | ۳۷٪ برای Command A Reasoning | ابزار چندمرحلهای سازمانی |
| Terminal-Bench Hard | ۲۵٪ | ۳٪ برای مدل قبلی | کار دشوار عامل ترمینال |
| MMMU-Pro | ۶۳٪ | نتیجه مدل یکپارچه | استدلال چندرشتهای تصویر و متن |
| MMMU | ۷۵٫۱٪ | ۶۵٫۳٪ برای Command A Vision | فهم عمومی چندوجهی |
| MathVista | ۸۰٫۶٪ | ۷۳٫۵٪ برای مدل بینایی قبلی | ریاضی روی تصویر |
| CharXiv Reasoning | ۵۲٫۷٪ | ۴۶٫۹٪ برای مدل قبلی | استدلال نمودار علمی |
| Artificial Analysis Index | ۳۷ | جایگاه قوی میان مدلهای باز | شاخص ترکیبی بیرونی |
جهش τ² بزرگ است، ولی به شبیهساز کاربر و محیط مخابرات وابسته است. Terminal-Bench Hard با Terminus-2 اجرا شده است. پیشپردازش تصویر و قید خروجی نیز بر معیار چندوجهی اثر دارند. راهنمای ارزیابی مدل مرزی روش کنترل این تفاوتها را شرح میدهد.
کوهیر برای North بهبود ۲۰ درصدی پاسخ عاملی، ۳۲ درصدی تحلیل صفحهگسترده و کیفیت حافظه ۵۴ درصد در برابر ۳۹ درصد را گزارش میکند. این معیارهای داخلی به کار واقعی نزدیکاند، اما مستقل بازتولیدپذیر نیستند.
معیار داخلی لزوماً بیارزش نیست؛ میتواند کاری را بسنجد که داده عمومی ندارد. اعتبار آن با نمونه وظیفه، داور و طبقه شکست بیشتر میشود. خریدار باید روش سطح وظیفه را بخواهد و بخشی را با فایل و مجوز خود بازسازی کند.
در عامل سند، درستی باید در سطح فیلد باشد. خلاصه روانی که عدد، پاورقی یا منبع را تغییر میدهد مردود است. صفحهگسترده نیازمند بررسی فرمول و ارجاع است و بازیابی باید پشتیبانی استناد را جدا از شباهت موضوعی بسنجد.
Command A+ پشتیبانی را از ۲۳ به ۴۸ زبان افزایش میدهد و فارسی، عربی، ژاپنی، کرهای و هندی را شامل میشود. کوهیر بهبود فشردهسازی توکن ۲۰ درصد برای عربی، ۱۶ درصد برای کرهای و ۱۸ درصد برای ژاپنی گزارش میکند. توکن کمتر هزینه را پایین و متن بیشتری را در زمینه ثابت نگه میدارد.
کارایی توکن مساوی کیفیت زبان نیست. فارسی باید از نظر نیمفاصله، حروف عربی و فارسی، تقویم، رقم، شناسه ترکیبی و ترتیب راستبهچپ آزموده شود. ترجمه باید نام، مبلغ، استناد و قالب را حفظ کند.
امتیاز خودکار ترجمه برای مقایسه کلی مفید است؛ ارتباط حساس به ویراستار بومی و واژهنامه حوزه نیاز دارد. حاکمیت مدل وقتی ارزش دارد که تجربه زبان محلی نیز دقیق باشد.
بسیاری از وزنهای مرزی پیش از کش و افزونگی به هشت شتابدهنده پرحافظه نیاز دارند. امکان شروع Command A+ روی یک B200 یا دو H100 آستانه آزمایش خصوصی را پایین میآورد. سازمان میتواند سند را داخل شبکه نگه دارد و وابستگی به رابط بیرونی را کاهش دهد.
اما سروینگ هنوز انتخاب موتور، هسته، کوانتیزه، حد زمینه و پایش میخواهد. ظرفیت باید با همزمانی و توزیع ورودی واقعی طراحی شود، نه حداقل کارت مدل. حداکثر شتابهای جدا را نیز نباید ضرب کرد و سرعت نظری ساخت.
هزینه مالکیت شامل شتابدهنده، ارکستراسیون، مشاهدهپذیری، امنیت، ارتقا و بازبینی است. برای حجم پایین شاید رابط میزبانی ارزانتر باشد. وزن باز انتخاب میدهد، نه تضمین اقتصادی بودن خودمیزبانی.
مدل برای عامل خصوصی، RAG، سند چندزبانه، SQL، صفحهگسترده و فرایند ابزارمحور مناسب است. مدل واحد میتواند مسیریابی میان چند Command قدیمی را حذف کند. برای لبه کوچک، زمینه بیش از ۱۲۸ هزار یا تیم بدون توان سروینگ ۲۱۸B، انتخاب روشن نیست.
مجموعه آزمون دوزبانه و چندوجهی از نمونه مجاز بسازید. BF16 یا FP8 را مرجع قرار دهید و W4A4 را با همان ورودی مقایسه کنید. تطبیق فیلد، استناد، موفقیت ابزار، صدک تأخیر، توکن و استفاده شتابدهنده را ثبت کنید. سند خصمانه، تزریق دستور، منبع متناقض و نیاز به امتناع را اضافه کنید.
ابزارها در محیط ایزوله و عمل مادی پشت تأیید انسان باشند. RAG را جدا از تولید بسنجید. ترجمه را انسان بومی، کد و SQL را محیط یکبارمصرف بررسی کند. راهنمای عملیات مدل باز کنترل نسخه و بازگشت پس از دانلود را پوشش میدهد.
Command A+ بهدلیل پیوند پیشرفت معیار با داستان استقرار خصوصی، انتشار مهمی است. مجوز باز، ظرفیت فعال محدود، چندوجهی و ۴۸ زبان آن را برای سازمان مقرراتپذیر جدی میکند. در عین حال، حداقل سختافزار با تولید کامل فرق دارد و معیار داخلی باید محلی بازتولید شود.
نتیجه مناسب، اجرای پایلوت کنترلشده در برابر مدل فعلی با هزینه هر نتیجه پذیرفتهشده است. شعار «هوش حاکمیتی» بهتنهایی تصمیم نیست؛ فایل قابل ردگیری، آزمون بومی، مجوز دقیق و عملیات پایدار آن را به تصمیم تبدیل میکنند.

مدل Apache-2.0 در ۱۵ تیر بازخورد preview را به مسیر فعال کوچک، عامل قویتر، زمینه ۲۵۶K و پایداری عملی محصول تبدیل میکند.
ادامه مطلب
مدل ۲ تیر میسترال، کادر، نوع بلوک، اطمینان، ۱۷۰ زبان، خودمیزبانی و امتیازهای پیشرو را همراه نقد صریح محدودیت بنچمارک عرضه میکند.
ادامه مطلب
انتشار MIT در ۲۶ خرداد Z.ai با نمایه تنک مشترک و effort قابل تنظیم، ترمینال، مخزن، ابزار و کار طولانی را نسبت به GLM-5.1 بهبود میدهد.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.