
GPT-5.6؛ خانواده Sol، Terra، Luna و عامل Ultra
خانواده ۱۸ تیر OpenAI مدل پرچمدار، متعادل و اقتصادی را با معیارهای پیشرو ترمینال، کد، مرور و علم و یک رده چندعاملی عرضه میکند.
ادامه مطلبپژوهش ژرف ایآی
میز انتشار مدل

بایدو در ۹ مه ۲۰۲۶، برابر با ۱۹ اردیبهشت ۱۴۰۵ مدل ERNIE 5.1 را عرضه کرد. این نسخه صرفاً تغییر نام یک سرویس قدیمی نیست؛ طبق اعلام رسمی انگلیسی بایدو، تعداد کل پارامترها در مقایسه با ERNIE 5.0 تقریباً به یکسوم و پارامترهای فعال به حدود نصف رسیده است. بایدو همچنین میگوید پیشآموزش این نسخه تنها نزدیک به شش درصد هزینه محاسباتی مدلهای هممقیاس را مصرف کرده است.
این ادعاها مهماند، اما نباید آنها را به معنای «مدل کوچکتر در همهچیز برنده شد» خواند. دستاورد اصلی، پیوند معماری تنک، مسیردهی انعطافپذیر متخصصان، زیرساخت آموزش تقویتی ناهمگام و ارزیابیهای عاملی است. اعداد این مقاله تا جایی که صریحاً خلاف آن ذکر نشده، گزارش خود بایدو هستند و هنوز بازتولید مستقل یکسانی برای همه آنها منتشر نشده است.
نشانی صفحه عبارت 0508 را دارد، اما هر دو نسخه انگلیسی و چینی صفحه تاریخ ۹ مه را نشان میدهند؛ بنابراین تاریخ فراداده همین روز است. ERNIE 5.1 دانش پایه نسخه 5.0 را حفظ میکند، ولی ظرفیت ذخیرهشده، مسیر فعال و اقتصاد آموزش را تغییر میدهد.
بایدو از «ظرفیت کشسان متخصصان» و top-k متغیر صحبت میکند. در آموزش، زیرمجموعههای متفاوتی از متخصصان نمونهگیری میشوند تا یک مدل بتواند در حالتهای تنکتر یا گستردهتر کار کند. مسیر کوچکتر میتواند هزینه و تأخیر را پایین بیاورد و مسیر گستردهتر برای پرسش دشوار ظرفیت بیشتری مصرف کند. با این حال، اعلامیه ابعاد کامل معماری یا دستور بازتولید آموزش را منتشر نمیکند.
تغییر دوم زیرساخت آموزش تقویتی کاملاً ناهمگام و تفکیکشده است. مسیرهای عامل طول برابر ندارند؛ یک مأموریت سریع تمام میشود و دیگری با جستوجو، ابزار و خطا بسیار طول میکشد. طراحی ناهمگام از انتظار کل دسته برای کندترین مسیر جلوگیری میکند و استفاده از سختافزار را بهتر میسازد.

شفافترین رکورد عمومی ترکیبی از امتیاز دقیق، جایگاه زنده و مقایسه نموداری است:
| ارزیابی | نتیجه ERNIE 5.1 | موضوع سنجش | محدودیت تفسیر |
|---|---|---|---|
| AIME 2026 با ابزار | ۹۹٫۶ | ریاضی مسابقهای با کمک ابزار | با اجرای بدون ابزار قابل قیاس مستقیم نیست |
| Arena Search | امتیاز ۱٬۲۲۳ و رتبه چهارم جهان در ۹ مه | ترجیح انسانی برای پاسخ جستوجویی | جایگاه زنده و وابسته به تاریخ است |
| τ³-bench | بالاتر از DeepSeek V4 Pro در گزارش بایدو | عامل چندمرحلهای و ابزار | بودجه و شبیهساز کاربر مهماند |
| SpreadsheetBench-Verified | بالاتر از DeepSeek V4 Pro در نمودار | اجرای کار صفحهگسترده | محیط و سیاست تلاش مجدد باید بازتولید شود |
| GPQA و MMLU-Pro | نزدیک مدلهای بسته پیشرو | دانش علمی و عمومی | متن صفحه همه مقدارهای نمودار را صریح نمیکند |
امتیاز ۹۹٫۶ با ابزار نشان میدهد سیستم در حل مسئله همراه ابزار قدرتمند است؛ نه اینکه خود مدل خام تقریباً همه سؤالها را در یک بار حل میکند. جایگاه Arena نیز ممکن است با رأیهای تازه عوض شود. راهنمای ارزیابی مدلهای مرزی توضیح میدهد چرا نسخه معیار، ابزار، زمان و روش داوری باید کنار عدد ثبت شوند.
در آموزش عامل، مسئله زمانبندی به اندازه الگوریتم یادگیری مهم است. مسیر کوتاه، خطا و پاداش را سریع تحویل میدهد؛ مسیر بلند شاید دهها ابزار را فراخوانی کند. اگر همه مسیرها همزمان منتظر بمانند، پردازندهها در پایان هر دسته بیکار میمانند. تفکیک تولید تجربه از یادگیری اجازه میدهد مسیرها مستقل وارد صف آموزش شوند.
بایدو همچنین بر سازگاری آموزش و استنتاج در FP8 تأکید میکند. اگر عامل با یک مسیر عددی تجربه تولید کند و مدل با مسیری متفاوت بهروزرسانی شود، احتمال توکنها میتواند تغییر کند و هدف آموزش نویزی شود. کتابخانه کمدقت یکپارچه در مخزن رسمی PaddlePaddle برای کاهش این اختلاف طراحی شده است.
این توضیح اثبات نمیکند که FP8 در همه وظایف بیافت است. پیام مهمتر این است که بایدو مدل، زمانبند مسیر، دقت عددی و سروینگ را یک سامانه واحد دیده است.
عبارت «یکسوم پارامترها» بهتنهایی هزینه را تعیین نمیکند. پارامتر کل ظرفیت ذخیرهشده را نشان میدهد، پارامتر فعال محاسبه هر توکن را، و هزینه واقعی به جابهجایی حافظه، ارتباط میان شتابدهندهها، طول زمینه، دستهبندی و هستههای اجرا نیز وابسته است.
top-k متغیر میتواند چند نقطه هزینه-کیفیت در یک مدل ایجاد کند. اما خریدار باید بداند آیا رابط عمومی عرض مسیر را در اختیار میگذارد، آیا سرویس بهطور پویا آن را تغییر میدهد و آیا کیفیت زبان یا ابزار خاص در حالت تنک افت میکند. ادعای شش درصد هزینه پیشآموزش نیز مخرج کاملاً مشترکی از سختافزار، تعداد توکن و انرژی منتشر نمیکند؛ پس باید آن را شاهد کارایی دستور داخلی دانست، نه نسبت جهانی هزینه.
در آزمایش خرید، هزینه هر پاسخ کافی نیست. هزینه هر نتیجه پذیرفتهشده، همراه تعداد تلاش مجدد و بازبینی انسان، معیار مناسبتری است.
ادعاهای مهمتر درباره جستوجو، نرمافزار و صفحهگستردهاند. این کارها پرسش ثابت نیستند؛ عامل باید وضعیت را ببیند، ابزار مناسب را انتخاب کند، خطا را تشخیص دهد و خروجی را بررسی کند. برای آزمون داخلی باید همه فراخوانیها، زمان، توکن، مجوز، تلاش مجدد و نتیجه نهایی ثبت شود.
در صفحهگسترده، فایلهایی با فرمول، سلول ادغامشده، تاریخ محلی، شیت مخفی و درخواست مبهم لازم است. در جستوجو، صحت استناد باید جدا از روانی متن سنجیده شود. در فرایند کسبوکار، مواردی را اضافه کنید که پاسخ درست توقف و درخواست تأیید است. توان انتخاب یک ابزار به معنای داشتن اختیار اجرای عمل نیست.
توان نگارش خلاق هم آزمون دیگری میخواهد. ارزیابی داخلی سبک میتواند مفید باشد، ولی با درستی واقعیت یکسان نیست. فارسی و چینی باید توسط ویراستار بومی از نظر لحن، اصطلاح، عدد و حفظ منبع بررسی شوند.
قویترین مورد استفاده برای سازمانهای داخل زیستبوم بایدو و جریانهای چینیزبان است. ترکیب جستوجو، دانش، نگارش و عامل با پشته PaddlePaddle میتواند برای حجم بالا اقتصادی باشد. انتشار همچنین نشانهای از روند بازار است: قابلیت مرزی بیش از گذشته از مسیردهی، پسآموزش، ابزار و مهندسی سیستم میآید و نه فقط شمار پارامتر.
ضعیفترین استدلال، مهاجرت تنها بر پایه رتبه Arena است. رتبه زنده نوسان دارد و الزاماً مزیت مشابهی در یک گردش انگلیسی یا فارسی ایجاد نمیکند. مقایسه باید با بودجه ابزار، زمان و هزینه کل یکسان انجام شود.
این مدل وزنباز معرفی نشده است. تجربه میزبانیشده و توضیح فنی بایدو با انتشار وزن، داده و دستور آموزش تفاوت دارد. سازمانی که استقرار خصوصی میخواهد باید این مرز را از ابتدا روشن کند.
شناسه دقیق مدل، حالت استدلال، حد زمینه و خروجی، محل نگهداری ورودی و ردپای ابزار، منطقه پردازش و سیاست تغییر نسخه باید مستند شوند. بدون این موارد، نتیجه ارزیابی قابل تکرار نیست. همچنین روشن کنید آیا مسیر متخصص قابل تنظیم است و سرویس چه زمانی نام مستعار را به نسخه تازه نگاشت میکند.
تأخیر را در سه سطح بسنجید: پاسخ خام مدل، چرخه کامل ابزار و زمانی که کاربر نتیجه قابل استفاده میگیرد. مدل ارزانتر ممکن است با مسیر طولانی و اصلاح بیشتر گران شود. مدل گرانتر نیز ممکن است با تکمیل درست در بار اول هزینه کل را کاهش دهد.
کنترلهای راهنمای عملیات مدل باز—ثبت نسخه، منشأ، مجموعه رگرسیون و بازگشت—برای سرویس بسته هم مفیدند. ERNIE 5.1 نامزد جدی آزمایش کنترلشده است، نه مجوز جایگزینی خودکار.

خانواده ۱۸ تیر OpenAI مدل پرچمدار، متعادل و اقتصادی را با معیارهای پیشرو ترمینال، کد، مرور و علم و یک رده چندعاملی عرضه میکند.
ادامه مطلب
مدل Apache-2.0 در ۱۵ تیر بازخورد preview را به مسیر فعال کوچک، عامل قویتر، زمینه ۲۵۶K و پایداری عملی محصول تبدیل میکند.
ادامه مطلب
مدل ۹ تیر آنتروپیک کد، ترمینال، جستوجو، رایانه و کار دانشی را ارتقا میدهد و effort را به کنترل هزینه-عملکرد تبدیل میکند.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.