ERNIE 5.1؛ مدل کوچک‌تر با معیارهای عاملی قوی‌تر

پ

پژوهش ژرف ای‌آی

میز انتشار مدل

۱۹ اردیبهشت ۱۴۰۵به‌روزرسانی ۱۵ مرداد ۱۴۰۵۷ دقیقه مطالعه
ERNIE 5.1؛ مدل کوچک‌تر با معیارهای عاملی قوی‌تر

بایدو در ۹ مه ۲۰۲۶، برابر با ۱۹ اردیبهشت ۱۴۰۵ مدل ERNIE 5.1 را عرضه کرد. این نسخه صرفاً تغییر نام یک سرویس قدیمی نیست؛ طبق اعلام رسمی انگلیسی بایدو، تعداد کل پارامترها در مقایسه با ERNIE 5.0 تقریباً به یک‌سوم و پارامترهای فعال به حدود نصف رسیده است. بایدو همچنین می‌گوید پیش‌آموزش این نسخه تنها نزدیک به شش درصد هزینه محاسباتی مدل‌های هم‌مقیاس را مصرف کرده است.

این ادعاها مهم‌اند، اما نباید آن‌ها را به معنای «مدل کوچک‌تر در همه‌چیز برنده شد» خواند. دستاورد اصلی، پیوند معماری تنک، مسیر‌دهی انعطاف‌پذیر متخصصان، زیرساخت آموزش تقویتی ناهمگام و ارزیابی‌های عاملی است. اعداد این مقاله تا جایی که صریحاً خلاف آن ذکر نشده، گزارش خود بایدو هستند و هنوز بازتولید مستقل یکسانی برای همه آن‌ها منتشر نشده است.

تاریخ انتشار و ماهیت تغییر

نشانی صفحه عبارت 0508 را دارد، اما هر دو نسخه انگلیسی و چینی صفحه تاریخ ۹ مه را نشان می‌دهند؛ بنابراین تاریخ فراداده همین روز است. ERNIE 5.1 دانش پایه نسخه 5.0 را حفظ می‌کند، ولی ظرفیت ذخیره‌شده، مسیر فعال و اقتصاد آموزش را تغییر می‌دهد.

بایدو از «ظرفیت کشسان متخصصان» و top-k متغیر صحبت می‌کند. در آموزش، زیرمجموعه‌های متفاوتی از متخصصان نمونه‌گیری می‌شوند تا یک مدل بتواند در حالت‌های تنک‌تر یا گسترده‌تر کار کند. مسیر کوچک‌تر می‌تواند هزینه و تأخیر را پایین بیاورد و مسیر گسترده‌تر برای پرسش دشوار ظرفیت بیشتری مصرف کند. با این حال، اعلامیه ابعاد کامل معماری یا دستور بازتولید آموزش را منتشر نمی‌کند.

تغییر دوم زیرساخت آموزش تقویتی کاملاً ناهمگام و تفکیک‌شده است. مسیرهای عامل طول برابر ندارند؛ یک مأموریت سریع تمام می‌شود و دیگری با جست‌وجو، ابزار و خطا بسیار طول می‌کشد. طراحی ناهمگام از انتظار کل دسته برای کندترین مسیر جلوگیری می‌کند و استفاده از سخت‌افزار را بهتر می‌سازد.

آرشیوی فشرده که حفظ دانش یک مدل بزرگ‌تر را با ظرفیت فعال کمتر نشان می‌دهد.
آرشیوی فشرده که حفظ دانش یک مدل بزرگ‌تر را با ظرفیت فعال کمتر نشان می‌دهد.

تصویر عددی معیارها

شفاف‌ترین رکورد عمومی ترکیبی از امتیاز دقیق، جایگاه زنده و مقایسه نموداری است:

ارزیابینتیجه ERNIE 5.1موضوع سنجشمحدودیت تفسیر
AIME 2026 با ابزار۹۹٫۶ریاضی مسابقه‌ای با کمک ابزاربا اجرای بدون ابزار قابل قیاس مستقیم نیست
Arena Searchامتیاز ۱٬۲۲۳ و رتبه چهارم جهان در ۹ مهترجیح انسانی برای پاسخ جست‌وجوییجایگاه زنده و وابسته به تاریخ است
τ³-benchبالاتر از DeepSeek V4 Pro در گزارش بایدوعامل چندمرحله‌ای و ابزاربودجه و شبیه‌ساز کاربر مهم‌اند
SpreadsheetBench-Verifiedبالاتر از DeepSeek V4 Pro در نموداراجرای کار صفحه‌گستردهمحیط و سیاست تلاش مجدد باید بازتولید شود
GPQA و MMLU-Proنزدیک مدل‌های بسته پیشرودانش علمی و عمومیمتن صفحه همه مقدارهای نمودار را صریح نمی‌کند

امتیاز ۹۹٫۶ با ابزار نشان می‌دهد سیستم در حل مسئله همراه ابزار قدرتمند است؛ نه اینکه خود مدل خام تقریباً همه سؤال‌ها را در یک بار حل می‌کند. جایگاه Arena نیز ممکن است با رأی‌های تازه عوض شود. راهنمای ارزیابی مدل‌های مرزی توضیح می‌دهد چرا نسخه معیار، ابزار، زمان و روش داوری باید کنار عدد ثبت شوند.

اهمیت آموزش تقویتی ناهمگام

در آموزش عامل، مسئله زمان‌بندی به اندازه الگوریتم یادگیری مهم است. مسیر کوتاه، خطا و پاداش را سریع تحویل می‌دهد؛ مسیر بلند شاید ده‌ها ابزار را فراخوانی کند. اگر همه مسیرها هم‌زمان منتظر بمانند، پردازنده‌ها در پایان هر دسته بیکار می‌مانند. تفکیک تولید تجربه از یادگیری اجازه می‌دهد مسیرها مستقل وارد صف آموزش شوند.

بایدو همچنین بر سازگاری آموزش و استنتاج در FP8 تأکید می‌کند. اگر عامل با یک مسیر عددی تجربه تولید کند و مدل با مسیری متفاوت به‌روزرسانی شود، احتمال توکن‌ها می‌تواند تغییر کند و هدف آموزش نویزی شود. کتابخانه کم‌دقت یکپارچه در مخزن رسمی PaddlePaddle برای کاهش این اختلاف طراحی شده است.

این توضیح اثبات نمی‌کند که FP8 در همه وظایف بی‌افت است. پیام مهم‌تر این است که بایدو مدل، زمان‌بند مسیر، دقت عددی و سروینگ را یک سامانه واحد دیده است.

متخصصان کشسان و هزینه واقعی

عبارت «یک‌سوم پارامترها» به‌تنهایی هزینه را تعیین نمی‌کند. پارامتر کل ظرفیت ذخیره‌شده را نشان می‌دهد، پارامتر فعال محاسبه هر توکن را، و هزینه واقعی به جابه‌جایی حافظه، ارتباط میان شتاب‌دهنده‌ها، طول زمینه، دسته‌بندی و هسته‌های اجرا نیز وابسته است.

top-k متغیر می‌تواند چند نقطه هزینه-کیفیت در یک مدل ایجاد کند. اما خریدار باید بداند آیا رابط عمومی عرض مسیر را در اختیار می‌گذارد، آیا سرویس به‌طور پویا آن را تغییر می‌دهد و آیا کیفیت زبان یا ابزار خاص در حالت تنک افت می‌کند. ادعای شش درصد هزینه پیش‌آموزش نیز مخرج کاملاً مشترکی از سخت‌افزار، تعداد توکن و انرژی منتشر نمی‌کند؛ پس باید آن را شاهد کارایی دستور داخلی دانست، نه نسبت جهانی هزینه.

در آزمایش خرید، هزینه هر پاسخ کافی نیست. هزینه هر نتیجه پذیرفته‌شده، همراه تعداد تلاش مجدد و بازبینی انسان، معیار مناسب‌تری است.

اعتبارسنجی عامل در محیط واقعی

ادعاهای مهم‌تر درباره جست‌وجو، نرم‌افزار و صفحه‌گسترده‌اند. این کارها پرسش ثابت نیستند؛ عامل باید وضعیت را ببیند، ابزار مناسب را انتخاب کند، خطا را تشخیص دهد و خروجی را بررسی کند. برای آزمون داخلی باید همه فراخوانی‌ها، زمان، توکن، مجوز، تلاش مجدد و نتیجه نهایی ثبت شود.

در صفحه‌گسترده، فایل‌هایی با فرمول، سلول ادغام‌شده، تاریخ محلی، شیت مخفی و درخواست مبهم لازم است. در جست‌وجو، صحت استناد باید جدا از روانی متن سنجیده شود. در فرایند کسب‌وکار، مواردی را اضافه کنید که پاسخ درست توقف و درخواست تأیید است. توان انتخاب یک ابزار به معنای داشتن اختیار اجرای عمل نیست.

توان نگارش خلاق هم آزمون دیگری می‌خواهد. ارزیابی داخلی سبک می‌تواند مفید باشد، ولی با درستی واقعیت یکسان نیست. فارسی و چینی باید توسط ویراستار بومی از نظر لحن، اصطلاح، عدد و حفظ منبع بررسی شوند.

جایگاه مناسب ERNIE 5.1

قوی‌ترین مورد استفاده برای سازمان‌های داخل زیست‌بوم بایدو و جریان‌های چینی‌زبان است. ترکیب جست‌وجو، دانش، نگارش و عامل با پشته PaddlePaddle می‌تواند برای حجم بالا اقتصادی باشد. انتشار همچنین نشانه‌ای از روند بازار است: قابلیت مرزی بیش از گذشته از مسیر‌دهی، پس‌آموزش، ابزار و مهندسی سیستم می‌آید و نه فقط شمار پارامتر.

ضعیف‌ترین استدلال، مهاجرت تنها بر پایه رتبه Arena است. رتبه زنده نوسان دارد و الزاماً مزیت مشابهی در یک گردش انگلیسی یا فارسی ایجاد نمی‌کند. مقایسه باید با بودجه ابزار، زمان و هزینه کل یکسان انجام شود.

این مدل وزن‌باز معرفی نشده است. تجربه میزبانی‌شده و توضیح فنی بایدو با انتشار وزن، داده و دستور آموزش تفاوت دارد. سازمانی که استقرار خصوصی می‌خواهد باید این مرز را از ابتدا روشن کند.

پرسش‌های پیش از استقرار

شناسه دقیق مدل، حالت استدلال، حد زمینه و خروجی، محل نگهداری ورودی و ردپای ابزار، منطقه پردازش و سیاست تغییر نسخه باید مستند شوند. بدون این موارد، نتیجه ارزیابی قابل تکرار نیست. همچنین روشن کنید آیا مسیر متخصص قابل تنظیم است و سرویس چه زمانی نام مستعار را به نسخه تازه نگاشت می‌کند.

تأخیر را در سه سطح بسنجید: پاسخ خام مدل، چرخه کامل ابزار و زمانی که کاربر نتیجه قابل استفاده می‌گیرد. مدل ارزان‌تر ممکن است با مسیر طولانی و اصلاح بیشتر گران شود. مدل گران‌تر نیز ممکن است با تکمیل درست در بار اول هزینه کل را کاهش دهد.

کنترل‌های راهنمای عملیات مدل باز—ثبت نسخه، منشأ، مجموعه رگرسیون و بازگشت—برای سرویس بسته هم مفیدند. ERNIE 5.1 نامزد جدی آزمایش کنترل‌شده است، نه مجوز جایگزینی خودکار.

یادداشت منابع — بازبینی ۲۰۲۶

#ERNIE 5.1#بایدو#عامل هوش مصنوعی#ترکیب متخصصان#بنچمارک

مطالب مرتبط

آماده شروع پروژه هوش مصنوعی خود هستید؟

با تیم ما تماس بگیرید و درباره نحوه کمک به کسب‌وکار خود صحبت کنید.