Claude Sonnet 5؛ عامل نزدیک Opus با اقتصاد Sonnet

پ

پژوهش ژرف ای‌آی

میز انتشار مدل

۹ تیر ۱۴۰۵به‌روزرسانی ۱۵ مرداد ۱۴۰۵۶ دقیقه مطالعه
Claude Sonnet 5؛ عامل نزدیک Opus با اقتصاد Sonnet

آنتروپیک در ۳۰ ژوئن ۲۰۲۶، برابر با ۹ تیر ۱۴۰۵ Claude Sonnet 5 را به‌عنوان عاملی‌ترین Sonnet و مدل پیش‌فرض پلن Free و Pro عرضه کرد. اعلام رسمی آن را نزدیک Opus 4.8 با هزینه کمتر می‌داند. کارت سیستم ۶۳٫۲ در SWE-bench Pro، ۸۰٫۴ در Terminal-Bench 2.1، ۸۴٫۷ در BrowseComp تک‌عامل، ۸۱٫۲ در OSWorld و ۱٬۶۱۸ Elo در GDPval-AA v2 را گزارش می‌کند.

کنترل مهم effort است. medium برای اقتصاد و سطح بالا برای کار دشوار توکن و زمان بیشتر خرج می‌کند. قیمت مقدماتی دو دلار ورودی و ده دلار خروجی برای میلیون توکن تا ۳۱ اوت است؛ بعد سه و پانزده دلار.

جدول معیار با تنظیم استاندارد

کارت سیستم Sonnet 5 تنظیم استاندارد را adaptive thinking در max effort، sampling پیش‌فرض و میانگین پنج اجرا می‌داند. زمینه متغیر و BrowseComp تا ده میلیون با compaction در ۲۰۰K است.

این افشا ارزیابی را روشن‌تر می‌کند و در عین حال مانع مخلوط کردن ساده امتیازهاست. راهنمای ارزیابی مدل مرزی ثبت harness، effort، context، ابزار و sampling کنار هر عدد را توضیح می‌دهد.

ارزیابیSonnet 5Sonnet 4.6معنا
SWE-bench Verified۸۵٫۲حل مسئله مخزن
SWE-bench Pro۶۳٫۲۵۸٫۱مهندسی سخت
SWE چندزبانه۷۸٫۳۹ زبان برنامه‌نویسی
Terminal 2.1۸۰٫۴۶۷٫۰عامل خط فرمان
BrowseComp۸۴٫۷ تک؛ ۸۶٫۶ چند۷۶٫۲جست‌وجوی دشوار
HLE۴۳٫۲ بی‌ابزار؛ ۵۷٫۴ ابزار۳۴٫۶؛ ۴۶٫۸پرسش دشوار
OSWorld۸۱٫۲۷۸٫۵استفاده رایانه
GDPval-AA v2۱٬۶۱۸۱٬۳۸۱کار دانشی حرفه‌ای

این جدول max است، نه ارزان‌ترین effort. محصول medium باید منحنی خود را بسازد.

کارگاه دقیق و چابک برنامه‌ریزی، آزمون و تکمیل زنجیره پیچیده را در مقیاس Sonnet نشان می‌دهد.
کارگاه دقیق و چابک برنامه‌ریزی، آزمون و تکمیل زنجیره پیچیده را در مقیاس Sonnet نشان می‌دهد.

کد و سهم پوسته

۶۳٫۲ نسبت به 4.6 پنج‌ممیزیک رشد و زیر ۶۹٫۲ Opus است. Verified به ۸۵٫۲ و چندزبانه ۷۸٫۳ می‌رسد. فاصله با effort کم می‌شود، ولی هزینه و harness باید برابر باشد.

حل مخزن به کیفیت patch، آزمون، کمینه بودن و امنیت نیاز دارد. مدل ارزان با اصلاح بیشتر شاید صرفه‌جویی نکند.

Terminal در کارت با mini-SWE-agent اجرا شده چون Terminus-2 در xhigh دو‌ممیزهفت برابر timeout بیشتر داشت. پس «۸۰٫۴» بدون نام پوسته ناقص است.

اصلاح روش جست‌وجو

آنتروپیک همان روز نمودار BrowseComp را اصلاح کرد چون روش ساده‌تر عملکرد را کم برآورد کرده بود. تنظیم تازه با کارت—بودجه ده میلیون، compaction و programmatic tool—مطابق است.

اصلاح خوب است، ولی نشان می‌دهد روش در روز عرضه تغییر می‌کند. رکورد باید score تازه و changelog را نگه دارد و خریدار نسخه منبع را archive کند.

چندعامل از ۸۴٫۷ به ۸۶٫۶ می‌رسد، ولی هزینه هماهنگی دارد. پژوهش به استناد پشتیبان و تنوع منبع نیاز دارد.

رایانه و اتوماسیون

OSWorld به ۸۱٫۲ می‌رسد. پاورقی از رفع bug zoom و افزایش سقف هر turn به ۱۲۸K می‌گوید؛ پس بخشی از بهبود سامانه از ابزار و بودجه است.

AutomationBench برابر ۱۳٫۵ و 4.6 برابر ۵٫۳ است؛ Gemini 3.5 Flash در همان جدول ۱۴٫۵ دارد. مطلق پایین نشان می‌دهد اتوماسیون پیچیده حل نشده است.

حساب ایزوله، کمترین مجوز، log و تأیید برگشت‌ناپذیر لازم است. راهنمای طراحی تأیید انسان محل gate را توضیح می‌دهد.

effort و اقتصاد

سطح effort چند نقطه هزینه-کیفیت در یک مدل می‌سازد. low یا medium کار عادی و xhigh debugging سخت را می‌گیرد. routing باید بر نوع و خطر باشد، نه اطمینان خود مدل.

برای هر سطح موفقیت، توکن، تأخیر و زمان بازبین را رسم کنید. تغییر توکنایزر طبق آنتروپیک می‌تواند یک ورودی را ۱٫۰ تا ۱٫۳۵ برابر توکن کند. قیمت مقدماتی گذار را نرم می‌کند، ولی موقت است.

هزینه هر task پذیرفته‌شده معیار است. effort دوبرابر که شکست تکراری را حذف کند شاید اقتصادی باشد.

ایمنی

آنتروپیک رفتار نامطلوب، توهم و چاپلوسی کمتر و مقاومت بهتر در تزریق نسبت به 4.6 گزارش می‌کند. توان سایبری زیر Opus و Mythos است و در آزمون Firefox exploit کامل نساخت.

با این حال موفقیت جزئی exploit کمی بیشتر و safeguard سایبری فعال است. بعضی معیار هم‌ترازی از Opus و Mythos بدتر است. ایمنی با قیمت یا tier یکنواخت نیست.

ابزار و زبان محلی را آزمایش کنید. حفاظت ارائه‌دهنده جای مجوز و sandbox نیست. امتناع درست را از خطای توان جدا کنید.

حکم

Sonnet 5 پیش‌فرض قوی برای عامل کد، جست‌وجو، سند و رایانه است وقتی هزینه Opus سخت است. برای سخت‌ترین کار Fable/Opus و برای استخراج مدل کوچک‌تر ممکن است بهتر باشد.

ارزش رکورد در پنج اجرا، زمینه، پوسته، اصلاح روش و مقایسه نسل است. نتیجه، توان نزدیک Opus در دامنه هزینه گسترده است، نه یک امتیاز برای همه effortها. پایلوت محلی باید منحنی واقعی را بسازد.

برنامه مهاجرت و پذیرش

حرکت از Sonnet نسل قبل یا ارائه‌دهنده دیگر را تغییر نسخه یک سیستم بدانید. مجموعه ثابتی از issue مخزن، سؤال پژوهش وب، صفحه گسترده، سند و جریان computer use نگه دارید. خروجی مدل قدیمی، transcript ابزار، زمان، صورتحساب توکن، اصلاح بازبین و تصمیم نهایی را حفظ کنید. سپس Sonnet 5 را با همان permission واقعی تولید اجرا کنید، نه حساب نمایشی بدون محدودیت.

برای کیفیت پاسخ، تکمیل task، regression، latency، هزینه و تلاش برای عمل ناامن آستانه جدا بسازید. امتیاز معیار بیشتر مدلی را که permission وسیع‌تر می‌خواهد یا patch سخت‌مرور می‌نویسد توجیه نمی‌کند. از سوی دیگر trace طولانی‌تر اگر شاهد را روشن و زمان بازبین را کم کند ممکن است پذیرفتنی باشد. واحد سنجش workflow کامل و پذیرفته‌شده است.

rollout را بر اساس کلاس وظیفه انجام دهید. ابتدا تحلیل read-only و draft، سپس تغییر کد محدود و عمل برگشت‌پذیر مرورگر. ارسال، انتشار، deploy، حذف و credential پشت تأیید صریح بماند. شناسه مدل، effort، سیاست context، نسخه ابزار و تاریخ هر canary ثبت شود تا تغییر بعدی سرویس قابل جداسازی باشد.

برای timeout و کندی گهگاهی، checkpoint قابل ادامه و fallback تعریف کنید. اگر session قطع شد، عامل نباید بدون دانستن نتیجه action قبلی آن را تکرار کند. کلید idempotency، مشاهده دوباره وضعیت و ثبت دلیل retry از هزینه دوگانه یا عمل تکراری جلوگیری می‌کند.

در کار کد، patch را با test مرتبط، تحلیل security و review انسانی ببندید. در پژوهش، citation باید به ادعای دقیق برسد و منبع جاری دوباره بررسی شود. در computer use، حساب ایزوله، allowlist دامنه و محدودیت مالی نیاز است. تنها وقتی هر سه مسیر از gate خود عبور کردند، Sonnet 5 می‌تواند default سازمان شود.

یادداشت منابع — بازبینی ۲۰۲۶

#Claude Sonnet 5#آنتروپیک#عامل هوش مصنوعی#کدنویسی#بنچمارک

مطالب مرتبط

آماده شروع پروژه هوش مصنوعی خود هستید؟

با تیم ما تماس بگیرید و درباره نحوه کمک به کسب‌وکار خود صحبت کنید.