
Claude Sonnet 5؛ عامل نزدیک Opus با اقتصاد Sonnet
مدل ۹ تیر آنتروپیک کد، ترمینال، جستوجو، رایانه و کار دانشی را ارتقا میدهد و effort را به کنترل هزینه-عملکرد تبدیل میکند.
ادامه مطلبپژوهش ژرف ایآی
میز انتشار مدل

آنتروپیک در ۲۸ مه ۲۰۲۶، برابر با ۷ خرداد ۱۴۰۵ Claude Opus 4.8 را بهعنوان قویترین مدل عمومی خود پیش از Fable و Mythos منتشر کرد. اعلام رسمی بر مهندسی نرمافزار خودکار، کار دانشی پیچیده، بینایی و استفاده از رایانه تمرکز دارد.
کارت سیستم امتیاز ۸۸٫۶ در SWE-bench Verified، امتیاز ۶۹٫۲ در SWE-bench Pro، امتیاز ۸۴٫۳ در BrowseComp تکعامل و ۸۸٫۵ در چندعامل، امتیاز ۸۳٫۴ در OSWorld-Verified و ۴۹٫۸ در Humanity's Last Exam بدون ابزار را گزارش میکند. اهمیت مدل فقط صدرنشینی یک عدد نیست؛ این نسخه کف توان را در چند کار ارزشمند بالا میبرد و شواهد ایمنی گستردهای منتشر میکند.
نام نسخه افزایشی است، ولی تمرکز عامل تغییر قابل توجهی دارد. آنتروپیک میگوید مدل در وظیفه بلند دستور را بهتر دنبال میکند، مخزن را عمیقتر میگردد، ابزار را با نظارت کمتر به کار میبرد و سند حرفهایتری میسازد. مشتریان اولیه از مهاجرت و درخواست کششی میگویند که نسخه پیشین نیمهکاره رها میکرد.
مدل میزبانیشده است و از محصولات Claude، Claude Code و رابط Claude ارائه میشود. پس سروینگ، لایه سیاست، توکنایزر، سطح تلاش، مدیریت زمینه و ابزار محصول بخشی از سامانهاند. نام مدل بهتنهایی شرح آزمایش نیست.
برای رکورد تولید باید شناسه، سطح محصول، تلاش، ابزار، تاریخ و سیاست تکرار ثبت شود. نتیجه کارت سیستم ممکن است با پوسته، فشردهسازی یا ابزار متفاوت اجرا شده باشد.

رکورد رسمی چند حوزه را پوشش میدهد:
| ارزیابی | نتیجه Opus 4.8 | نکته تنظیم |
|---|---|---|
| SWE-bench Verified | ۸۸٫۶٪ | حل مسئله مخزن با سامانه عامل گزارششده |
| SWE-bench Pro | ۶۹٫۲٪ | مسائل دشوارتر و حساس به چهارچوب |
| BrowseComp | ۸۴٫۳٪ تکعامل؛ ۸۸٫۵٪ چندعامل | ارکستراسیون پوشش را بالا میبرد |
| Humanity's Last Exam | ۴۹٫۸٪ بدون ابزار؛ ۵۷٫۹٪ با ابزار | ابزار تعریف ارزیابی را تغییر میدهد |
| OSWorld-Verified | ۸۳٫۴٪ | عمل در محیط گرافیکی |
| ChartQAPro | ۶۹٫۴٪ بدون ابزار؛ ۷۲٫۳٪ با ابزار | پرسش نموداری |
| GPQA Diamond | ۹۳٫۶٪ | استدلال علوم تحصیلات تکمیلی |
اینها یک جدول مشترک بیقید نیستند. چندعامل هزینه و هماهنگی دارد؛ ابزار با اجرای بدون ابزار یکسان نیست؛ OSWorld به رابط عمل وابسته است. کارت کامل سیستم مرجع تصمیم خرید است.
SWE-bench از عامل میخواهد مخزن را بفهمد، کد را تغییر دهد و آزمون را عبور دهد. این حرکت از تکمیل تابع به حل مسئله عملی مهم است؛ مدل باید ساختار، قرارداد و شکست را دنبال کند.
با این حال عبور آزمون کیفیت وصله را کامل نمیگوید. راهحل ممکن است شکننده، گسترده یا دارای ضعف امنیت باشد. آزمایش محلی باید کمینه بودن تغییر، نگهداشتپذیری، کیفیت آزمون، امنیت و زمان بازبینی را کنار حل نهایی بسنجد. چند اجرا برای واریانس لازم است.
Claude Code سهم بزرگی در تجربه دارد. مجوز ابزار، خلاصهسازی، زیرعامل و پیام سیستمی بر ماندگاری اثر میگذارند. مقایسه آن با رابط خام رقیب، مقایسه سامانه است. راهنمای عامل مهندسی نرمافزار کنترل مخزن و بازبینی را توضیح میدهد.
BrowseComp پژوهش دشواری را میسنجد که به یافتن و ترکیب چند شاهد نیاز دارد. جهش از ۸۴٫۳ به ۸۸٫۵ نشان میدهد جستوجوی موازی میتواند پوشش را بهتر کند؛ اما تماس، توکن و زمان بیشتری مصرف میشود.
چند عامل میتوانند خطای همبسته را تقویت کنند اگر همه یک منبع ضعیف را تکرار کنند. سامانه به تنوع منبع، استناد سطح ادعا، حذف تکرار و داوری نیاز دارد که ترکیب بیپشتوانه را رد کند. هزینه باید برای نتیجه پژوهش پذیرفتهشده گزارش شود.
در خبر زنده، تاریخ منبع و رخداد مهم است. عامل باید اعلام مدل را از بهروزرسانی کارت یا تغییر نام رابط جدا کند. دفتر پوشش همین مجموعه برای جلوگیری از خطای تاریخ ساخته شده است.
امتیاز ۸۳٫۴ OSWorld توان عمل در محیط گرافیکی را نشان میدهد و کار بدون رابط قابل اتکا را ممکن میکند. در مقابل، حالت پنهان، تزریق دستور، کلیک اشتباه و عمل برگشتناپذیر را وارد میسازد. درصد موفقیت شدت شکست باقیمانده را نمیگوید.
حساب ایزوله و کمترین دسترسی لازم است. ارسال، انتشار، خرید، تغییر مجوز و حذف باید تأیید شوند. تصویر و عمل ذخیره شود تا اجرا قابل حسابرسی باشد. وقتی رابط ساختیافته وجود دارد، پیکسل جایگزین حکمرانی نیست.
ChartQAPro توان شکل متراکم را تقویت میکند. استخراج حساس باید ناحیه، واحد و منبع را برگرداند. روانی بصری خطای OCR یا عدد را حذف نمیکند.
HLE از ۴۹٫۸ بدون ابزار به ۵۷٫۹ با ابزار میرسد. این اختلاف نشان میدهد سامانه مستقر از جستوجو یا محاسبه چه میگیرد. ابزار خطای حافظه را کم میکند، ولی کیفیت منبع، شکست ابزار و مجوز را اضافه میکند.
جدول خرید باید مدل تنها، مدل با ابزار و عامل کامل را جدا نگه دارد. ترکیب آنها به ارائهدهندهای پاداش میدهد که پوسته قویتری آورده است. سطح تلاش نیز هزینه و تأخیر را با استدلال مبادله میکند.
راهنمای ارزیابی مدل مرزی فهرست اجزای غیرمدلی را لازم میداند. بدون آن، تغییر امتیاز بعدی قابل توضیح نیست.
کارت سیستم سوءاستفاده، سایبری، زیستی، همترازی و توهم را پوشش میدهد. این شفافیت ارزشمند است، اما گواهی استقرار خریدار نیست. مدل خواندنی مخزن با مدل دارای اعتبارنامه و شبکه خطر یکسان ندارد. تزریق غیرمستقیم، راز، دستور مخرب و خروج داده باید در سطح سامانه کنترل شوند.
Opus برای کاری مناسب است که تکمیل بهتر قیمت بالاتر را توجیه کند: تغییر سخت مخزن، تحلیل بلند، پژوهش پیچیده و کار رایانهای. استخراج معمول میتواند به مدل کوچکتر برسد. هزینه کل شامل توکن، زمان، ابزار، بازبینی و رخداد است.
در مهاجرت، مجموعه وظیفه باید قابل حمل و ردپا کامل باشد. مدل میزبانی تغییر میکند و فقط آزمون پذیرش ثابت میتواند افت نسخه بعد یا مزیت رقیب را نشان دهد. امتناع ایمن را نیز از شکست توان جدا کنید تا سیستم بهخاطر رعایت مرز امنیتی جریمه نشود.
نتیجه درست پایلوت کنترلشده برای کار دشوار است. مدل و پوسته را ثابت کنید، امتیاز ابزار را جدا نگه دارید، کمترین مجوز بدهید و نتیجه را با آزمون یا شاهد عینی تأیید کنید. Opus 4.8 خط پایه مهم عمومی تابستان ۲۰۲۶ باقی میماند.

مدل ۹ تیر آنتروپیک کد، ترمینال، جستوجو، رایانه و کار دانشی را ارتقا میدهد و effort را به کنترل هزینه-عملکرد تبدیل میکند.
ادامه مطلب
خانواده ۱۸ تیر OpenAI مدل پرچمدار، متعادل و اقتصادی را با معیارهای پیشرو ترمینال، کد، مرور و علم و یک رده چندعاملی عرضه میکند.
ادامه مطلب
مدل ۲۹ اردیبهشت گوگل استنتاج سریع را با امتیازهای قوی کدنویسی، ابزار، چندوجهی و کار بلندمدت ترکیب میکند، اما سامانه اجرا هنوز بخشی از نتیجه است.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.