
GPT-5.6؛ خانواده Sol، Terra، Luna و عامل Ultra
خانواده ۱۸ تیر OpenAI مدل پرچمدار، متعادل و اقتصادی را با معیارهای پیشرو ترمینال، کد، مرور و علم و یک رده چندعاملی عرضه میکند.
ادامه مطلبپژوهش ژرف ایآی
میز انتشار مدل

آنتروپیک در ۳۰ ژوئن ۲۰۲۶، برابر با ۹ تیر ۱۴۰۵ Claude Sonnet 5 را بهعنوان عاملیترین Sonnet و مدل پیشفرض پلن Free و Pro عرضه کرد. اعلام رسمی آن را نزدیک Opus 4.8 با هزینه کمتر میداند. کارت سیستم ۶۳٫۲ در SWE-bench Pro، ۸۰٫۴ در Terminal-Bench 2.1، ۸۴٫۷ در BrowseComp تکعامل، ۸۱٫۲ در OSWorld و ۱٬۶۱۸ Elo در GDPval-AA v2 را گزارش میکند.
کنترل مهم effort است. medium برای اقتصاد و سطح بالا برای کار دشوار توکن و زمان بیشتر خرج میکند. قیمت مقدماتی دو دلار ورودی و ده دلار خروجی برای میلیون توکن تا ۳۱ اوت است؛ بعد سه و پانزده دلار.
کارت سیستم Sonnet 5 تنظیم استاندارد را adaptive thinking در max effort، sampling پیشفرض و میانگین پنج اجرا میداند. زمینه متغیر و BrowseComp تا ده میلیون با compaction در ۲۰۰K است.
این افشا ارزیابی را روشنتر میکند و در عین حال مانع مخلوط کردن ساده امتیازهاست. راهنمای ارزیابی مدل مرزی ثبت harness، effort، context، ابزار و sampling کنار هر عدد را توضیح میدهد.
| ارزیابی | Sonnet 5 | Sonnet 4.6 | معنا |
|---|---|---|---|
| SWE-bench Verified | ۸۵٫۲ | — | حل مسئله مخزن |
| SWE-bench Pro | ۶۳٫۲ | ۵۸٫۱ | مهندسی سخت |
| SWE چندزبانه | ۷۸٫۳ | — | ۹ زبان برنامهنویسی |
| Terminal 2.1 | ۸۰٫۴ | ۶۷٫۰ | عامل خط فرمان |
| BrowseComp | ۸۴٫۷ تک؛ ۸۶٫۶ چند | ۷۶٫۲ | جستوجوی دشوار |
| HLE | ۴۳٫۲ بیابزار؛ ۵۷٫۴ ابزار | ۳۴٫۶؛ ۴۶٫۸ | پرسش دشوار |
| OSWorld | ۸۱٫۲ | ۷۸٫۵ | استفاده رایانه |
| GDPval-AA v2 | ۱٬۶۱۸ | ۱٬۳۸۱ | کار دانشی حرفهای |
این جدول max است، نه ارزانترین effort. محصول medium باید منحنی خود را بسازد.

۶۳٫۲ نسبت به 4.6 پنجممیزیک رشد و زیر ۶۹٫۲ Opus است. Verified به ۸۵٫۲ و چندزبانه ۷۸٫۳ میرسد. فاصله با effort کم میشود، ولی هزینه و harness باید برابر باشد.
حل مخزن به کیفیت patch، آزمون، کمینه بودن و امنیت نیاز دارد. مدل ارزان با اصلاح بیشتر شاید صرفهجویی نکند.
Terminal در کارت با mini-SWE-agent اجرا شده چون Terminus-2 در xhigh دوممیزهفت برابر timeout بیشتر داشت. پس «۸۰٫۴» بدون نام پوسته ناقص است.
آنتروپیک همان روز نمودار BrowseComp را اصلاح کرد چون روش سادهتر عملکرد را کم برآورد کرده بود. تنظیم تازه با کارت—بودجه ده میلیون، compaction و programmatic tool—مطابق است.
اصلاح خوب است، ولی نشان میدهد روش در روز عرضه تغییر میکند. رکورد باید score تازه و changelog را نگه دارد و خریدار نسخه منبع را archive کند.
چندعامل از ۸۴٫۷ به ۸۶٫۶ میرسد، ولی هزینه هماهنگی دارد. پژوهش به استناد پشتیبان و تنوع منبع نیاز دارد.
OSWorld به ۸۱٫۲ میرسد. پاورقی از رفع bug zoom و افزایش سقف هر turn به ۱۲۸K میگوید؛ پس بخشی از بهبود سامانه از ابزار و بودجه است.
AutomationBench برابر ۱۳٫۵ و 4.6 برابر ۵٫۳ است؛ Gemini 3.5 Flash در همان جدول ۱۴٫۵ دارد. مطلق پایین نشان میدهد اتوماسیون پیچیده حل نشده است.
حساب ایزوله، کمترین مجوز، log و تأیید برگشتناپذیر لازم است. راهنمای طراحی تأیید انسان محل gate را توضیح میدهد.
سطح effort چند نقطه هزینه-کیفیت در یک مدل میسازد. low یا medium کار عادی و xhigh debugging سخت را میگیرد. routing باید بر نوع و خطر باشد، نه اطمینان خود مدل.
برای هر سطح موفقیت، توکن، تأخیر و زمان بازبین را رسم کنید. تغییر توکنایزر طبق آنتروپیک میتواند یک ورودی را ۱٫۰ تا ۱٫۳۵ برابر توکن کند. قیمت مقدماتی گذار را نرم میکند، ولی موقت است.
هزینه هر task پذیرفتهشده معیار است. effort دوبرابر که شکست تکراری را حذف کند شاید اقتصادی باشد.
آنتروپیک رفتار نامطلوب، توهم و چاپلوسی کمتر و مقاومت بهتر در تزریق نسبت به 4.6 گزارش میکند. توان سایبری زیر Opus و Mythos است و در آزمون Firefox exploit کامل نساخت.
با این حال موفقیت جزئی exploit کمی بیشتر و safeguard سایبری فعال است. بعضی معیار همترازی از Opus و Mythos بدتر است. ایمنی با قیمت یا tier یکنواخت نیست.
ابزار و زبان محلی را آزمایش کنید. حفاظت ارائهدهنده جای مجوز و sandbox نیست. امتناع درست را از خطای توان جدا کنید.
Sonnet 5 پیشفرض قوی برای عامل کد، جستوجو، سند و رایانه است وقتی هزینه Opus سخت است. برای سختترین کار Fable/Opus و برای استخراج مدل کوچکتر ممکن است بهتر باشد.
ارزش رکورد در پنج اجرا، زمینه، پوسته، اصلاح روش و مقایسه نسل است. نتیجه، توان نزدیک Opus در دامنه هزینه گسترده است، نه یک امتیاز برای همه effortها. پایلوت محلی باید منحنی واقعی را بسازد.
حرکت از Sonnet نسل قبل یا ارائهدهنده دیگر را تغییر نسخه یک سیستم بدانید. مجموعه ثابتی از issue مخزن، سؤال پژوهش وب، صفحه گسترده، سند و جریان computer use نگه دارید. خروجی مدل قدیمی، transcript ابزار، زمان، صورتحساب توکن، اصلاح بازبین و تصمیم نهایی را حفظ کنید. سپس Sonnet 5 را با همان permission واقعی تولید اجرا کنید، نه حساب نمایشی بدون محدودیت.
برای کیفیت پاسخ، تکمیل task، regression، latency، هزینه و تلاش برای عمل ناامن آستانه جدا بسازید. امتیاز معیار بیشتر مدلی را که permission وسیعتر میخواهد یا patch سختمرور مینویسد توجیه نمیکند. از سوی دیگر trace طولانیتر اگر شاهد را روشن و زمان بازبین را کم کند ممکن است پذیرفتنی باشد. واحد سنجش workflow کامل و پذیرفتهشده است.
rollout را بر اساس کلاس وظیفه انجام دهید. ابتدا تحلیل read-only و draft، سپس تغییر کد محدود و عمل برگشتپذیر مرورگر. ارسال، انتشار، deploy، حذف و credential پشت تأیید صریح بماند. شناسه مدل، effort، سیاست context، نسخه ابزار و تاریخ هر canary ثبت شود تا تغییر بعدی سرویس قابل جداسازی باشد.
برای timeout و کندی گهگاهی، checkpoint قابل ادامه و fallback تعریف کنید. اگر session قطع شد، عامل نباید بدون دانستن نتیجه action قبلی آن را تکرار کند. کلید idempotency، مشاهده دوباره وضعیت و ثبت دلیل retry از هزینه دوگانه یا عمل تکراری جلوگیری میکند.
در کار کد، patch را با test مرتبط، تحلیل security و review انسانی ببندید. در پژوهش، citation باید به ادعای دقیق برسد و منبع جاری دوباره بررسی شود. در computer use، حساب ایزوله، allowlist دامنه و محدودیت مالی نیاز است. تنها وقتی هر سه مسیر از gate خود عبور کردند، Sonnet 5 میتواند default سازمان شود.

خانواده ۱۸ تیر OpenAI مدل پرچمدار، متعادل و اقتصادی را با معیارهای پیشرو ترمینال، کد، مرور و علم و یک رده چندعاملی عرضه میکند.
ادامه مطلب
پرچمدار ۷ خرداد آنتروپیک کار مخزن، عامل بلندمدت، استفاده از رایانه و استدلال بصری را ارتقا میدهد و کارت سیستم محدودیتها را آشکار میکند.
ادامه مطلب
مدل ۲۹ اردیبهشت گوگل استنتاج سریع را با امتیازهای قوی کدنویسی، ابزار، چندوجهی و کار بلندمدت ترکیب میکند، اما سامانه اجرا هنوز بخشی از نتیجه است.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.