
Claude Sonnet 5؛ عامل نزدیک Opus با اقتصاد Sonnet
مدل ۹ تیر آنتروپیک کد، ترمینال، جستوجو، رایانه و کار دانشی را ارتقا میدهد و effort را به کنترل هزینه-عملکرد تبدیل میکند.
ادامه مطلبپژوهش ژرف ایآی
میز انتشار مدل

OpenAI در ۹ ژوئیه ۲۰۲۶، برابر با ۱۸ تیر ۱۴۰۵ خانواده GPT-5.6 را پس از preview محدود Sol عمومی کرد. اعلام رسمی Sol پرچمدار، Terra متعادل و Luna اقتصادی را معرفی میکند. تنظیم ultra نیز پیشفرض چهار عامل را برای کار دشوار هماهنگ میکند.
OpenAI برای Sol امتیاز ۸۰ در Artificial Analysis Coding Agent Index، امتیاز ۸۸٫۸ در Terminal-Bench 2.1، امتیاز ۷۲٫۷ در DeepSWE v1.1، امتیاز ۹۲٫۲ در BrowseComp و ۶۲٫۶ در OSWorld 2.0 گزارش میکند. Terra و Luna با زمان، هزینه و توکن کمتر نزدیک میمانند.
Sol، Terra و Luna نقطههای جدا هستند. Sol بیشینه توان، Terra توازن و Luna حجم را هدف میگیرند. ارزیابی هرکدام باید مستقل باشد.
max زمان فکر یک مدل را بیشتر میکند. ultra چندعامل است و چهار عامل پیشفرض و در برخی آزمون تا شانزده دارد. پس Ultra مدل پایه چهارم نیست و توکن، تأخیر و شکست متفاوت دارد.
preview در ۲۶ ژوئن دسترسی محدود بود؛ ۹ ژوئیه تاریخ خانواده عمومی است. هر دو رویداد ثبت میشوند ولی یکی جای دیگری را نمیگیرد.

جدول رسمی خانواده قابل مقایسه است:
| ارزیابی | Sol | Terra | Luna | معنا |
|---|---|---|---|---|
| AA Coding Index v1.1 | ۸۰٫۰ | ۷۷٫۴ | ۷۴٫۶ | شاخص ترکیبی عامل کد |
| SWE-bench Pro | ۶۴٫۶٪ | ۶۳٫۴٪ | ۶۲٫۷٪ | مخزن دشوار |
| DeepSWE v1.1 | ۷۲٫۷٪ | ۶۹٫۶٪ | ۶۷٫۲٪ | مهندسی بلند |
| Terminal 2.1 | ۸۸٫۸٪ | ۸۷٫۴٪ | ۸۴٫۷٪ | خط فرمان |
| Terminal با Sol Ultra | ۹۱٫۹٪ | — | — | چهارعامل پیشفرض |
در SWE فاصله Luna و Sol کوچک و در شاخص گسترده بیشتر است. routing بر نوع کار بهتر از فرض برتری پرچمدار است.
Sol در BrowseComp امتیاز ۹۲٫۲ و OSWorld 2.0 امتیاز ۶۲٫۶ دارد. این نسخهها با BrowseComp یا OSWorld-Verified جدول Anthropic یکسان نیستند و نام نسخه باید بماند.
Agents' Last Exam کار حرفهای بلند در ۵۵ حوزه است. Sol به ۵۳٫۶ و ۱۳٫۱ بالاتر از Fable در تنظیم OpenAI میرسد. معیار تازه نیازمند بررسی داده و rubric بیرونی است.
اسلاید، سند و شیت تأکید محصولاند. testimonial از گام و توکن کمتر میگوید، ولی پذیرش محلی باید فرمول، استناد، ویرایشپذیری و طراحی را بسنجد.
GPT-5.6 برنامه سبک برای هماهنگی ابزار، فیلتر نتیجه و تصمیم گام بعد مینویسد. این round-trip و متن زمینه را کم میکند، ولی منطق را به کد مدلساخته منتقل میکند.
کد ارکستراسیون به sandbox، منابع محدود، tool type و log نیاز دارد. filter شاید شاهد تعیینکننده را حذف کند. منشأ نتیجه خام تا ادعا باید حفظ شود.
Ultra کار را موازی و frontier امتیاز-تأخیر را بهتر میکند، ولی هزینه و هماهنگی بالا میرود. برای کار تجزیهپذیر ارزشمند استفاده و مرحله adjudication اضافه کنید. راهنمای گردش عامل پایدار checkpoint و idempotency را پوشش میدهد.
راهنمای ارزیابی مدل مرزی قرارداد سنجش مکمل را میدهد: tier مدل، reasoning، تعداد عامل، harness، بودجه ابزار، سیاست context و judge باید کنار هر امتیاز بماند.
OpenAI برای Sol امتیاز ۲۸٫۷ GeneBench Pro، ۵۹٫۹ LifeSciBench، ۴۸٫۳ MedChemBench داخلی و ۶۰٫۵ HealthBench Professional میدهد. Terra و Luna در برخی ردیف نزدیکاند.
این توان است، نه اعتبار بالینی. Gene و LifeSci گردش فنیاند و MedChem داخلی است. داده و روش باید بررسی شود.
عامل علمی باید منبع داده، واحد، کد تکرارپذیر و مرز فرضیه و مشاهده را حفظ کند. دسترسی سایبری و علمی پرخطر نیز safeguard و verification دارد.
OpenAI توکن، زمان و هزینه کمتر را محور میکند. Sol در شاخص ۸۰ با کمتر از نصف توکن و زمان Fable و حدود یکسوم هزینه برآوردی گزارش شده است. این برآورد به پوسته و قیمت وابسته است.
کار پذیرفتهشده یکسان را بسنجید. cache، ابزار برنامهپذیر، چندعامل و reasoning صورتحساب را عوض میکنند. Ultra شاید سریعتر تمام و compute کل بیشتری مصرف کند.
router میتواند کار عادی را Luna، مبهم را Terra و سخت را Sol/Ultra بدهد. قیمت هر توکن کافی نیست.
رکورد ایمنی استقرار red team، safeguard و پایش را توضیح میدهد. ابزار قوی ارزش دفاع و خطر سوءاستفاده را بالا میبرد.
سازمان به هویت، اعتبارنامه محدود، شبکه، تأیید و پاسخ رخداد نیاز دارد. چندعامل session ابزار را زیاد میکند و مجوز باید درست منتقل شود. علم و کار حرفهای به validator و متخصص نیاز دارند؛ معیار مجوز یا certification نیست.
GPT-5.6 مهم است چون کل خانواده توان عامل قوی را با tier هزینه و scaling چندعامل میدهد. سه مدل و Ultra را چهار سامانه بدانید. بهترین استقرار شاید Sol همهجا نباشد؛ router حاکمیتی است که فقط با شاهد هزینه مرزی میپردازد.
با مطالعه routing کور شروع کنید و همه کارها را مستقیم به Sol یا Ultra نفرستید. workload نماینده را بر اساس ریسک، پیچیدگی، تحمل latency، نیاز شاهد و ارزش اقتصادی برچسب بزنید. Luna، Terra و Sol را روی snapshot یکسان با ابزار و acceptance test یکسان اجرا کنید. Ultra فقط وارد زیرمجموعه تجزیهپذیر شود که رشد احتمالی، هماهنگی چهار عامل را توجیه میکند.
هزینه هر نتیجه پذیرفته را بسنجید، نه قیمت تبلیغی توکن را. ورودی cached و uncached، خروجی، اجرای ابزار، retry، شاخه موازی، زمان دیواری و دقیقه بازبین را بیاورید. false completion را از شکست صریح جدا کنید؛ توقف صادقانه از artifact مطمئن ولی نامعتبر ارزانتر و امنتر است. میانه و tail را هر دو رسم کنید، چون trace سخت میتواند صورتحساب را غالب کند.
استقرار شناسه مدل پایدار، revision ثابت prompt و schema ابزار، canary و مسیر rollback میخواهد. نوشتن مخزن در branch بازبینی، مرورگر در حساب ایزوله و خروجی علم یا سلامت پشت بازبین حوزه باشد. در Ultra شاهد هر subagent و reconciliation داور آرشیو شود تا اختلاف پنهان نشود.
در علم، معیار قوی جای بازتولید، citation و کنترل آزمایش را نمیگیرد. در سلامت نیز نتیجه benchmark برای تشخیص فردی یا تصمیم درمانی مجوز نیست. خروجی باید هدف کمکی روشن، هشدار محدودیت و مسیر escalation داشته باشد. GeneBench یا HealthBench شایستگی روی مجموعه ارزیابی را نشان میدهد، نه ایمنی پرونده واقعی.
ارسال، انتشار، اقدام مالی، تغییر credential و حذف حتی با امتیاز ابزار خوب نیازمند تأیید انسان میمانند. وقتی router به مدل بالاتر میرود، دلیل escalation و تفاوت نتیجه ثبت شود. اگر Sol یا Ultra ارزش اضافی قابل اندازهگیری نسازد، مسیر ارزانتر default باقی بماند.

مدل ۹ تیر آنتروپیک کد، ترمینال، جستوجو، رایانه و کار دانشی را ارتقا میدهد و effort را به کنترل هزینه-عملکرد تبدیل میکند.
ادامه مطلب
مدل ۲۹ اردیبهشت گوگل استنتاج سریع را با امتیازهای قوی کدنویسی، ابزار، چندوجهی و کار بلندمدت ترکیب میکند، اما سامانه اجرا هنوز بخشی از نتیجه است.
ادامه مطلب
پرچمدار ۷ خرداد آنتروپیک کار مخزن، عامل بلندمدت، استفاده از رایانه و استدلال بصری را ارتقا میدهد و کارت سیستم محدودیتها را آشکار میکند.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.