GPT-5.6؛ خانواده Sol، Terra، Luna و عامل Ultra

پ

پژوهش ژرف ای‌آی

میز انتشار مدل

۱۸ تیر ۱۴۰۵به‌روزرسانی ۱۵ مرداد ۱۴۰۵۶ دقیقه مطالعه
GPT-5.6؛ خانواده Sol، Terra، Luna و عامل Ultra

OpenAI در ۹ ژوئیه ۲۰۲۶، برابر با ۱۸ تیر ۱۴۰۵ خانواده GPT-5.6 را پس از preview محدود Sol عمومی کرد. اعلام رسمی Sol پرچم‌دار، Terra متعادل و Luna اقتصادی را معرفی می‌کند. تنظیم ultra نیز پیش‌فرض چهار عامل را برای کار دشوار هماهنگ می‌کند.

OpenAI برای Sol امتیاز ۸۰ در Artificial Analysis Coding Agent Index، امتیاز ۸۸٫۸ در Terminal-Bench 2.1، امتیاز ۷۲٫۷ در DeepSWE v1.1، امتیاز ۹۲٫۲ در BrowseComp و ۶۲٫۶ در OSWorld 2.0 گزارش می‌کند. Terra و Luna با زمان، هزینه و توکن کمتر نزدیک می‌مانند.

سه مدل و یک رده ارکستراسیون

Sol، Terra و Luna نقطه‌های جدا هستند. Sol بیشینه توان، Terra توازن و Luna حجم را هدف می‌گیرند. ارزیابی هرکدام باید مستقل باشد.

max زمان فکر یک مدل را بیشتر می‌کند. ultra چندعامل است و چهار عامل پیش‌فرض و در برخی آزمون تا شانزده دارد. پس Ultra مدل پایه چهارم نیست و توکن، تأخیر و شکست متفاوت دارد.

preview در ۲۶ ژوئن دسترسی محدود بود؛ ۹ ژوئیه تاریخ خانواده عمومی است. هر دو رویداد ثبت می‌شوند ولی یکی جای دیگری را نمی‌گیرد.

سه موتور دقیق روی یک میز سنجش، Sol، Terra و Luna را نمایش می‌دهند.
سه موتور دقیق روی یک میز سنجش، Sol، Terra و Luna را نمایش می‌دهند.

جدول کدنویسی

جدول رسمی خانواده قابل مقایسه است:

ارزیابیSolTerraLunaمعنا
AA Coding Index v1.1۸۰٫۰۷۷٫۴۷۴٫۶شاخص ترکیبی عامل کد
SWE-bench Pro۶۴٫۶٪۶۳٫۴٪۶۲٫۷٪مخزن دشوار
DeepSWE v1.1۷۲٫۷٪۶۹٫۶٪۶۷٫۲٪مهندسی بلند
Terminal 2.1۸۸٫۸٪۸۷٫۴٪۸۴٫۷٪خط فرمان
Terminal با Sol Ultra۹۱٫۹٪چهارعامل پیش‌فرض

در SWE فاصله Luna و Sol کوچک و در شاخص گسترده بیشتر است. routing بر نوع کار بهتر از فرض برتری پرچم‌دار است.

مرور، رایانه و کار دانشی

Sol در BrowseComp امتیاز ۹۲٫۲ و OSWorld 2.0 امتیاز ۶۲٫۶ دارد. این نسخه‌ها با BrowseComp یا OSWorld-Verified جدول Anthropic یکسان نیستند و نام نسخه باید بماند.

Agents' Last Exam کار حرفه‌ای بلند در ۵۵ حوزه است. Sol به ۵۳٫۶ و ۱۳٫۱ بالاتر از Fable در تنظیم OpenAI می‌رسد. معیار تازه نیازمند بررسی داده و rubric بیرونی است.

اسلاید، سند و شیت تأکید محصول‌اند. testimonial از گام و توکن کمتر می‌گوید، ولی پذیرش محلی باید فرمول، استناد، ویرایش‌پذیری و طراحی را بسنجد.

ابزار برنامه‌پذیر و Ultra

GPT-5.6 برنامه سبک برای هماهنگی ابزار، فیلتر نتیجه و تصمیم گام بعد می‌نویسد. این round-trip و متن زمینه را کم می‌کند، ولی منطق را به کد مدل‌ساخته منتقل می‌کند.

کد ارکستراسیون به sandbox، منابع محدود، tool type و log نیاز دارد. filter شاید شاهد تعیین‌کننده را حذف کند. منشأ نتیجه خام تا ادعا باید حفظ شود.

Ultra کار را موازی و frontier امتیاز-تأخیر را بهتر می‌کند، ولی هزینه و هماهنگی بالا می‌رود. برای کار تجزیه‌پذیر ارزشمند استفاده و مرحله adjudication اضافه کنید. راهنمای گردش عامل پایدار checkpoint و idempotency را پوشش می‌دهد.

راهنمای ارزیابی مدل مرزی قرارداد سنجش مکمل را می‌دهد: tier مدل، reasoning، تعداد عامل، harness، بودجه ابزار، سیاست context و judge باید کنار هر امتیاز بماند.

علم و سلامت

OpenAI برای Sol امتیاز ۲۸٫۷ GeneBench Pro، ۵۹٫۹ LifeSciBench، ۴۸٫۳ MedChemBench داخلی و ۶۰٫۵ HealthBench Professional می‌دهد. Terra و Luna در برخی ردیف نزدیک‌اند.

این توان است، نه اعتبار بالینی. Gene و LifeSci گردش فنی‌اند و MedChem داخلی است. داده و روش باید بررسی شود.

عامل علمی باید منبع داده، واحد، کد تکرارپذیر و مرز فرضیه و مشاهده را حفظ کند. دسترسی سایبری و علمی پرخطر نیز safeguard و verification دارد.

بهره‌وری و هزینه

OpenAI توکن، زمان و هزینه کمتر را محور می‌کند. Sol در شاخص ۸۰ با کمتر از نصف توکن و زمان Fable و حدود یک‌سوم هزینه برآوردی گزارش شده است. این برآورد به پوسته و قیمت وابسته است.

کار پذیرفته‌شده یکسان را بسنجید. cache، ابزار برنامه‌پذیر، چندعامل و reasoning صورتحساب را عوض می‌کنند. Ultra شاید سریع‌تر تمام و compute کل بیشتری مصرف کند.

router می‌تواند کار عادی را Luna، مبهم را Terra و سخت را Sol/Ultra بدهد. قیمت هر توکن کافی نیست.

ایمنی و حکم

رکورد ایمنی استقرار red team، safeguard و پایش را توضیح می‌دهد. ابزار قوی ارزش دفاع و خطر سوءاستفاده را بالا می‌برد.

سازمان به هویت، اعتبارنامه محدود، شبکه، تأیید و پاسخ رخداد نیاز دارد. چندعامل session ابزار را زیاد می‌کند و مجوز باید درست منتقل شود. علم و کار حرفه‌ای به validator و متخصص نیاز دارند؛ معیار مجوز یا certification نیست.

GPT-5.6 مهم است چون کل خانواده توان عامل قوی را با tier هزینه و scaling چندعامل می‌دهد. سه مدل و Ultra را چهار سامانه بدانید. بهترین استقرار شاید Sol همه‌جا نباشد؛ router حاکمیتی است که فقط با شاهد هزینه مرزی می‌پردازد.

برنامه مسیریابی و regression

با مطالعه routing کور شروع کنید و همه کارها را مستقیم به Sol یا Ultra نفرستید. workload نماینده را بر اساس ریسک، پیچیدگی، تحمل latency، نیاز شاهد و ارزش اقتصادی برچسب بزنید. Luna، Terra و Sol را روی snapshot یکسان با ابزار و acceptance test یکسان اجرا کنید. Ultra فقط وارد زیرمجموعه تجزیه‌پذیر شود که رشد احتمالی، هماهنگی چهار عامل را توجیه می‌کند.

هزینه هر نتیجه پذیرفته را بسنجید، نه قیمت تبلیغی توکن را. ورودی cached و uncached، خروجی، اجرای ابزار، retry، شاخه موازی، زمان دیواری و دقیقه بازبین را بیاورید. false completion را از شکست صریح جدا کنید؛ توقف صادقانه از artifact مطمئن ولی نامعتبر ارزان‌تر و امن‌تر است. میانه و tail را هر دو رسم کنید، چون trace سخت می‌تواند صورتحساب را غالب کند.

استقرار شناسه مدل پایدار، revision ثابت prompt و schema ابزار، canary و مسیر rollback می‌خواهد. نوشتن مخزن در branch بازبینی، مرورگر در حساب ایزوله و خروجی علم یا سلامت پشت بازبین حوزه باشد. در Ultra شاهد هر subagent و reconciliation داور آرشیو شود تا اختلاف پنهان نشود.

در علم، معیار قوی جای بازتولید، citation و کنترل آزمایش را نمی‌گیرد. در سلامت نیز نتیجه benchmark برای تشخیص فردی یا تصمیم درمانی مجوز نیست. خروجی باید هدف کمکی روشن، هشدار محدودیت و مسیر escalation داشته باشد. GeneBench یا HealthBench شایستگی روی مجموعه ارزیابی را نشان می‌دهد، نه ایمنی پرونده واقعی.

ارسال، انتشار، اقدام مالی، تغییر credential و حذف حتی با امتیاز ابزار خوب نیازمند تأیید انسان می‌مانند. وقتی router به مدل بالاتر می‌رود، دلیل escalation و تفاوت نتیجه ثبت شود. اگر Sol یا Ultra ارزش اضافی قابل اندازه‌گیری نسازد، مسیر ارزان‌تر default باقی بماند.

یادداشت منابع — بازبینی ۲۰۲۶

#GPT-5.6#OpenAI#عامل هوش مصنوعی#کدنویسی#بنچمارک

مطالب مرتبط

آماده شروع پروژه هوش مصنوعی خود هستید؟

با تیم ما تماس بگیرید و درباره نحوه کمک به کسب‌وکار خود صحبت کنید.