
GPT-5.6؛ خانواده Sol، Terra، Luna و عامل Ultra
خانواده ۱۸ تیر OpenAI مدل پرچمدار، متعادل و اقتصادی را با معیارهای پیشرو ترمینال، کد، مرور و علم و یک رده چندعاملی عرضه میکند.
ادامه مطلبپژوهش ژرف ایآی
میز انتشار مدل

Google در ۲۱ ژوئیه ۲۰۲۶، برابر با ۳۰ تیر ۱۴۰۵ سه مدل مرتبط را اعلام کرد: Gemini 3.6 Flash، Gemini 3.5 Flash-Lite و Gemini 3.5 Flash Cyber. انتشار مشترک آنها را خانواده تولید میداند، نه سه سطح قابل تعویض. Flash مدل کاری توانمند، Lite برای حجم و تأخیر، و Cyber متخصص محدود داخل CodeMender است.
ادعای بهرهوری دقیق است. 3.6 Flash در Artificial Analysis Index هفده درصد توکن خروجی کمتر از 3.5 مصرف میکند و در مقایسه DeepSWE گوگل تا ۶۵ درصد کمتر، همزمان قیمت خروجی از ۹ به ۷٫۵ دلار در هر میلیون توکن میرسد. Flash-Lite سرعت اعلامی ۳۵۰ توکن خروجی در ثانیه با قیمت ۰٫۳۰ دلار ورودی و ۲٫۵ دلار خروجی دارد.
یک مقاله ساختار عرضه گوگل را حفظ میکند، اما مرز دسترسی باید روشن بماند. 3.6 Flash و Flash-Lite از Gemini API، AI Studio، محصولات سازمانی و سطح مصرفکننده عرضه شدند. Flash Cyber فقط بهصورت پایلوت محدود برای دولتها و شریکان مورد اعتماد از مسیر CodeMender اعلام شد.
هر سه سرویس میزبانیشدهاند، نه وزن باز. کارت Gemini 3.6 Flash ورودی بومی متن، تصویر، صوت و ویدئو، زمینه تا یک میلیون توکن و خروجی متن تا 64K را ثبت میکند. کارت Lite نیز همین حدود را میدهد.
پس پرسش «بهترین مدل» اشتباه است. عامل عمومی، طبقهبندی رسید و برنامه ترمیم آسیبپذیری به throughput، کیفیت، دسترسی و ریسک متفاوت نیاز دارند.

کارت گوگل این مقایسه هممنبع را گزارش میکند:
| معیار | Gemini 3.6 Flash | Gemini 3.5 Flash | تغییر |
|---|---|---|---|
| SWE-bench Pro عمومی | ۵۸٫۷٪ | ۵۵٫۱٪ | +۳٫۶ واحد |
| DeepSWE v1.1 | ۴۹٪ | ۳۷٪ | +۱۲ واحد |
| Terminal-Bench 2.1، Terminus-2 | ۷۸٫۰٪ | ۷۶٫۲٪ | +۱٫۸ واحد |
| MLE-Bench | ۶۳٫۹٪ | ۴۹٫۷٪ | +۱۴٫۲ واحد |
| GDPval-AA v2 | ۱۴۲۱ Elo | ۱۳۴۹ Elo | +۷۲ |
| OSWorld-Verified | ۸۳٫۰٪ | ۷۸٫۴٪ | +۴٫۶ واحد |
| GDM-MRCR v2، 128K | ۹۱٫۸٪ | ۷۷٫۳٪ | +۱۴٫۵ واحد |
| GDM-MRCR v2، 1M | ۵۴٫۰٪ | ۲۶٫۶٪ | +۲۷٫۴ واحد |
صفحه عرضه DeepSWE را ۴۹ در برابر ۳۷، هماهنگ با کارت، و ۱۷ درصد توکن کمتر گزارش میکند. مقایسه GPT، Claude و Grok در جدول تنظیم نامدار دارد اما توسط فروشنده گردآوری شده؛ ردیف 3.6 در برابر 3.5 پاکترین شاهد ارتقاست.
DeepSWE از ۳۷ به ۴۹ و SWE-bench Pro از ۵۵٫۱ به ۵۸٫۷ میرسد. scaffold و مسئله متفاوتاند؛ رشد بزرگ DeepSWE را نمیتوان روی هر مخزن تعمیم داد. افزایش کوچکتر ۱٫۸ واحدی Terminal-Bench نشان میدهد برخی کارهای shell قبلاً قوی بودهاند.
OSWorld-Verified به ۸۳٫۰ میرسد و گوگل computer use را ابزار client-side بومی API و پلتفرم سازمانی میکند. ابزار بومی اصطکاک را کم میکند، نه اختیار را؛ action صفحه به allowlist دامنه، تأیید تغییر مادی و بازیابی UI کهنه نیاز دارد.
GDPval-AA v2 با ۷۲ Elo رشد به ۱۴۲۱ از جایگاه کار دانشی پشتیبانی میکند. کار گزارش و نمودار باید دقت citation، صحت فرمول و ردگیری واقعیت را بیفزاید. راهنمای ارزیابی مدل مرزی دروازه خاص workload را شرح میدهد.
چشمگیرترین رشد GDM-MRCR در یک میلیون توکن است: ۵۴٫۰ در برابر ۲۶٫۶. میانگین 128K از ۷۷٫۳ به ۹۱٫۸ میرود. این از retrieval بهتر پشتیبانی میکند، ولی ۵۴ درصد در سقف نشان میدهد limit یک میلیون تضمین یادآوری نیست.
گوگل ۱۷ درصد خروجی کمتر در شاخص و تا ۶۵ درصد کمتر در DeepSWE را به گام استدلال و ابزار کمتر نسبت میدهد. «تا» وابسته به workload است؛ ظرفیت باید با توزیع کار داخلی برنامهریزی شود.
قیمت 3.6 برای ورودی ۱٫۵ و خروجی ۷٫۵ دلار است؛ ورودی ثابت و خروجی 3.5 از ۹ دلار کمتر شده. هزینه workflow پذیرفتهشده cache، ابزار، retry و اصلاح انسان را هم دارد. توکن ارزانتر prompt بیدلیل یکمیلیونی را جبران نمیکند.
Gemini 3.5 Flash-Lite صرفاً 3.6 ضعیفتر نیست. گوگل آن را سریعترین مدل کلاس 3.5 با ۳۵۰ توکن خروجی در ثانیه معرفی میکند. قیمت عرضه برای هر میلیون ۰٫۳۰ دلار ورودی و ۲٫۵ دلار خروجی است.
در برابر 3.1 Flash-Lite، Terminal-Bench را ۵۴ در برابر ۳۱، GDM-MRCR را ۷۲٫۲ در برابر ۶۰٫۱ و GDPval را ۱۱۴۰ در برابر ۶۴۲ گزارش میکند. Lite جدید حتی از Gemini 3 Flash در SWE-bench Pro با ۵۴٫۲ در برابر ۴۹٫۶ و OSWorld با ۷۴٫۰ در برابر ۶۵٫۱ جلوست.
کارت Gemini 3.5 Flash-Lite ورودی multimodal یکمیلیونی و خروجی 64K را تأیید میکند. برای طبقهبندی، ترجمه، استخراج، جستوجو و fan-out عامل پس از سنجش tail latency و هزینه خطا در concurrency واقعی استفاده شود.
Gemini 3.5 Flash Cyber بر 3.5 ساخته و برای کشف، اعتبارسنجی و رفع آسیبپذیری تنظیم شده است. گوگل چند عامل Cyber را در CodeMender برای گزارش ترکیبی به کار میبرد و عملکرد رقابتی CyberGym را ادعا میکند.
انتشار اختصاصی Flash Cyber پایلوت محدود برای دولت و شریک مورد اعتماد را برجسته میکند. این قرارداد بخشی از داستان مدل است، نه پاورقی دسترسی. قابلیت سایبری دوکاربردی است و معیار مجوز API عمومی نیست.
تیم امنیت باید کشف، اثبات exploitability، patch و deploy را با مجوز جدا کند. نامزدها در replica ایزوله، بدون secret تولید، با شاهد بازتولیدپذیر و review عادی اجرا شوند. گزارش چندعامل پوشش و در عین حال false positive و permission را زیاد میکند.
گوگل از محافظ CBRN و سوءاستفاده سایبری قویتر همراه کاهش refusal بیدلیل میگوید. کارت مقایسه خودکار با 3.5، پسرفت اندک لحن و نبود نگرانی فاحش در red team دستی را گزارش و میگوید 3.6 زیر Cyber CCL مانده است.
Hallucination، کندی و timeout گهگاهی محدودیت نامبردهاند. cutoff دانش مارس ۲۰۲۶ است، با هشدار رفتار برخی دامنهها نزدیک ژانویه ۲۰۲۵. retrieval و citation حتی برای مدل ژوئیه لازم میماند.
ایمنی میان محصول قابل انتقال نیست. Cyber قابلیت و دسترسی دیگر، Lite حجم بسیار بیشتر و 3.6 امکان کنترل رایانه دارد. هرکدام در پوشش ابزار و اختیار واقعی آزموده شود.
مجموعه ارزیابی مشترک و versioned بسازید و سپس بر اساس کلاس کار route کنید. 3.6 و Lite را روی استخراج حجمی، جستوجو، ترجمه، سند، تغییر کد کوتاه، trace بلند و computer use بسنجید. کیفیت پذیرفتهشده، p50/p95، کل توکن، ابزار، retry، دقیقه انسان و مداخله ایمنی ثبت شود.
Lite وقتی استفاده شود که قیمت و throughput از آستانه کیفیت عبور کند. کار دشوار multimodal و context بلند به 3.6 برود. Cyber در برنامه مجاز CodeMender بماند. router روشن از بلعیدن همه کارها توسط default قوی جلوگیری و ارتقا را قابل ممیزی میکند.
راهنمای گردشکار پایدار عامل checkpoint، idempotency و تأیید را پوشش میدهد. شناسه API و تاریخ ارزیابی ثابت و canary با تغییر alias تکرار شود.
عرضه ۲۱ ژوئیه یک سبد است. Gemini 3.6 Flash کد، رایانه، کار دانشی، retrieval بلند و بهرهوری را نسبت به 3.5 بالا میبرد. Flash-Lite نقطه ۳۵۰ TPS با قیمت بسیار پایینتر و Flash Cyber قابلیت تخصصی پشت مرز دسترسی باریک است.
شاهد معیار برای پایلوت هر سه نقش کافی است، نه تعویضپذیری. رشد همسان را محلی بازتولید، workflow پذیرفته را قیمتگذاری و محدودیت سایبری را حفظ کنید. استقرار قوی میان مدلها route میکند، نه یک عضو را برای همهچیز برمیگزیند.

خانواده ۱۸ تیر OpenAI مدل پرچمدار، متعادل و اقتصادی را با معیارهای پیشرو ترمینال، کد، مرور و علم و یک رده چندعاملی عرضه میکند.
ادامه مطلب
مدل Apache-2.0 در ۱۵ تیر بازخورد preview را به مسیر فعال کوچک، عامل قویتر، زمینه ۲۵۶K و پایداری عملی محصول تبدیل میکند.
ادامه مطلب
مدل ۹ تیر آنتروپیک کد، ترمینال، جستوجو، رایانه و کار دانشی را ارتقا میدهد و effort را به کنترل هزینه-عملکرد تبدیل میکند.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.