
GPT-5.6؛ خانواده Sol، Terra، Luna و عامل Ultra
خانواده ۱۸ تیر OpenAI مدل پرچمدار، متعادل و اقتصادی را با معیارهای پیشرو ترمینال، کد، مرور و علم و یک رده چندعاملی عرضه میکند.
ادامه مطلبپژوهش ژرف ایآی
میز انتشار مدل

گوگل در ۱۹ مه ۲۰۲۶، برابر با ۲۹ اردیبهشت ۱۴۰۵ مدل Gemini 3.5 Flash را بهعنوان نخستین عضو عمومی خانواده 3.5 عرضه کرد. اعلام رسمی گوگل ادعا میکند یک مدل کلاس Flash اکنون در عامل و کدنویسی با پرچمداران بزرگ رقابت میکند و سرعت خروجی حدود چهار برابر مدلهای مرزی دیگر دارد.
گوگل امتیاز ۷۶٫۲ در Terminal-Bench 2.1، امتیاز ۸۳٫۶ در MCP Atlas، امتیاز ۸۴٫۲ در CharXiv Reasoning و ۱٬۶۵۶ Elo در GDPval-AA را گزارش میکند. این چهار عدد چهار سامانه متفاوت را میسنجند: ترمینال، هماهنگی ابزار، استدلال روی نمودار و کار حرفهای با داوری کارشناسی. جمع یا میانگینگیری آنها یک «ضریب هوش» معتبر نمیسازد.
Gemini 3.5 نام خانواده است، ولی Flash تنها عضو عمومی زمان اعلام بود. گوگل گفت 3.5 Pro هنوز بهصورت داخلی استفاده میشود. پس تاریخ این مقاله متعلق به Flash است و نباید نسخه عرضهنشده را در همان روز منتشرشده فرض کرد.
مدل از طریق اپ Gemini، حالت AI در جستوجو، Google Antigravity، رابط Gemini، Android Studio و محصولات سازمانی ارائه شد. هر یک از این سطحها سامانه متفاوتی است. مدل خام، عامل مدیریتشده Antigravity و اپ دارای جستوجو یا استفاده از رایانه نتیجه یکسانی تولید نمیکنند.
در ۲۴ ژوئن، گوگل قابلیت استفاده بومی از رایانه را به همین مدل افزود. این گسترش ابزار است و مدل بنیادین تازهای با تاریخ جدید محسوب نمیشود. برای بازتولید، باید هم شناسه مدل و هم چهارچوب عامل ثبت شود.

چهار مقدار اصلی دامنه توان مدل را نشان میدهند:
| معیار | نتیجه Gemini 3.5 Flash | موضوع | احتیاط |
|---|---|---|---|
| Terminal-Bench 2.1 | ۷۶٫۲٪ | اجرای وظیفه در خط فرمان | عامل، زمان و سیاست ابزار امتیاز را تغییر میدهند |
| MCP Atlas | ۸۳٫۶٪ | استفاده از سرورهای ابزار | سقف فراخوانی و داور مهماند |
| CharXiv Reasoning | ۸۴٫۲٪ | استدلال روی نمودار علمی | وضوح تصویر و روش نمرهدهی اثر دارند |
| GDPval-AA | ۱٬۶۵۶ Elo | ترجیح کارشناس روی خروجی حرفهای | Elo به مجموعه رقیبان وابسته است |
ادعای چهار برابر سرعت نیز بدون سختافزار، سرویسدهنده، طول خروجی و همزمانی یک نسبت جهانی نیست. توکن بر ثانیه زمان توکن اول، اجرای ابزار و تعداد توکن لازم برای پایان کار را حذف میکند. راهنمای مهندسی تأخیر استنتاج این لایهها را جدا میکند.
برای عامل، زمان و هزینه هر وظیفه پذیرفتهشده مناسبتر از سرعت رمزگشایی تنهاست. مدلی که سریع متن ناقص تولید کند ممکن است در بازبینی انسان کندتر تمام شود.
Terminal-Bench از عامل میخواهد وضعیت محیط را ببیند، دستور اجرا کند، خطا را رفع کند و نتیجه را بررسی کند. این کار به مهندسی واقعی نزدیکتر از تکمیل یک تابع است، اما پوسته عامل بخش مهمی از امتیاز است. پیام سیستمی، فشردهسازی زمینه، تلاش مجدد، مجوز فایل و مدت اجرا نتیجه را جابهجا میکنند.
عدد ۷۶٫۲ شاهد خوبی است که یک مدل سریع میتواند کار چندمرحلهای را حفظ کند. این عدد تضمین نمیکند فراخوانی مستقیم رابط یا افزونهای دیگر همان عملکرد را داشته باشد. Antigravity عامل و محیط مدیریتشده فراهم میکند؛ رابط خام بهتنهایی آن را بازسازی نمیکند.
آزمون داخلی باید مسئله واقعی مخزن را با چهارچوب ثابت اجرا کند و حل نهایی، کیفیت آزمون، رگرسیون، توکن، زمان و تلاش بازبینی را بسنجد. پیام «کار تمام شد» معیار قبولی نیست.
MCP Atlas انتخاب ابزار، تکمیل آرگومان، تفسیر نتیجه و حفظ وضعیت را در چند مرحله میسنجد. امتیاز ۸۳٫۶ نشان میدهد مدل برای خودکارسازی ابزارمحور جدی است. کیفیت طرح ابزار نیز تعیینکننده است؛ نام روشن و ورودی محدود همه مدلها را بهتر میکند و ابزار مبهم تفاوت برنامهریزی را آشکار میسازد.
توان ابزار با اختیار عمل یکی نیست. سامانه واقعی به فهرست مجاز، طرح نوعدار، کلید تکرارناپذیری، حالت آزمایشی و تأیید انسان برای ارسال پیام، پرداخت، تغییر دسترسی یا حذف داده نیاز دارد.
اعلام استفاده از رایانه دو کنترل اختیاری سازمانی را نیز توضیح میدهد: تأیید صریح عمل حساس و توقف در صورت تشخیص تزریق دستور غیرمستقیم. این کنترلها بخشی از محصولاند، نه توان ذاتی مدل.
CharXiv Reasoning نمودار علمی را میسنجد؛ مدل باید محور، مقدار و رابطه را درک کند و نتیجه استدلالی بدهد. امتیاز ۸۴٫۲ برای پژوهش، مالی و سند فنی مهمتر از توان نوشتن کپشن عکس است.
داده واقعی سختتر است: اسکن کمکیفیت، شکل چندبخشی، راهنمای بریده، محور لگاریتمی و رنگ بدون برچسب خطاهای خاص ایجاد میکنند. برای استخراج حساس باید ناحیه یا مختصات منبع بازگردانده و عدد با تصویر تطبیق شود. امتیاز تجمیعی محاسبه بصری را خودتأیید نمیکند.
گوگل همچنین از رابط و گرافیک غنیتر سخن میگوید. کیفیت ظاهری باید همراه کامل بودن، واکنشگرایی، دسترسپذیری و صحت عملکرد سنجیده شود. تصویر زیبا ممکن است تعامل خراب را پنهان کند.
اگر نسبت سرعت در محیط هدف حفظ شود، اثر بزرگتر از چت سریع است. سامانه میتواند در یک بودجه زمانی چند شاخه، اعتبارسنج یا دور اصلاح اجرا کند. حلقه مشاهده و عمل در استفاده از رایانه نیز کوتاهتر میشود.
اما عامل بدون محدودیت میتواند صرفهجویی را با فراخوانی بیشتر از بین ببرد. نرخ کش، طول ورودی، قیمت زمینه بلند و پرگویی هزینه را تعیین میکنند. سرعت و بهرهوری توکن یک چیز نیستند؛ معرفی بعدی Gemini 3.6 نیز همین جدایی را برجسته کرد.
سه سطح را ثبت کنید: تأخیر مدل خام، حلقه کامل عامل و زمان قابل مشاهده کاربر. شکست و تلاش مجدد را حذف نکنید. مقایسه منصفانه باید کیفیت پذیرفتهشده و سیاست ابزار یکسان داشته باشد.
Gemini 3.5 Flash گزینهای معتبر برای کمک کدنویسی حجیم، پژوهش متن-تصویر، پشتیبانی ابزارمحور و عامل تعاملی است. استفاده بومی از رایانه آن را برای نرمافزارهایی که رابط مطمئن ندارند جذاب میکند. برای کار حداکثر دقت یا الزام وزنباز، انتخاب بدیهی نیست.
مجموعه آزمون نسخهدار از باگ، ترمینال، نمودار و ابزار واقعی بسازید. مدل، دما، استدلال، سقف خروجی، زمینه و بودجه ابزار را ثابت کنید. چند تکرار لازم است چون یک مسیر موفق میتواند سیاست شکننده را پنهان کند.
کد باید آزمون شود، پژوهش باید استناد پشتیبان داشته باشد و سند باید در سطح فیلد تطبیق شود. راهنمای ارزیابی مدل مرزی برای همین مقایسه کنترلشده طراحی شده است. نتیجه قابل دفاع این است که Flash وارد قلمرو عامل مرزی شده؛ نه اینکه نیاز به اعتبارسنجی سامانه را حذف کرده است.

خانواده ۱۸ تیر OpenAI مدل پرچمدار، متعادل و اقتصادی را با معیارهای پیشرو ترمینال، کد، مرور و علم و یک رده چندعاملی عرضه میکند.
ادامه مطلب
مدل ۹ تیر آنتروپیک کد، ترمینال، جستوجو، رایانه و کار دانشی را ارتقا میدهد و effort را به کنترل هزینه-عملکرد تبدیل میکند.
ادامه مطلب
پرچمدار ۷ خرداد آنتروپیک کار مخزن، عامل بلندمدت، استفاده از رایانه و استدلال بصری را ارتقا میدهد و کارت سیستم محدودیتها را آشکار میکند.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.