
GPT-5.6؛ خانواده Sol، Terra، Luna و عامل Ultra
خانواده ۱۸ تیر OpenAI مدل پرچمدار، متعادل و اقتصادی را با معیارهای پیشرو ترمینال، کد، مرور و علم و یک رده چندعاملی عرضه میکند.
ادامه مطلبپژوهش ژرف ایآی
میز انتشار مدل

علیبابا عرضه Qwen3.7 را در ۲۰ مه ۲۰۲۶، برابر با ۳۰ اردیبهشت ۱۴۰۵ با Qwen3.7-Max آغاز کرد و سپس Plus چندوجهی و رده اقتصادی Flash را افزود. این سه مدل یک خانواده میزبانیشده و هماهنگاند، نه سه نام نامرتبط؛ بنابراین مقاله تاریخ نخستین معرفی خانواده را نگه میدارد و زمان دسترسی اعضای بعدی را جدا توضیح میدهد.
فهرست رسمی انتشار Qwen مدل Max را پایهای برای کدنویسی، کار اداری و اجرای خودکار بلندمدت معرفی میکند. صفحه تفصیلی Qwen3.7 منبع جدول معیار Max است. Plus تصویر و ویدیو را به یک عامل واحد میآورد و Flash برای حجم و هزینه بهینه شده است.
علیبابا برای Max امتیاز ۶۰٫۶ در SWE-bench Pro، امتیاز ۶۹٫۷ در Terminal-Bench 2.0، امتیاز ۷۶٫۴ در MCP Atlas، امتیاز ۹۲٫۴ در GPQA Diamond و ۹۱٫۶ در LiveCodeBench را گزارش میکند. این اعداد از چهارچوبهای متفاوت میآیند و نباید به یک رتبه کلی بیشرط تبدیل شوند.
Max نخست در ۲۰ مه بهعنوان پرچمدار متنی اختصاصی معرفی شد. Plus یک پایه چندوجهی برای متن، تصویر و ویدیو فراهم کرد. بهروزرسانیهای سرویس در ژوئیه نیز Flash را بهعنوان مسیر کمهزینهتر و سریعتر تکمیل کردند.
هر سه زمینه بلند دارند، اما وجه ورودی و اقتصاد آنها متفاوت است. Max برای دشوارترین متن و برنامهریزی، Plus برای عامل چندوجهی و Flash برای بار پرتعداد طراحی شده است. ثبت ارزیابی فقط با نام «Qwen3.7» کافی نیست؛ شناسه دقیق و تاریخ سرویس باید معلوم باشد.
این خانواده میزبانیشده است. پیشینه وزنباز Qwen باعث نمیشود Qwen3.7-Max خودکار وزنباز باشد. اعلام مه آن را بهعنوان وزن قابل دانلود معرفی نکرده است. این مرز برای حاکمیت و استقرار خصوصی تعیینکننده است.

رکورد Max استدلال، کدنویسی و ابزار را پوشش میدهد:
| معیار | نتیجه Qwen3.7-Max | توان مورد سنجش | احتیاط |
|---|---|---|---|
| GPQA Diamond | ۹۲٫۴ | استدلال علمی تحصیلات تکمیلی | تلاش استدلال و نمونهگیری اثر دارند |
| SWE-bench Pro | ۶۰٫۶ | حل مسئله دشوار مخزن | عامل و محیط آزمون بخشی از نتیجهاند |
| Terminal-Bench 2.0 | ۶۹٫۷ | اجرای وظیفه خط فرمان | با نسخه 2.1 قابل قیاس مستقیم نیست |
| MCP Atlas | ۷۶٫۴ | کشف و هماهنگی ابزار | سقف ابزار و داور مهماند |
| LiveCodeBench | ۹۱٫۶ | تولید کد با برش زمانی | برش داده و سیاست آلودگی باید ثبت شوند |
این جدول در زمینه منبع مفید است. مقایسه عدد Terminal 2.0 با 2.1 یا SWE با پوسته عامل دیگر نتیجه ساختگی میسازد. جدولهای گسترده Qwen نیز اجرای خود شرکت و عدد رقیب از منابع منتشرشده را کنار هم میگذارند؛ هر ردیف باید منشأ داشته باشد.
راهنمای ارزیابی مدل مرزی ثبت نسخه معیار، چهارچوب، سطح تلاش، تاریخ و ارائهدهنده را لازم میداند. بدون آنها داشبورد میتواند اختلاف روش را پیشرفت مدل نشان دهد.
ادعای متمایز Max فقط دقت کد نیست. علیبابا آن را برای صدها یا هزاران گام خودکار توصیف میکند. کار بلندمدت برنامه، حافظه، بازیابی از خطا و تشخیص زمان تأیید را میسنجد. مدل ممکن است ویرایشهای جداگانه عالی داشته باشد ولی در مأموریت چندساعته هدف را گم کند.
SWE-bench و Terminal-Bench شواهد بخشی فراهم میکنند؛ MCP Atlas نیز انتخاب ابزار را میسنجد. هیچیک همکاری چندروزه، تغییر خواسته یا تصمیم انسانی را کامل پوشش نمیدهد. آزمون سازمانی باید وقفه، هدف مبهم، مرز مجوز و نقاط توقف اجباری داشته باشد.
زمینه یکمیلیونی نیز مترادف یادآوری مطمئن نیست. محدودیت قدیمی در میان متن، دستور متناقض و خلاصهسازی تصمیمها باید آزمایش شوند. ذخیره توکن زیاد ارزش دارد، اما حافظه عملی به انتخاب درست وابسته است.
Plus تصویر و ویدیو را وارد همان عامل میکند تا اسکرینشات، نمودار، سند و توالی را بدون مسیر جدا ببیند. این کار معماری محصول را ساده میکند و زمینه را میان وجوه حفظ مینماید.
اما عامل چندوجهی تعهد آزمون تازه دارد. اسکرینشات میتواند تزریق دستور داشته باشد. نمونهبرداری ویدیو شاید فریم کلیدی را حذف کند. سند نیازمند استناد ناحیهای و استخراج عدد است. یک امتیاز کلی بینایی ایمنی یا کیفیت همه این حالتها را ثابت نمیکند.
برای فارسی و عربی باید ترتیب راستبهچپ، شناسه لاتین، رقم فارسی، جدول و اسکن کمکیفیت سنجیده شود. گستره زبانی Qwen امیدوارکننده است، ولی از معیار نمودار انگلیسی نمیتوان کیفیت سند محلی را نتیجه گرفت.
مدل Flash معمولاً بیشترین حجم تولید را میگیرد: طبقهبندی، استخراج، مسیریابی و پیشنویس نخست. ارزش Qwen3.7-Flash با توان عملیاتی، تأخیر دنباله و هزینه هر کار پذیرفتهشده سنجیده میشود، نه صرفاً قیمت توکن.
قیمت کمتر ممکن است با پرگویی یا تلاش دوباره جبران شود. از سوی دیگر، Flash میتواند موارد معمول را حل و فقط موارد دشوار را به Max بفرستد. مسیریابی نباید تنها به «اطمینان» اعلامی مدل متکی باشد؛ نوع کار، خطر، بررسی قطعی و نتیجه اعتبارسنج مناسبترند.
نام مستعار latest را برای تولید نپذیرید. شناسه نسخه و سیاست تغییر سرویس را ثبت کنید، زیرا تغییر خاموش میتواند کیفیت، قیمت و طول خروجی را عوض کند. دسترسی بعدی Flash بخشی از تاریخچه خانواده است و تاریخ ۲۰ مه را بازنویسی نمیکند.
سازمانی که وزن قابل دانلود یا اجرای خصوصی لازم دارد باید Qwen3.7 را با مدلهای باز Qwen یا دیگر انتشارهای این مجموعه مقایسه کند. سرویس میزبانیشده وقتی ابزار، پایداری و منطقه مناسب دارد میتواند انتخاب اقتصادی باشد، اما «باز بودن آزمایشگاه» جای مجوز این نسخه را نمیگیرد.
منطقه رابط، نگهداری داده، ثبت تصویر و ویدیو، محدودیت نرخ، قیمت زمینه و سیاست تغییر باید مستند شوند. پاسخ ساختیافته و فراخوانی ابزار را در خطا و ورودی خراب بیازمایید. ردپای کامل ذخیره کنید تا رخداد بعد از تغییر نسخه قابل بازسازی باشد.
راهنمای عملیات مدل باز برای خانواده بسته هم کاربرد دارد: نسخه، منشأ، ارزیابی تکرارپذیر و امکان بازگشت به ارائهدهنده خاص محدود نیستند.
Max را روی سختترین برنامهریزی و کد، Plus را روی کار بومی چندوجهی و Flash را روی توزیع حجیم آزمایش کنید. معیار پذیرش یکسان بماند. حل مسئله، زمان اصلاح انسان، شکست ابزار، توکن، زمان و هزینه کل را ثبت کنید.
برای کار خودکار، نقطه توقف و خروجی میانمرحلهای قابل بازبینی لازم است. فایل اداری باید از نظر فرمول و منبع بررسی شود، کد آزمون داشته باشد و پژوهش استناد پشتیبان ارائه کند. سپس Flash برای کمخطر، Plus برای تصویر و Max برای برنامه عمیق مسیریابی میشوند.
Qwen3.7 انتشار مهمی است چون سه محدودیت تولید—تکمیل مرزی، چندوجهی بومی و مقیاس اقتصادی—را در یک نسل سازمان میدهد. معیارهای Max آزمایش جدی را توجیه میکنند، ولی نبود وزن قابل دانلود و تفاوت وجوه اجازه نمیدهد سه عضو را یک نقطه قابل تعویض بدانیم.

خانواده ۱۸ تیر OpenAI مدل پرچمدار، متعادل و اقتصادی را با معیارهای پیشرو ترمینال، کد، مرور و علم و یک رده چندعاملی عرضه میکند.
ادامه مطلب
مدل ۹ تیر آنتروپیک کد، ترمینال، جستوجو، رایانه و کار دانشی را ارتقا میدهد و effort را به کنترل هزینه-عملکرد تبدیل میکند.
ادامه مطلب
مدل ۲۹ اردیبهشت گوگل استنتاج سریع را با امتیازهای قوی کدنویسی، ابزار، چندوجهی و کار بلندمدت ترکیب میکند، اما سامانه اجرا هنوز بخشی از نتیجه است.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.