Qwen3.7؛ خانواده Max، Plus و Flash برای عامل‌ها

پ

پژوهش ژرف ای‌آی

میز انتشار مدل

۳۰ اردیبهشت ۱۴۰۵به‌روزرسانی ۱۵ مرداد ۱۴۰۵۶ دقیقه مطالعه
Qwen3.7؛ خانواده Max، Plus و Flash برای عامل‌ها

علی‌بابا عرضه Qwen3.7 را در ۲۰ مه ۲۰۲۶، برابر با ۳۰ اردیبهشت ۱۴۰۵ با Qwen3.7-Max آغاز کرد و سپس Plus چندوجهی و رده اقتصادی Flash را افزود. این سه مدل یک خانواده میزبانی‌شده و هماهنگ‌اند، نه سه نام نامرتبط؛ بنابراین مقاله تاریخ نخستین معرفی خانواده را نگه می‌دارد و زمان دسترسی اعضای بعدی را جدا توضیح می‌دهد.

فهرست رسمی انتشار Qwen مدل Max را پایه‌ای برای کدنویسی، کار اداری و اجرای خودکار بلندمدت معرفی می‌کند. صفحه تفصیلی Qwen3.7 منبع جدول معیار Max است. Plus تصویر و ویدیو را به یک عامل واحد می‌آورد و Flash برای حجم و هزینه بهینه شده است.

علی‌بابا برای Max امتیاز ۶۰٫۶ در SWE-bench Pro، امتیاز ۶۹٫۷ در Terminal-Bench 2.0، امتیاز ۷۶٫۴ در MCP Atlas، امتیاز ۹۲٫۴ در GPQA Diamond و ۹۱٫۶ در LiveCodeBench را گزارش می‌کند. این اعداد از چهارچوب‌های متفاوت می‌آیند و نباید به یک رتبه کلی بی‌شرط تبدیل شوند.

سه نقطه عملیاتی در یک خانواده

Max نخست در ۲۰ مه به‌عنوان پرچم‌دار متنی اختصاصی معرفی شد. Plus یک پایه چندوجهی برای متن، تصویر و ویدیو فراهم کرد. به‌روزرسانی‌های سرویس در ژوئیه نیز Flash را به‌عنوان مسیر کم‌هزینه‌تر و سریع‌تر تکمیل کردند.

هر سه زمینه بلند دارند، اما وجه ورودی و اقتصاد آن‌ها متفاوت است. Max برای دشوارترین متن و برنامه‌ریزی، Plus برای عامل چندوجهی و Flash برای بار پرتعداد طراحی شده است. ثبت ارزیابی فقط با نام «Qwen3.7» کافی نیست؛ شناسه دقیق و تاریخ سرویس باید معلوم باشد.

این خانواده میزبانی‌شده است. پیشینه وزن‌باز Qwen باعث نمی‌شود Qwen3.7-Max خودکار وزن‌باز باشد. اعلام مه آن را به‌عنوان وزن قابل دانلود معرفی نکرده است. این مرز برای حاکمیت و استقرار خصوصی تعیین‌کننده است.

سه ابزار دقیق یک نوار زمینه بلند را میان Max، Plus و Flash به اشتراک می‌گذارند.
سه ابزار دقیق یک نوار زمینه بلند را میان Max، Plus و Flash به اشتراک می‌گذارند.

جدول معیار گزارش‌شده

رکورد Max استدلال، کدنویسی و ابزار را پوشش می‌دهد:

معیارنتیجه Qwen3.7-Maxتوان مورد سنجشاحتیاط
GPQA Diamond۹۲٫۴استدلال علمی تحصیلات تکمیلیتلاش استدلال و نمونه‌گیری اثر دارند
SWE-bench Pro۶۰٫۶حل مسئله دشوار مخزنعامل و محیط آزمون بخشی از نتیجه‌اند
Terminal-Bench 2.0۶۹٫۷اجرای وظیفه خط فرمانبا نسخه 2.1 قابل قیاس مستقیم نیست
MCP Atlas۷۶٫۴کشف و هماهنگی ابزارسقف ابزار و داور مهم‌اند
LiveCodeBench۹۱٫۶تولید کد با برش زمانیبرش داده و سیاست آلودگی باید ثبت شوند

این جدول در زمینه منبع مفید است. مقایسه عدد Terminal 2.0 با 2.1 یا SWE با پوسته عامل دیگر نتیجه ساختگی می‌سازد. جدول‌های گسترده Qwen نیز اجرای خود شرکت و عدد رقیب از منابع منتشرشده را کنار هم می‌گذارند؛ هر ردیف باید منشأ داشته باشد.

راهنمای ارزیابی مدل مرزی ثبت نسخه معیار، چهارچوب، سطح تلاش، تاریخ و ارائه‌دهنده را لازم می‌داند. بدون آن‌ها داشبورد می‌تواند اختلاف روش را پیشرفت مدل نشان دهد.

Max و اجرای بلندمدت

ادعای متمایز Max فقط دقت کد نیست. علی‌بابا آن را برای صدها یا هزاران گام خودکار توصیف می‌کند. کار بلندمدت برنامه، حافظه، بازیابی از خطا و تشخیص زمان تأیید را می‌سنجد. مدل ممکن است ویرایش‌های جداگانه عالی داشته باشد ولی در مأموریت چندساعته هدف را گم کند.

SWE-bench و Terminal-Bench شواهد بخشی فراهم می‌کنند؛ MCP Atlas نیز انتخاب ابزار را می‌سنجد. هیچ‌یک همکاری چندروزه، تغییر خواسته یا تصمیم انسانی را کامل پوشش نمی‌دهد. آزمون سازمانی باید وقفه، هدف مبهم، مرز مجوز و نقاط توقف اجباری داشته باشد.

زمینه یک‌میلیونی نیز مترادف یادآوری مطمئن نیست. محدودیت قدیمی در میان متن، دستور متناقض و خلاصه‌سازی تصمیم‌ها باید آزمایش شوند. ذخیره توکن زیاد ارزش دارد، اما حافظه عملی به انتخاب درست وابسته است.

Plus و مرز چندوجهی

Plus تصویر و ویدیو را وارد همان عامل می‌کند تا اسکرین‌شات، نمودار، سند و توالی را بدون مسیر جدا ببیند. این کار معماری محصول را ساده می‌کند و زمینه را میان وجوه حفظ می‌نماید.

اما عامل چندوجهی تعهد آزمون تازه دارد. اسکرین‌شات می‌تواند تزریق دستور داشته باشد. نمونه‌برداری ویدیو شاید فریم کلیدی را حذف کند. سند نیازمند استناد ناحیه‌ای و استخراج عدد است. یک امتیاز کلی بینایی ایمنی یا کیفیت همه این حالت‌ها را ثابت نمی‌کند.

برای فارسی و عربی باید ترتیب راست‌به‌چپ، شناسه لاتین، رقم فارسی، جدول و اسکن کم‌کیفیت سنجیده شود. گستره زبانی Qwen امیدوارکننده است، ولی از معیار نمودار انگلیسی نمی‌توان کیفیت سند محلی را نتیجه گرفت.

Flash و اقتصاد تولید

مدل Flash معمولاً بیشترین حجم تولید را می‌گیرد: طبقه‌بندی، استخراج، مسیریابی و پیش‌نویس نخست. ارزش Qwen3.7-Flash با توان عملیاتی، تأخیر دنباله و هزینه هر کار پذیرفته‌شده سنجیده می‌شود، نه صرفاً قیمت توکن.

قیمت کمتر ممکن است با پرگویی یا تلاش دوباره جبران شود. از سوی دیگر، Flash می‌تواند موارد معمول را حل و فقط موارد دشوار را به Max بفرستد. مسیریابی نباید تنها به «اطمینان» اعلامی مدل متکی باشد؛ نوع کار، خطر، بررسی قطعی و نتیجه اعتبارسنج مناسب‌ترند.

نام مستعار latest را برای تولید نپذیرید. شناسه نسخه و سیاست تغییر سرویس را ثبت کنید، زیرا تغییر خاموش می‌تواند کیفیت، قیمت و طول خروجی را عوض کند. دسترسی بعدی Flash بخشی از تاریخچه خانواده است و تاریخ ۲۰ مه را بازنویسی نمی‌کند.

مرز حاکمیت و استقرار

سازمانی که وزن قابل دانلود یا اجرای خصوصی لازم دارد باید Qwen3.7 را با مدل‌های باز Qwen یا دیگر انتشارهای این مجموعه مقایسه کند. سرویس میزبانی‌شده وقتی ابزار، پایداری و منطقه مناسب دارد می‌تواند انتخاب اقتصادی باشد، اما «باز بودن آزمایشگاه» جای مجوز این نسخه را نمی‌گیرد.

منطقه رابط، نگهداری داده، ثبت تصویر و ویدیو، محدودیت نرخ، قیمت زمینه و سیاست تغییر باید مستند شوند. پاسخ ساخت‌یافته و فراخوانی ابزار را در خطا و ورودی خراب بیازمایید. ردپای کامل ذخیره کنید تا رخداد بعد از تغییر نسخه قابل بازسازی باشد.

راهنمای عملیات مدل باز برای خانواده بسته هم کاربرد دارد: نسخه، منشأ، ارزیابی تکرارپذیر و امکان بازگشت به ارائه‌دهنده خاص محدود نیستند.

ماتریس ارزیابی و جمع‌بندی

Max را روی سخت‌ترین برنامه‌ریزی و کد، Plus را روی کار بومی چندوجهی و Flash را روی توزیع حجیم آزمایش کنید. معیار پذیرش یکسان بماند. حل مسئله، زمان اصلاح انسان، شکست ابزار، توکن، زمان و هزینه کل را ثبت کنید.

برای کار خودکار، نقطه توقف و خروجی میان‌مرحله‌ای قابل بازبینی لازم است. فایل اداری باید از نظر فرمول و منبع بررسی شود، کد آزمون داشته باشد و پژوهش استناد پشتیبان ارائه کند. سپس Flash برای کم‌خطر، Plus برای تصویر و Max برای برنامه عمیق مسیریابی می‌شوند.

Qwen3.7 انتشار مهمی است چون سه محدودیت تولید—تکمیل مرزی، چندوجهی بومی و مقیاس اقتصادی—را در یک نسل سازمان می‌دهد. معیارهای Max آزمایش جدی را توجیه می‌کنند، ولی نبود وزن قابل دانلود و تفاوت وجوه اجازه نمی‌دهد سه عضو را یک نقطه قابل تعویض بدانیم.

یادداشت منابع — بازبینی ۲۰۲۶

#Qwen3.7#علی‌بابا#عامل هوش مصنوعی#هوش چندوجهی#بنچمارک

مطالب مرتبط

آماده شروع پروژه هوش مصنوعی خود هستید؟

با تیم ما تماس بگیرید و درباره نحوه کمک به کسب‌وکار خود صحبت کنید.