Claude Opus 4.8؛ عامل، کدنویسی و بینایی قوی‌تر

پ

پژوهش ژرف ای‌آی

میز انتشار مدل

۷ خرداد ۱۴۰۵به‌روزرسانی ۱۵ مرداد ۱۴۰۵۶ دقیقه مطالعه
Claude Opus 4.8؛ عامل، کدنویسی و بینایی قوی‌تر

آنتروپیک در ۲۸ مه ۲۰۲۶، برابر با ۷ خرداد ۱۴۰۵ Claude Opus 4.8 را به‌عنوان قوی‌ترین مدل عمومی خود پیش از Fable و Mythos منتشر کرد. اعلام رسمی بر مهندسی نرم‌افزار خودکار، کار دانشی پیچیده، بینایی و استفاده از رایانه تمرکز دارد.

کارت سیستم امتیاز ۸۸٫۶ در SWE-bench Verified، امتیاز ۶۹٫۲ در SWE-bench Pro، امتیاز ۸۴٫۳ در BrowseComp تک‌عامل و ۸۸٫۵ در چندعامل، امتیاز ۸۳٫۴ در OSWorld-Verified و ۴۹٫۸ در Humanity's Last Exam بدون ابزار را گزارش می‌کند. اهمیت مدل فقط صدرنشینی یک عدد نیست؛ این نسخه کف توان را در چند کار ارزشمند بالا می‌برد و شواهد ایمنی گسترده‌ای منتشر می‌کند.

تغییر واقعی در خط Opus

نام نسخه افزایشی است، ولی تمرکز عامل تغییر قابل توجهی دارد. آنتروپیک می‌گوید مدل در وظیفه بلند دستور را بهتر دنبال می‌کند، مخزن را عمیق‌تر می‌گردد، ابزار را با نظارت کمتر به کار می‌برد و سند حرفه‌ای‌تری می‌سازد. مشتریان اولیه از مهاجرت و درخواست کششی می‌گویند که نسخه پیشین نیمه‌کاره رها می‌کرد.

مدل میزبانی‌شده است و از محصولات Claude، Claude Code و رابط Claude ارائه می‌شود. پس سروینگ، لایه سیاست، توکنایزر، سطح تلاش، مدیریت زمینه و ابزار محصول بخشی از سامانه‌اند. نام مدل به‌تنهایی شرح آزمایش نیست.

برای رکورد تولید باید شناسه، سطح محصول، تلاش، ابزار، تاریخ و سیاست تکرار ثبت شود. نتیجه کارت سیستم ممکن است با پوسته، فشرده‌سازی یا ابزار متفاوت اجرا شده باشد.

ابزاری بزرگ و دقیق چند ابزار کوچک را در یک میزکار خودکار هماهنگ می‌کند.
ابزاری بزرگ و دقیق چند ابزار کوچک را در یک میزکار خودکار هماهنگ می‌کند.

تصویر توان از کارت سیستم

رکورد رسمی چند حوزه را پوشش می‌دهد:

ارزیابینتیجه Opus 4.8نکته تنظیم
SWE-bench Verified۸۸٫۶٪حل مسئله مخزن با سامانه عامل گزارش‌شده
SWE-bench Pro۶۹٫۲٪مسائل دشوارتر و حساس به چهارچوب
BrowseComp۸۴٫۳٪ تک‌عامل؛ ۸۸٫۵٪ چندعاملارکستراسیون پوشش را بالا می‌برد
Humanity's Last Exam۴۹٫۸٪ بدون ابزار؛ ۵۷٫۹٪ با ابزارابزار تعریف ارزیابی را تغییر می‌دهد
OSWorld-Verified۸۳٫۴٪عمل در محیط گرافیکی
ChartQAPro۶۹٫۴٪ بدون ابزار؛ ۷۲٫۳٪ با ابزارپرسش نموداری
GPQA Diamond۹۳٫۶٪استدلال علوم تحصیلات تکمیلی

این‌ها یک جدول مشترک بی‌قید نیستند. چندعامل هزینه و هماهنگی دارد؛ ابزار با اجرای بدون ابزار یکسان نیست؛ OSWorld به رابط عمل وابسته است. کارت کامل سیستم مرجع تصمیم خرید است.

مهندسی نرم‌افزار؛ روشن‌ترین کاربرد

SWE-bench از عامل می‌خواهد مخزن را بفهمد، کد را تغییر دهد و آزمون را عبور دهد. این حرکت از تکمیل تابع به حل مسئله عملی مهم است؛ مدل باید ساختار، قرارداد و شکست را دنبال کند.

با این حال عبور آزمون کیفیت وصله را کامل نمی‌گوید. راه‌حل ممکن است شکننده، گسترده یا دارای ضعف امنیت باشد. آزمایش محلی باید کمینه بودن تغییر، نگهداشت‌پذیری، کیفیت آزمون، امنیت و زمان بازبینی را کنار حل نهایی بسنجد. چند اجرا برای واریانس لازم است.

Claude Code سهم بزرگی در تجربه دارد. مجوز ابزار، خلاصه‌سازی، زیرعامل و پیام سیستمی بر ماندگاری اثر می‌گذارند. مقایسه آن با رابط خام رقیب، مقایسه سامانه است. راهنمای عامل مهندسی نرم‌افزار کنترل مخزن و بازبینی را توضیح می‌دهد.

جست‌وجو و چندعامل

BrowseComp پژوهش دشواری را می‌سنجد که به یافتن و ترکیب چند شاهد نیاز دارد. جهش از ۸۴٫۳ به ۸۸٫۵ نشان می‌دهد جست‌وجوی موازی می‌تواند پوشش را بهتر کند؛ اما تماس، توکن و زمان بیشتری مصرف می‌شود.

چند عامل می‌توانند خطای هم‌بسته را تقویت کنند اگر همه یک منبع ضعیف را تکرار کنند. سامانه به تنوع منبع، استناد سطح ادعا، حذف تکرار و داوری نیاز دارد که ترکیب بی‌پشتوانه را رد کند. هزینه باید برای نتیجه پژوهش پذیرفته‌شده گزارش شود.

در خبر زنده، تاریخ منبع و رخداد مهم است. عامل باید اعلام مدل را از به‌روزرسانی کارت یا تغییر نام رابط جدا کند. دفتر پوشش همین مجموعه برای جلوگیری از خطای تاریخ ساخته شده است.

رایانه و استدلال بصری

امتیاز ۸۳٫۴ OSWorld توان عمل در محیط گرافیکی را نشان می‌دهد و کار بدون رابط قابل اتکا را ممکن می‌کند. در مقابل، حالت پنهان، تزریق دستور، کلیک اشتباه و عمل برگشت‌ناپذیر را وارد می‌سازد. درصد موفقیت شدت شکست باقی‌مانده را نمی‌گوید.

حساب ایزوله و کمترین دسترسی لازم است. ارسال، انتشار، خرید، تغییر مجوز و حذف باید تأیید شوند. تصویر و عمل ذخیره شود تا اجرا قابل حسابرسی باشد. وقتی رابط ساخت‌یافته وجود دارد، پیکسل جایگزین حکمرانی نیست.

ChartQAPro توان شکل متراکم را تقویت می‌کند. استخراج حساس باید ناحیه، واحد و منبع را برگرداند. روانی بصری خطای OCR یا عدد را حذف نمی‌کند.

ابزار تعریف معیار را عوض می‌کند

HLE از ۴۹٫۸ بدون ابزار به ۵۷٫۹ با ابزار می‌رسد. این اختلاف نشان می‌دهد سامانه مستقر از جست‌وجو یا محاسبه چه می‌گیرد. ابزار خطای حافظه را کم می‌کند، ولی کیفیت منبع، شکست ابزار و مجوز را اضافه می‌کند.

جدول خرید باید مدل تنها، مدل با ابزار و عامل کامل را جدا نگه دارد. ترکیب آن‌ها به ارائه‌دهنده‌ای پاداش می‌دهد که پوسته قوی‌تری آورده است. سطح تلاش نیز هزینه و تأخیر را با استدلال مبادله می‌کند.

راهنمای ارزیابی مدل مرزی فهرست اجزای غیرمدلی را لازم می‌داند. بدون آن، تغییر امتیاز بعدی قابل توضیح نیست.

ایمنی، هزینه و حکم

کارت سیستم سوءاستفاده، سایبری، زیستی، هم‌ترازی و توهم را پوشش می‌دهد. این شفافیت ارزشمند است، اما گواهی استقرار خریدار نیست. مدل خواندنی مخزن با مدل دارای اعتبارنامه و شبکه خطر یکسان ندارد. تزریق غیرمستقیم، راز، دستور مخرب و خروج داده باید در سطح سامانه کنترل شوند.

Opus برای کاری مناسب است که تکمیل بهتر قیمت بالاتر را توجیه کند: تغییر سخت مخزن، تحلیل بلند، پژوهش پیچیده و کار رایانه‌ای. استخراج معمول می‌تواند به مدل کوچک‌تر برسد. هزینه کل شامل توکن، زمان، ابزار، بازبینی و رخداد است.

در مهاجرت، مجموعه وظیفه باید قابل حمل و ردپا کامل باشد. مدل میزبانی تغییر می‌کند و فقط آزمون پذیرش ثابت می‌تواند افت نسخه بعد یا مزیت رقیب را نشان دهد. امتناع ایمن را نیز از شکست توان جدا کنید تا سیستم به‌خاطر رعایت مرز امنیتی جریمه نشود.

نتیجه درست پایلوت کنترل‌شده برای کار دشوار است. مدل و پوسته را ثابت کنید، امتیاز ابزار را جدا نگه دارید، کمترین مجوز بدهید و نتیجه را با آزمون یا شاهد عینی تأیید کنید. Opus 4.8 خط پایه مهم عمومی تابستان ۲۰۲۶ باقی می‌ماند.

یادداشت منابع — بازبینی ۲۰۲۶

#Claude Opus 4.8#آنتروپیک#عامل هوش مصنوعی#کدنویسی#ایمنی مدل

مطالب مرتبط

آماده شروع پروژه هوش مصنوعی خود هستید؟

با تیم ما تماس بگیرید و درباره نحوه کمک به کسب‌وکار خود صحبت کنید.