
Claude Sonnet 5؛ عامل نزدیک Opus با اقتصاد Sonnet
مدل ۹ تیر آنتروپیک کد، ترمینال، جستوجو، رایانه و کار دانشی را ارتقا میدهد و effort را به کنترل هزینه-عملکرد تبدیل میکند.
ادامه مطلبپژوهش ژرف ایآی
میز انتشار مدل

آنتروپیک در ۹ ژوئن ۲۰۲۶، برابر با ۱۹ خرداد ۱۴۰۵ Claude Fable 5 و Claude Mythos 5 را عرضه کرد. اینها دو مدل بنیادین جدا نیستند. اعلام رسمی میگوید Fable همان مدل زیرین Mythos است که حفاظتهای بیشتری برای امنیت سایبری و زیستشناسی دارد. Fable عمومی و Mythos مخصوص مشتری تأییدشده است.
این معماری دسترسی، خبر اصلی است. توان مرزی فقط با وزن و امتیاز تعریف نمیشود. محصول میتواند پرسش پرخطر را به Opus 4.8 هدایت، ردپا را نگهداری یا دسترسی تأییدشده بخواهد. معیار Mythos الزاماً تجربه کاربر عادی Fable در حوزه محافظتشده را نشان نمیدهد.
Fable و Mythos پایه مشترک دارند. آنتروپیک میگوید Fable برخی درخواستهای سایبری و زیستی را به Opus 4.8 میفرستد. این کنترلها بهطور میانگین در کمتر از پنج درصد جلسهها فعال میشوند، ولی توزیع موضوع نرخ را عوض میکند. Mythos برای کار دوکاربردی تأییدشده محدودیت کمتری دارد و شرط نگهداری و پایش قویتری اعمال میکند.
برای کد عمومی، مالی، بینایی و دانش، Fable مدل تازه را ارائه میکند. در درخواست محافظتشده ممکن است مدل دیگر یا امتناع پاسخ دهد. Mythos عمومی نیست. دو نام در یک مقالهاند چون جداسازی آنها تصور آموزش مستقل میسازد، ولی رکورد عملیاتی هر مسیر جداست.

کارت سیستم و مواد انتشار چنین نمایی میدهند:
| ارزیابی | نتیجه گزارششده | محدودیت |
|---|---|---|
| SWE-bench Pro | حدود ۸۰٪ با تلاش بالا | پوسته و سطح تلاش مهماند |
| Terminal-Bench 2.1 | حدود ۸۴٪ | چهارچوب و timeout باید یکسان باشند |
| DeepSWE v1.1 | حدود ۷۰٪ | کدنویسی بلند با پوسته نامبرده |
| Artificial Analysis Coding Agent Index | ۷۷٫۲ | شاخص ترکیبی در تاریخ گزارش |
| مسیریابی حفاظت Fable | کمتر از ۵٪ جلسهها بهطور میانگین | موضوع نرخ را تغییر میدهد |
| ترجیح فرضیه زیستشناسی | حدود ۸۰٪ به سود Mythos در برابر Opus | مقایسه داخلی کور دانشمندان |
تفاوت کوچک میان جدولهای رسمی و صفحات بعدی از تغییر پوسته و نسخه معیار میآید. پس جایی که تنظیم فرق دارد، عدد تقریبی است. کارت سیستم Fable/Mythos مرجع اجرای مشخص خود است.
Fable قویترین مدل عمومی کد و عامل آنتروپیک معرفی شده است. روایت مشتری از مهاجرت وسیع، ابزار ناآشنا و مأموریت طولانی با turn کمتر میگوید. معیار مخزن و ترمینال این جهت را پشتیبانی میکند.
توان بلند فقط pass rate نیست. مدل ممکن است کار را با تغییر گسترده و سختبررسی تمام کند. کمینه بودن، آزمون، امنیت، بهرهوری ابزار و دخالت انسان را بسنجید. بعد از فشردهسازی، حفظ قید و اعتبارسنجی پایان مهم است.
لایه محافظ ممکن است روی رفع آسیبپذیری مشروع اثر بگذارد. پایلوت امنیتی مجاز باید ثبت کند پاسخ Fable، fallback Opus یا امتناع بوده است. این مسیریابی بخشی از عملکرد مؤثر است.
آنتروپیک توان پیشرفته زیرین را در سایبری و زیستشناسی گزارش میکند. این حوزه ارزش و سوءاستفاده بالا دارند؛ بنابراین Mythos به بررسی و پایش نیاز دارد.
دسترسی تأییدشده خروجی را درست یا عمل را مجاز نمیکند. فرضیه زیستی به بازبینی و آزمایش نیاز دارد و یافته سایبری به محدوده و افشای مسئولانه. سیاست مدل کنار حاکمیت حرفهای است.
ترجیح ۸۰ درصدی فرضیه و پروژه ژنومیک چندمیلیون سلول جالباند، اما شواهد اولیه داخلیاند، نه اثبات همگانی کشف علمی. استفاده حساس باید کمینه داده و تأیید متخصص داشته باشد.
جدول سنتی فرض میکند endpoint نامبرده همیشه همان مدل است. Fable با مسیریابی این فرض را میشکند. ارزیابی سازمانی باید metadata fallback را ثبت و مداخله ایمنی را جدا طبقهبندی کند.
امتناع درست را شکست توان معمول و fallback را توان خام Fable حساب نکنید. سه نرخ گزارش کنید: موفقیت، مداخله حفاظت و عمل ناامن یا نادرست. حوزه حساس باید مسیر تأییدشده داشته باشد، نه اینکه حفاظت عمومی ضعیف شود.
این کنترل دسترسی مبتنی بر قابلیت در لایه مدل است. راهنمای هویت و اختیار عامل مجوز مکمل در لایه ابزار را توضیح میدهد.
آنتروپیک پس از ۹ ژوئن بهدلیل مسئله کنترل صادرات Fable را موقتاً متوقف و در ۱ ژوئیه بازاستقرار کرد. این رویداد خانواده تازهای نبود و تاریخ مدل را عوض نمیکند.
تایملاین باید وقفه را رخداد عملیاتی ثبت کند، نه پست دوم. این کار شمار انتشار را از outage، سیاست یا alias متورم نمیکند. برای خریدار، رخداد نشان میدهد سرویس مرزی به دلیل حقوقی یا ایمنی تغییر میکند. تداوم کسبوکار به مدل جایگزین و آزمون قابل replay نیاز دارد.
Mythos شرط نگهداری ۳۰ روزه و پایش بیشتر دارد. پژوهش محرمانه باید آن را با قرارداد، اخلاق و کمینهسازی داده تطبیق دهد. صرف توان مدل مجوز ارسال داده حساس نیست.
Fable نیز به بررسی منطقه، نگهداری، log، امنیت حساب و پاسخ رخداد نیاز دارد. ابزار کمترین مجوز را داشته باشد. حفاظت مدل جای sandbox یا مجوز نیست. راهنمای ارزیابی مدل مرزی آزمون کل سامانه دسترسی و ابزار را توصیه میکند.
Fable برای کد، تحلیل، بینایی و عامل دشوار عمومی است؛ Mythos برای برنامه زیستی و سایبری تأییدشده. اهمیت انتشار در جداسازی توان زیرین و دسترسی مؤثر است. پرسش عملی این است که چه مدل تحت کدام سیاست پاسخ میدهد. دو مسیر را جدا ارزیابی و تاریخ ۹ ژوئن را حفظ کنید.
مجموعه پذیرش باید چهار گروه داشته باشد: کار عادی، کار حساس مشروع، درخواست آشکارا مخرب و مورد دوکاربردی مبهم. بازبین tier پاسخدهنده، نتیجه حفاظت، مفید بودن، تأخیر و امکان escalation را ثبت کند. این ماتریس هم بیشمسدودسازی و هم کممسدودسازی خطرناک را آشکار میکند.
برای تیم پژوهش، نقشها جدا باشند: مالک داده، پژوهشگر تأییدشده، بازبین ایمنی و مسئول اقدام. Mythos میتواند فرضیه یا یافته بسازد، اما انتقال به آزمایش، شبکه واقعی یا انتشار بیرونی مرحلهای مستقل با مجوز تازه است. خروجی باید به داده و ابزار مورد استفاده پیوند داشته باشد.
در تداوم کسبوکار، fallback سازمان نباید همان fallback درونی Fable فرض شود. یک مدل جایگزین، وظیفه قابل replay و سقف تأخیر تعریف کنید. اگر سرویس بهدلیل سیاست یا منطقه در دسترس نبود، کار حساس باید امن متوقف شود، نه به endpoint ناشناخته منتقل گردد.

مدل ۹ تیر آنتروپیک کد، ترمینال، جستوجو، رایانه و کار دانشی را ارتقا میدهد و effort را به کنترل هزینه-عملکرد تبدیل میکند.
ادامه مطلب
خانواده ۱۸ تیر OpenAI مدل پرچمدار، متعادل و اقتصادی را با معیارهای پیشرو ترمینال، کد، مرور و علم و یک رده چندعاملی عرضه میکند.
ادامه مطلب
پرچمدار ۷ خرداد آنتروپیک کار مخزن، عامل بلندمدت، استفاده از رایانه و استدلال بصری را ارتقا میدهد و کارت سیستم محدودیتها را آشکار میکند.
ادامه مطلببا تیم ما تماس بگیرید و درباره نحوه کمک به کسبوکار خود صحبت کنید.