Claude Fable 5 و Mythos 5؛ یک مدل، دو مرز دسترسی

پ

پژوهش ژرف ای‌آی

میز انتشار مدل

۱۹ خرداد ۱۴۰۵به‌روزرسانی ۱۵ مرداد ۱۴۰۵۶ دقیقه مطالعه
Claude Fable 5 و Mythos 5؛ یک مدل، دو مرز دسترسی

آنتروپیک در ۹ ژوئن ۲۰۲۶، برابر با ۱۹ خرداد ۱۴۰۵ Claude Fable 5 و Claude Mythos 5 را عرضه کرد. این‌ها دو مدل بنیادین جدا نیستند. اعلام رسمی می‌گوید Fable همان مدل زیرین Mythos است که حفاظت‌های بیشتری برای امنیت سایبری و زیست‌شناسی دارد. Fable عمومی و Mythos مخصوص مشتری تأییدشده است.

این معماری دسترسی، خبر اصلی است. توان مرزی فقط با وزن و امتیاز تعریف نمی‌شود. محصول می‌تواند پرسش پرخطر را به Opus 4.8 هدایت، ردپا را نگهداری یا دسترسی تأییدشده بخواهد. معیار Mythos الزاماً تجربه کاربر عادی Fable در حوزه محافظت‌شده را نشان نمی‌دهد.

یک مدل و دو سامانه مؤثر

Fable و Mythos پایه مشترک دارند. آنتروپیک می‌گوید Fable برخی درخواست‌های سایبری و زیستی را به Opus 4.8 می‌فرستد. این کنترل‌ها به‌طور میانگین در کمتر از پنج درصد جلسه‌ها فعال می‌شوند، ولی توزیع موضوع نرخ را عوض می‌کند. Mythos برای کار دوکاربردی تأییدشده محدودیت کمتری دارد و شرط نگهداری و پایش قوی‌تری اعمال می‌کند.

برای کد عمومی، مالی، بینایی و دانش، Fable مدل تازه را ارائه می‌کند. در درخواست محافظت‌شده ممکن است مدل دیگر یا امتناع پاسخ دهد. Mythos عمومی نیست. دو نام در یک مقاله‌اند چون جداسازی آن‌ها تصور آموزش مستقل می‌سازد، ولی رکورد عملیاتی هر مسیر جداست.

یک موتور مرکزی پشت دو محفظه امنیتی، مدل مشترک با کنترل دسترسی متفاوت را نشان می‌دهد.
یک موتور مرکزی پشت دو محفظه امنیتی، مدل مشترک با کنترل دسترسی متفاوت را نشان می‌دهد.

تصویر معیار توان

کارت سیستم و مواد انتشار چنین نمایی می‌دهند:

ارزیابینتیجه گزارش‌شدهمحدودیت
SWE-bench Proحدود ۸۰٪ با تلاش بالاپوسته و سطح تلاش مهم‌اند
Terminal-Bench 2.1حدود ۸۴٪چهارچوب و timeout باید یکسان باشند
DeepSWE v1.1حدود ۷۰٪کدنویسی بلند با پوسته نام‌برده
Artificial Analysis Coding Agent Index۷۷٫۲شاخص ترکیبی در تاریخ گزارش
مسیریابی حفاظت Fableکمتر از ۵٪ جلسه‌ها به‌طور میانگینموضوع نرخ را تغییر می‌دهد
ترجیح فرضیه زیست‌شناسیحدود ۸۰٪ به سود Mythos در برابر Opusمقایسه داخلی کور دانشمندان

تفاوت کوچک میان جدول‌های رسمی و صفحات بعدی از تغییر پوسته و نسخه معیار می‌آید. پس جایی که تنظیم فرق دارد، عدد تقریبی است. کارت سیستم Fable/Mythos مرجع اجرای مشخص خود است.

مهندسی نرم‌افزار بلندمدت

Fable قوی‌ترین مدل عمومی کد و عامل آنتروپیک معرفی شده است. روایت مشتری از مهاجرت وسیع، ابزار ناآشنا و مأموریت طولانی با turn کمتر می‌گوید. معیار مخزن و ترمینال این جهت را پشتیبانی می‌کند.

توان بلند فقط pass rate نیست. مدل ممکن است کار را با تغییر گسترده و سخت‌بررسی تمام کند. کمینه بودن، آزمون، امنیت، بهره‌وری ابزار و دخالت انسان را بسنجید. بعد از فشرده‌سازی، حفظ قید و اعتبارسنجی پایان مهم است.

لایه محافظ ممکن است روی رفع آسیب‌پذیری مشروع اثر بگذارد. پایلوت امنیتی مجاز باید ثبت کند پاسخ Fable، fallback Opus یا امتناع بوده است. این مسیریابی بخشی از عملکرد مؤثر است.

محدودیت Mythos و پژوهش

آنتروپیک توان پیشرفته زیرین را در سایبری و زیست‌شناسی گزارش می‌کند. این حوزه ارزش و سوءاستفاده بالا دارند؛ بنابراین Mythos به بررسی و پایش نیاز دارد.

دسترسی تأییدشده خروجی را درست یا عمل را مجاز نمی‌کند. فرضیه زیستی به بازبینی و آزمایش نیاز دارد و یافته سایبری به محدوده و افشای مسئولانه. سیاست مدل کنار حاکمیت حرفه‌ای است.

ترجیح ۸۰ درصدی فرضیه و پروژه ژنومیک چندمیلیون سلول جالب‌اند، اما شواهد اولیه داخلی‌اند، نه اثبات همگانی کشف علمی. استفاده حساس باید کمینه داده و تأیید متخصص داشته باشد.

حفاظت و تعریف بنچمارک

جدول سنتی فرض می‌کند endpoint نام‌برده همیشه همان مدل است. Fable با مسیریابی این فرض را می‌شکند. ارزیابی سازمانی باید metadata fallback را ثبت و مداخله ایمنی را جدا طبقه‌بندی کند.

امتناع درست را شکست توان معمول و fallback را توان خام Fable حساب نکنید. سه نرخ گزارش کنید: موفقیت، مداخله حفاظت و عمل ناامن یا نادرست. حوزه حساس باید مسیر تأییدشده داشته باشد، نه اینکه حفاظت عمومی ضعیف شود.

این کنترل دسترسی مبتنی بر قابلیت در لایه مدل است. راهنمای هویت و اختیار عامل مجوز مکمل در لایه ابزار را توضیح می‌دهد.

توقف، بازاستقرار و تاریخ

آنتروپیک پس از ۹ ژوئن به‌دلیل مسئله کنترل صادرات Fable را موقتاً متوقف و در ۱ ژوئیه بازاستقرار کرد. این رویداد خانواده تازه‌ای نبود و تاریخ مدل را عوض نمی‌کند.

تایم‌لاین باید وقفه را رخداد عملیاتی ثبت کند، نه پست دوم. این کار شمار انتشار را از outage، سیاست یا alias متورم نمی‌کند. برای خریدار، رخداد نشان می‌دهد سرویس مرزی به دلیل حقوقی یا ایمنی تغییر می‌کند. تداوم کسب‌وکار به مدل جایگزین و آزمون قابل replay نیاز دارد.

داده، حاکمیت و حکم

Mythos شرط نگهداری ۳۰ روزه و پایش بیشتر دارد. پژوهش محرمانه باید آن را با قرارداد، اخلاق و کمینه‌سازی داده تطبیق دهد. صرف توان مدل مجوز ارسال داده حساس نیست.

Fable نیز به بررسی منطقه، نگهداری، log، امنیت حساب و پاسخ رخداد نیاز دارد. ابزار کمترین مجوز را داشته باشد. حفاظت مدل جای sandbox یا مجوز نیست. راهنمای ارزیابی مدل مرزی آزمون کل سامانه دسترسی و ابزار را توصیه می‌کند.

Fable برای کد، تحلیل، بینایی و عامل دشوار عمومی است؛ Mythos برای برنامه زیستی و سایبری تأییدشده. اهمیت انتشار در جداسازی توان زیرین و دسترسی مؤثر است. پرسش عملی این است که چه مدل تحت کدام سیاست پاسخ می‌دهد. دو مسیر را جدا ارزیابی و تاریخ ۹ ژوئن را حفظ کنید.

مجموعه پذیرش باید چهار گروه داشته باشد: کار عادی، کار حساس مشروع، درخواست آشکارا مخرب و مورد دوکاربردی مبهم. بازبین tier پاسخ‌دهنده، نتیجه حفاظت، مفید بودن، تأخیر و امکان escalation را ثبت کند. این ماتریس هم بیش‌مسدودسازی و هم کم‌مسدودسازی خطرناک را آشکار می‌کند.

برای تیم پژوهش، نقش‌ها جدا باشند: مالک داده، پژوهشگر تأییدشده، بازبین ایمنی و مسئول اقدام. Mythos می‌تواند فرضیه یا یافته بسازد، اما انتقال به آزمایش، شبکه واقعی یا انتشار بیرونی مرحله‌ای مستقل با مجوز تازه است. خروجی باید به داده و ابزار مورد استفاده پیوند داشته باشد.

در تداوم کسب‌وکار، fallback سازمان نباید همان fallback درونی Fable فرض شود. یک مدل جایگزین، وظیفه قابل replay و سقف تأخیر تعریف کنید. اگر سرویس به‌دلیل سیاست یا منطقه در دسترس نبود، کار حساس باید امن متوقف شود، نه به endpoint ناشناخته منتقل گردد.

یادداشت منابع — بازبینی ۲۰۲۶

#Claude Fable 5#Claude Mythos 5#آنتروپیک#ایمنی هوش مصنوعی#بنچمارک

مطالب مرتبط

آماده شروع پروژه هوش مصنوعی خود هستید؟

با تیم ما تماس بگیرید و درباره نحوه کمک به کسب‌وکار خود صحبت کنید.