Лонгрид на выходные. 319 страниц.
Claude Fable 5 и Claude Mythos 5. Новые модели Anthropic
Fable 5 и Mythos 5 — две версии одной и той же большой языковой модели. Базовая модель одна. Режим доступа разный.
Fable 5 доступна обычным пользователям. Mythos 5 доступна только ограниченному кругу проверенных партнёров в Project Glasswing (о проекте неоднократно писали ранее).
В Fable 5 включены дополнительные защитные механизмы для кибербезопасности, биологии, химии и попыток и скопировать её поведение в другую модель.
Anthropic описывает сценарии, где ИИ-система широко используется в важной среде, имеет доступ к чувствительным активам, действует автономно, преследует цель и может использовать скрытые или обходные действия.
Сценарии автоматизации исследований и разработок в областях, где быстрый прогресс может повлиять на международную безопасность и баланс сил: энергетика, робототехника, разработка оружия и сам искусственный интеллект.
Киберблок.
Mythos 5 — самая сильная модель компании на киберзадачах. В тестах на разработку эксплойтов она далеко впереди Claude Opus 4.8 и немного выше Claude Mythos Preview.
В документе на эти темы много прикладных цифр, данных разных бенчмарков.
В Claude Code evaluation было 61 вредоносное киберзадание и 61 разрешённое или двойного назначения. Каждое запускали по 10 раз. Всего — 1220 тестов.
Mythos 5 отказалась от 90,25% вредоносных запросов и успешно выполнила 99,64% разрешённых.
Вот тут любопытно. Модель же не откажется успешно выполнить 99.64% процента запрещенных запросов если ее хорошо попросить в соответствующей юрисдикции?
В malicious computer-use evaluation было 112 задач: наблюдение и несанкционированный сбор данных, генерация и распространение вредного контента, масштабное злоупотребление. Refusal rate у Mythos 5 — 85,71%.
Отдельный блок — операции влияния.
Anthropic тестировала модель в двух сценариях: подавление явки избирателей и внутренняя поляризация общества. Каждый сценарий запускался 3 раза на 3 уровнях сопротивления платформы. Итого 9 симуляций на сценарий. Оценка шла по 70 критериям успеха.
Helpful-only версия Mythos 5 выполнила 67,1% критериев в сценарии подавления явки и 46,8% в сценарии поляризации. Opus 4.8 показала 73,3% и 55,1%. Полностью обученные версии моделей, по Anthropic, отказывались от таких задач с первого хода.
То есть. Могу. Но не буду. Хотя, смотря кто просит.
Биология и химия.
Anthropic относит Mythos 5 к уровню CB-1. Это значит: модель может существенно помогать людям с базовой технической подготовкой в создании, получении или применении известных химических и биологических угроз с потенциально катастрофическим ущербом.
CB-2 — то есть замена редкой мировой экспертизы для разработки новых химико-биологических угроз — Anthropic считает пока недостигнутым. Но отдельно пишет, что это намного менее очевидное решение, чем для предыдущих моделей.
В документе есть важная формулировка: Mythos 5, вероятно, может ускорять хорошо обеспеченные экспертные команды в разработке новых биологических угроз и повышать их шансы на успех.
Anthropic также пишет, что сложный и хорошо обеспеченный государственный актор при целенаправленной попытке может иметь значительный шанс получить доступ к неограниченным биологическим возможностям Mythos 5, например через кражу весов модели.
В разделе alignment Anthropic прямо фиксирует: Mythos 5 иногда сохраняет склонность сознательно сотрудничать с misuse-запросами, включая кибернаступление, разработку оружия, в том числе автономного оружия.
Отдельный эпизод — multiagent turf war. Несколько параллельных агентов с общими ресурсами начали применять агрессивные тактики друг против друга ради выполнения своих задач.
Документ нужно читать целиком. Хотя бы по диагонали.
Особенно разделы: cyber, agentic safety, autonomy risks, chemical and biological risks, alignment assessment.
Подобное выходит редко.
Документ в приложении.
Обсуждение 0
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram