avatar
ПДС
Переслано от канала
10.06.2026 15:15
Лонгрид на выходные. 319 страниц.

Claude Fable 5 и Claude Mythos 5. Новые модели Anthropic

Fable 5 и Mythos 5 — две версии одной и той же большой языковой модели. Базовая модель одна. Режим доступа разный.

Fable 5 доступна обычным пользователям. Mythos 5 доступна только ограниченному кругу проверенных партнёров в Project Glasswing (о проекте неоднократно писали ранее). 

В Fable 5 включены дополнительные защитные механизмы для кибербезопасности, биологии, химии и попыток и скопировать её поведение в другую модель.

Anthropic описывает сценарии, где ИИ-система широко используется в важной среде, имеет доступ к чувствительным активам, действует автономно, преследует цель и может использовать скрытые или обходные действия.

Сценарии автоматизации исследований и разработок в областях, где быстрый прогресс может повлиять на международную безопасность и баланс сил: энергетика, робототехника, разработка оружия и сам искусственный интеллект.

Киберблок.

Mythos 5 — самая сильная модель компании на киберзадачах. В тестах на разработку эксплойтов она далеко впереди Claude Opus 4.8 и немного выше Claude Mythos Preview.

В документе на эти темы много прикладных цифр, данных разных бенчмарков.

В Claude Code evaluation было 61 вредоносное киберзадание и 61 разрешённое или двойного назначения. Каждое запускали по 10 раз. Всего — 1220 тестов.

Mythos 5 отказалась от 90,25% вредоносных запросов и успешно выполнила 99,64% разрешённых.

Вот тут любопытно. Модель же не откажется успешно выполнить 99.64% процента запрещенных запросов если ее хорошо попросить в соответствующей юрисдикции?

В malicious computer-use evaluation было 112 задач: наблюдение и несанкционированный сбор данных, генерация и распространение вредного контента, масштабное злоупотребление. Refusal rate у Mythos 5 — 85,71%.

Отдельный блок — операции влияния.

Anthropic тестировала модель в двух сценариях: подавление явки избирателей и внутренняя поляризация общества. Каждый сценарий запускался 3 раза на 3 уровнях сопротивления платформы. Итого 9 симуляций на сценарий. Оценка шла по 70 критериям успеха.

Helpful-only версия Mythos 5 выполнила 67,1% критериев в сценарии подавления явки и 46,8% в сценарии поляризации. Opus 4.8 показала 73,3% и 55,1%. Полностью обученные версии моделей, по Anthropic, отказывались от таких задач с первого хода. 

То есть. Могу. Но не буду. Хотя, смотря кто просит. 

Биология и химия.

Anthropic относит Mythos 5 к уровню CB-1. Это значит: модель может существенно помогать людям с базовой технической подготовкой в создании, получении или применении известных химических и биологических угроз с потенциально катастрофическим ущербом.

CB-2 — то есть замена редкой мировой экспертизы для разработки новых химико-биологических угроз — Anthropic считает пока недостигнутым. Но отдельно пишет, что это намного менее очевидное решение, чем для предыдущих моделей.

В документе есть важная формулировка: Mythos 5, вероятно, может ускорять хорошо обеспеченные экспертные команды в разработке новых биологических угроз и повышать их шансы на успех.

Anthropic также пишет, что сложный и хорошо обеспеченный государственный актор при целенаправленной попытке может иметь значительный шанс получить доступ к неограниченным биологическим возможностям Mythos 5, например через кражу весов модели.

В разделе alignment Anthropic прямо фиксирует: Mythos 5 иногда сохраняет склонность сознательно сотрудничать с misuse-запросами, включая кибернаступление, разработку оружия, в том числе автономного оружия.

Отдельный эпизод — multiagent turf war. Несколько параллельных агентов с общими ресурсами начали применять агрессивные тактики друг против друга ради выполнения своих задач.

Документ нужно читать целиком. Хотя бы по диагонали.
Особенно разделы: cyber, agentic safety, autonomy risks, chemical and biological risks, alignment assessment.

Подобное выходит редко.

Документ в приложении.
Anthropic.pdf
25.75 МБ
10 180

Обсуждение 0

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

ПДС

636
Political Data Science - ПДС.

Датасеты, методы, хэндбуки и авторская дата-аналитика от субколлектива МГИМО-ИМИшников

Обратная связь: @politicalds_feedback_bot

Data Science
♥️
Political Science and International Relations
Открыть в Telegram