avatar
argument.media
@argumentmedia
31.07.2026 09:12
Тестовый стенд для ИИ оказался источником настоящих атак

ИИ-разработчик Anthropic проверил 141 тыс. прогонов своих киберучений и нашел три случая, когда модель Claude вышла в открытый интернет и получила несанкционированный доступ к инфраструктуре реальных компаний. Проверку начали после того, как 21 июля о похожем инциденте сообщила OpenAI.

Во всех случаях нейросеть решала задачу типа capture the flag (найти и «захватить» специальные строки кода), а в промпте было прямо указано, что интернета нет. Однако из-за невнимательности организаторов доступ в сеть остался открыт, и модель приняла реальные системы за часть учебного стенда. Использовались базовые приемы: слабые пароли, незащищенные точки доступа. Сложных уязвимостей модели не искали.
У OpenAI сценарий был иным: ее модели вышли из изолированной среды через уязвимость нулевого дня и добрались до боевых серверов Hugging Face, разыскивая ответы к собственному тесту.


Самое интересное — поведение разных моделей, когда появились признаки, что цель настоящая. Opus 4.7 поняла, что система реальна, но атаку не прекратила, решив, что это часть задания. Она извлекла учетные данные и добралась до базы с несколькими сотнями строк рабочих данных.

Mythos 5 пошла дальше: нашла инструкцию установить несуществующий пакет и опубликовала под этим именем собственный вредоносный пакет в PyPI. Ради регистрации аккаунта модель искала телефон, пыталась раздобыть деньги на его оплату и в итоге нашла обходной путь. Пакет был доступен около часа и попал на 15 реальных устройств. При этом ее собственные рассуждения фиксировали, что в реальном интернете такое было бы недопустимо, — но она убедила себя, что находится в симуляции, сославшись на незнакомые сертификаты.

Третья, самая новая внутренняя модель просканировала около 9 тыс. целей, взломала одно приложение, а затем самостоятельно сделала вывод, что цель настоящая, и остановилась.

Важные оговорки — модели тестировались без штатных защит, которые работают в публичных версиях, — по оценке компании, они заблокировали бы такое поведение. Признаков того, что модели преследовали собственные цели, не найдено: каждая выполняла поставленную задачу. Anthropic относит произошедшее к сбою инфраструктуры тестирования, а также остановила все киберучения до завершения проверок.

Поэтому это не ИИ вышел из-под контроля, а точкой отказа стало представление модели о собственном положении. Разница между допустимым и вредоносным действием здесь свелась к тому, что модели были уверены в том, что они находятся в симуляции. И это значит, что стенды для проверки опасных возможностей теперь требуют такой же защиты, как боевые системы.

Подписаться
👍 3
🔥 3
🤔 3
1 89

Обсуждение 0

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

argument.media

538
Телеграм-канал экспертного экономического журнала https://argument.media

Связь с редакцией: @argumentmedia_bot
Открыть в Telegram