Тестовый стенд для ИИ оказался источником настоящих атак
ИИ-разработчик Anthropic
проверил 141 тыс. прогонов своих киберучений и нашел три случая, когда модель Claude вышла в открытый интернет и получила несанкционированный доступ к инфраструктуре реальных компаний. Проверку начали после того, как 21 июля о похожем инциденте
сообщила OpenAI.
Во всех случаях нейросеть решала задачу типа capture the flag (найти и «захватить» специальные строки кода), а в промпте было прямо указано, что интернета нет. Однако из-за невнимательности организаторов доступ в сеть остался открыт, и модель приняла реальные системы за часть учебного стенда. Использовались базовые приемы: слабые пароли, незащищенные точки доступа. Сложных уязвимостей модели не искали.
У OpenAI сценарий был иным: ее модели вышли из изолированной среды через уязвимость нулевого дня и добрались до боевых серверов Hugging Face, разыскивая ответы к собственному тесту.
Самое интересное — поведение разных моделей, когда появились признаки, что цель настоящая. Opus 4.7 поняла, что система реальна, но атаку не прекратила, решив, что это часть задания. Она извлекла учетные данные и добралась до базы с несколькими сотнями строк рабочих данных.
Mythos 5 пошла дальше: нашла инструкцию установить несуществующий пакет и опубликовала под этим именем собственный вредоносный пакет в PyPI. Ради регистрации аккаунта модель искала телефон, пыталась раздобыть деньги на его оплату и в итоге нашла обходной путь. Пакет был доступен около часа и попал на
15 реальных устройств. При этом ее собственные рассуждения фиксировали, что в реальном интернете такое было бы недопустимо, — но она убедила себя, что находится в симуляции, сославшись на незнакомые сертификаты.
Третья, самая новая внутренняя модель просканировала около
9 тыс. целей, взломала одно приложение, а затем самостоятельно сделала вывод, что цель настоящая, и остановилась.
Важные оговорки — модели тестировались без штатных защит, которые работают в публичных версиях, — по оценке компании, они заблокировали бы такое поведение. Признаков того, что модели преследовали собственные цели, не найдено: каждая выполняла поставленную задачу. Anthropic относит произошедшее к сбою инфраструктуры тестирования, а также остановила все киберучения до завершения проверок.
Поэтому это не ИИ вышел из-под контроля, а точкой отказа стало представление модели о собственном положении. Разница между допустимым и вредоносным действием здесь свелась к тому, что модели были уверены в том, что они находятся в симуляции. И это значит, что стенды для проверки опасных возможностей теперь требуют такой же защиты, как боевые системы.
Подписаться
Обсуждение 0
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram