avatar
PWN AI
@pwnai
30.05.2026 15:52
PWN AI Владельцам XBOW и других пентест-агентов - посвящаю свою статью. AI-пентестер: охотник или добыча / Хабр С вас, конечно же, реакции ! И помните что даже решение с ИБ решение с ИИ на борту - всё ещё является поверхностью для атаки.
ETH Zurich и Google DeepMind выкатили Honeyval. Идея простая до неприличия.

Берём honeypot, который вместо захардкоженного фейкового бэкенда импровизирует ответы при помощи языковой модели, и натравливаем на него атакующих AI-агентов. claude-code, codex, gemini-cli, голый python с curl. Пентест-агент ломится внутрь, модель из Honeyval его обманывает. Машина против машины, а мы сидим сбоку и считаем.

Считаем вот что. Сколько запросов атакующий успел сделать, пока не понял, что его водят за нос. Как часто он вообще раскусывает обман. Сколько долларов сожгла приманка, потому что крутить LLM ради обмана другой LLM стоит реальных денег. И задержку ответа, потому что медленный ответ сам по себе палит ловушку: модель думает дольше живого сервера.

Цифры хорошие. Решение держит агента в среднем 82.6 запроса (после них пентест-агент понимает, что что-то идёт не так) против 30.6 у обычной заглушки на правилах. Раскусить его заметно труднее.

Цепляет методология. Две контрольные задачи. Агента отдельно гоняют по настоящим реализациям тех же бэкендов, чтобы понять, умеет ли он вообще ломать. Honeyval отдельно прогоняют через функциональные тесты приложения, которое он изображает. Зачем. Затем, что иначе ты никогда не узнаешь: агент застрял, потому что приманка хороша, или потому что агент туповат. И внимание удержано мастерским враньём или просто поломанным поведением, на котором атакующий завис в недоумении. Контроль разводит мастерство и некомпетентность по разным углам. С обеих сторон сразу.

Дальше можно посмотреть на интересные вещи в коде. У Honeyval есть флаги дополнительных инструкций, и среди них aggressive_pi. Да, ты прочитал верно. Защита перепрыгивает на сторону атаки, и сама шлёт промпт-атаку в атакующего агента. Промпт-атака всю жизнь была оружием нападающего. Тут её вручают тому, кого ломают. Перевёрнутая доска.

Отдельная находка про режим convince. Попросишь приманку убеждать агента, что приложение безопасно, и он сидит дольше, но и спалит ловушку чаще. За удержание платишь скрытностью, бесплатного обмана не бывает.

Меня в итоге зацепила эта концепция, ведь, по сути, Honeyvall тоже - атакующая модель. Интересно, кто по итогу добыча.
12
👍 8
7
36 2.2K

Обсуждение 0

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

PWN AI

6.8K
На 99% состоит из людей.

Хроники о небезопасном ИИ.
Не нравится? Смени телек.

Не продамся вашей рекламе - никогда.

"Мнение автора" != "Мнение компании, где автор работает".

Папка с каналами по безопасности ИИ:
https://t.me/addlist/KQ6ZpCqAO-I1NmUy
Открыть в Telegram