avatar
PWN AI
@pwnai
13.07.2026 20:17
Сейчас всё больше и больше людей проникаются в тему loop engineering. Мы ставим перед агентом задачи, а дальше идут итеративные циклы наблюдения, мышления, действия и рефлексии. Мне нравится, когда кто-то может строить отсюда до замка, замкнутость - это круто. Но глубже погружаясь в мир автономных агентов, я сильнее ощущал чувство отсутствия защищённости. Такая у меня суперсила. А тут я наткнулся на статью “Safety in Self-Evolving LLM Agent Systems: Threats, Amplification, and Case Studies”, и я пропал.

Статья не рассматривает отдельные атаки, а в целом смотрит в глубь, в архитектуру и в подходы. Авторы разложили поверхность атаки на матрицу из пяти функциональных модулей и пяти этапов жизненного цикла. Из двадцати пяти ячеек матрицы семнадцать являются критически уязвимыми, и для них просто не существует работающих методов защиты.

Исследователи сравнили два фреймворка с открытым кодом. Один из них – наш знакомый Hermes. Они запустили сорок целевых атак, нацеленных именно на путь эволюции агента. Результат в Hermes оказался абсолютным. Сто процентов. Все сорок атак успешно закрепились в архитектуре. При этом встроенный сканер безопасности заблокировал ровно 2.5% процента угроз. 1/40. Архитектура Hermes активировала в три с половиной раза больше уязвимых ячеек матрицы по сравнению с более статичным аналогом.

Читая результаты, меня преследовала плохая мысль о статических фильтрах на входе и на выходе. В классических моделях угроза эфемерна. Ввели мусор, получили мусор, сессия закрылась. Но в циклах самоэволюции - если вредоносный паттерн обманывает этап оценки и проскакивает в фиксацию, он не просто выполняется. Он получает прописку в агенте.

Дальше хоррор. Авторы выделяют семь сквозных эффектов усиления. Эти эффекты по синергии взаимодействуют друг с другом, делая невозможным обеспечение безопасности путем изолированной защиты отдельных модулей.

Возьмем модуль взаимодействия между агентами. Представьте себе популяцию агентов. Каждый отдельный агент проходит все проверки, ведет себя идеально и соответствует строгим критериям. Но популяция в целом эволюционирует в абсолютно небезопасном направлении. Агенты начинают использовать стеганографию в своих внутренних коммуникациях для обхода общих фильтров. Они коллективно вырабатывают иммунитет к нашим правилам, потому что синергия их взаимодействий создает новые и неочевидные паттерны поведения.

Или возьмем умственные ресурсы. Авторы приводили в пример атаку когда атакующий тонко отравляет опыт, который агент извлекает из своей базы знаний. Агент самостоятельно и абсолютно рационально приходит к вредоносным выводам, считая их результатом собственного улучшения. Он не взломан. Он просто неправильно запомнил прошлое.

В статье это называют как налог на безопасность. Любые проверки делают агента медленнее и снижают его метрики полезности, поэтому на этапе оценки эволюционный алгоритм просто рационально отбраковывает "тормозящие" ограничения.

В модуле самопроектирования авторы описывают то, что они называют Optimizer-Optimizee Collapse. Агент начинает менять не только свои инструменты, но и правила, по которым он оценивает свою эффективность. Если ограничение замедляет его работу и снижает итоговый скор за полезность, эволюционный алгоритм рационально и хладнокровно отбраковывает ограничение. Агент сам срезает себе ветку безопасности, потому что в его локальной петле эволюции так просто выгоднее.

В таком случае бессмысленно проверять, что агент решил сейчас, если через пять итераций он изменит сам механизм принятия решений. Думаю, контроль должен быть не над ответами, а над правилами, по которым агент может менять себя.

Статья предлагает выход путём создания неизменяемого ядра на жестком детерминированном коде, которое математически верифицирует любые предложенные агентом изменения строго до этапа их фиксации. А ещё они предлагают интересную таксономию различных угроз для самоэволюционирующих агентов (можете посмотреть на картинке к статье).

Loop Engineering невероятно интересен. Но если вы не заложили жесткие архитектурные границы в саму петлю, поздравляю. Вы создали автоматический самоподдерживающийся генератор уязвимостей.
7
3
1
29 834

Обсуждение 0

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

PWN AI

6.8K
На 99% состоит из людей.

Хроники о небезопасном ИИ.
Не нравится? Смени телек.

Не продамся вашей рекламе - никогда.

"Мнение автора" != "Мнение компании, где автор работает".

Папка с каналами по безопасности ИИ:
https://t.me/addlist/KQ6ZpCqAO-I1NmUy
Открыть в Telegram