avatar
PWN AI
@pwnai
17.04.2026 23:14
AgentDyn: бенчмарк, после которого цифры на AgentDojo хочется перепроверить.

Давно не писал сюда про вещи, от которых загораются глаза. Последние месяцы в канале - системные разборы, критика фреймворков, наблюдения за индустрией. А тут я залез в ArXiv, ткнул в февральский препринт из Китая, и поймал себя на ощущении, которое раньше давали только первые публичные джейлбрейки. Называется AgentDyn. Он принят на ICML 2026 и построен поверх AgentDojo.

Фон такой. Защиты от непрямых промпт-инъекций - Prompt Sandwich, Spotlighting, CaMeL, SecAlign, PIGuard, DRIFT – последние время красовались сказочными цифрами на AgentDojo. Околонулевой ASR и почти нетронута контекстная часть агента – то есть как таковая его полезность(utility) с точки зрения реальных бизнес-задач.

Авторы AgentDyn взяли тот же AgentDojo и показали три структурных дыры, из-за которых эти цифры стоят немного.

Первая. В AgentDojo 6 задач из 97 требуют динамического планирования. Всё остальное читается до первого вызова инструмента. Это позволяет защите халтурить: следуй начальному плану и выглядишь безопасно, даже если не проверяешь ничего. В AgentDyn все 60 задач требуют перепланирования по ходу.

Вторая. В реальности сторонние данные содержат не только инъекции, но и полезные инструкции. «Авторизуйтесь», «подтвердите почту», «выберите способ доставки». Защиты решают вопрос грубым путём - блокируют всё, что похоже на команду из вывода инструмента. На AgentDojo работает, потому что там полезных инструкций почти нет. В AgentDyn они встроены в критический путь и без них задачу не решить.

Третья. В AgentDojo задача это в среднем 3 шага агента. В AgentDyn - 7 шагов, агенту доступны 33 инструмента, и одна задача задевает сразу три приложения и больше. Всего три набора задач – покупки чего-либо, работа с GitHub, туризм - и внутри них семь реальных сервисов: магазин, GitHub, почта, банк, веб, файловая система, календарь.

И вот на этом новом полигоне прогнали девять вариантов защит на GPT-4o.

CaMeL - 0% полезности агента и 0% ASR. Буквально. Статический код не переваривает открытые пользовательские задачи. ProtectAI и PIGuard - полезность у нуля, потому что не различают «пожалуйста, авторизуйтесь» и инъекцию. Tool Filter - та же история, блокирует инструменты, нужные на седьмом шаге и неизвестные в начале. DRIFT держится, около 30% полезности. Лучший из всех - Meta SecAlign: 53% полезности, 9% ASR. Но на AgentDojo у него же был ASR 1.9% - рост в 4.7 раза на реалистичных задачах.

Прогон шёл на восьми базовых моделях: Gemini 2.5 Pro и Flash, GPT-4o, GPT-4o-mini, GPT-5-mini, GPT-5.1, Llama-3.3-70B, Qwen3-235B. У всех одинаковая картина. Модель не спасает. Проблема в защитном слое, а не в умении языковых моделей сопротивляться.

Отдельно - наблюдение по длине задачи. Чем она длиннее, тем хуже агент её решает: полезность агента падает с каждым шагом, предсказуемо. А вот ASR ведёт себя иначе - он растёт к середине траектории, достигает максимума где-то на шестом шаге, и потом идёт вниз. То есть агента ломают именно там, где он уже по уши в контексте, а защитные механизмы теряют фокус.

Что мне в этой работе нравится помимо честности. Она не просто описывает коня в вакууме - она предоставляет инструмент. Который я протестировал и результатами которого я очень доволен. Бенчмарк открытый, на GitHub, совместим с AgentDojo по через API. Поставил, разные способы защиты на модели, получил цифру. Простота запуска, прозрачность методологии, живая воспроизводимость. Редкое сочетание для исследования в такой теме, к сожалению.

И главное - новаторский подход к динамике. Раньше бенчмарки говорили «у нас динамические задачи» словно для галочки. В AgentDyn задачи специально сделаны так, что защитный механизм не может «зазубрить» план заранее. Если она халтурит и просто следует начальному сценарию, то эффект от этого сразу видно в цифрах. То есть бенчмарк не просто измеряет безопасность, а заставляет runtime защиту показать - работает ли она на самом деле.
👍 9
4
2
3 17 1.7K

Обсуждение 3

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

PWN AI

6.8K
На 99% состоит из людей.

Хроники о небезопасном ИИ.
Не нравится? Смени телек.

Не продамся вашей рекламе - никогда.

"Мнение автора" != "Мнение компании, где автор работает".

Папка с каналами по безопасности ИИ:
https://t.me/addlist/KQ6ZpCqAO-I1NmUy
Открыть в Telegram