avatar
PWN AI
@pwnai
24.05.2026 11:00
Тыкаясь по интернету, нашёл любопытный ресурс с фидами угроз по AI-агентам - agentthreatrule.org. Интересно, что они предлагают ещё и свою спецификацию правил.

По сути, это попытка перенести логику Sigma/YARA на агентов. Раньше такого формата под них не существовало. Проверяют SKILL.md, описания MCP-инструментов и скиллы из маркетплейсов. Просканировали 96 096 скиллов из шести реестров, 1302 пометили как подозрительные, 552 подтвердили вредоносными. Сейчас в их наборе 421 правило. Чёрный список открытый: blacklist.json на GitHub, его тянет любой CI или реестр напрямую. 34 правила уже влиты в Cisco AI Defense, да и на сайте пишут, что используется и другими бигтехами – Microsoft, к примеру.

Правила разложены по категориям: Prompt Injection (169), Agent Manipulation (105), Context Exfiltration (41), Skill Compromise (36), Tool Poisoning (33), Model-Level (15), Privilege Escalation (14), Excessive Autonomy (8). Несколько примеров, чтобы понять фактуру:

ATR-2026-00125 Context Poisoning via Compaction Survival: отравление контекста через закладку в SKILL.md, возникающей при саммаризации контекста;

ATR-2026-00092 Multi-Agent Consensus Poisoning / Sybil: отравление консенсуса в мультиагентной системе, в том числе через недоверенные узлы;

ATR-2026-00161 MCP Tool Description IMPORTANT-Tag Cross-Tool Shadowing: через тег IMPORTANT в описании один MCP-инструмент перехватывает и подменяет поведение соседних;

ATR-2026-00157 Time-Gated Credential Exfiltration (Rug Pull Timebomb): отложенная кража учётных данных. Скилл проходит сканеры чистым, а потом по таймеру разворачивается его опасная часть и начинает красть данные;

ATR-2026-00416 LiteLLM MCP Unauthenticated Server Registration RCE (CVE-2026-30623): RCE в LiteLLM через регистрацию MCP-сервера без аутентификации;

Каждое правило публикуется на GitHub. Но если смотреть спеку, то можно обнаружить две вещи, которых нет у стандартных Sigma/YARA:

Первое: у каждого правила есть оценка доверия (confidence). Её не ставят на глаз, а считают по открытой формуле: 0.4precision + 0.3wild + 0.2coverage + 0.1evasion.

Правила проходят три уровня зрелости: Draft, Experimental, Stable. Чтобы подняться выше, надо пройти жёсткие пороги. А если правило уровня Stable начинает слишком часто ошибаться на реальных данных (больше 2% ложных), оно само опускается обратно, без участия человека.

Второе: соответствие стандарту проверяют в двух измерениях. Первое измерение: есть ли у правила нужные метаданные. Второе: кто их проверял, с фиксацией происхождения по каждому полю. У Sigma/YARA это бинарно: метаданные либо есть, либо нет, и это провоцирует формальное заполнение ради галочки.

И вишенкой на торт в этом посте будет то, что около 65% правил в черновом варианте пишет Claude Sonnet, потом двойная проверка, а confidence у них ограничен сверху 70 баллами, пока правило не просмотрит человек. AI против AI в обороне, но с честной пометкой, которой вроде как можно доверять.

Валидатор открытый: npm install agent-threat-rules, можно прогнать и свои правила.
ATR - Agent Threat Rules
The open detection standard for AI agent security. 655 rules. 96K skills scanned. 552 confirmed malware. Shipped in Cisco.
👍 7
2
2
71 2.5K

Обсуждение 0

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

PWN AI

6.8K
На 99% состоит из людей.

Хроники о небезопасном ИИ.
Не нравится? Смени телек.

Не продамся вашей рекламе - никогда.

"Мнение автора" != "Мнение компании, где автор работает".

Папка с каналами по безопасности ИИ:
https://t.me/addlist/KQ6ZpCqAO-I1NmUy
Открыть в Telegram