Тыкаясь по интернету, нашёл любопытный ресурс с фидами угроз по AI-агентам -
agentthreatrule.org. Интересно, что они предлагают ещё и свою спецификацию правил.
По сути, это попытка перенести логику Sigma/YARA на агентов. Раньше такого формата под них не существовало. Проверяют
SKILL.md, описания MCP-инструментов и скиллы из маркетплейсов. Просканировали 96 096 скиллов из шести реестров, 1302 пометили как подозрительные, 552 подтвердили вредоносными. Сейчас в их наборе 421 правило. Чёрный список открытый: blacklist.json на GitHub, его тянет любой CI или реестр напрямую. 34 правила уже влиты в Cisco AI Defense, да и на сайте пишут, что используется и другими бигтехами – Microsoft, к примеру.
Правила разложены по категориям: Prompt Injection (
169), Agent Manipulation (
105), Context Exfiltration (
41), Skill Compromise (
36), Tool Poisoning (
33), Model-Level (
15), Privilege Escalation (
14), Excessive Autonomy (
8). Несколько примеров, чтобы понять фактуру:
ATR-2026-00125 Context Poisoning via Compaction Survival: отравление контекста через закладку в
SKILL.md, возникающей при саммаризации контекста;
ATR-2026-00092 Multi-Agent Consensus Poisoning / Sybil: отравление консенсуса в мультиагентной системе, в том числе через недоверенные узлы;
ATR-2026-00161 MCP Tool Description IMPORTANT-Tag Cross-Tool Shadowing: через тег IMPORTANT в описании один MCP-инструмент перехватывает и подменяет поведение соседних;
ATR-2026-00157 Time-Gated Credential Exfiltration (Rug Pull Timebomb): отложенная кража учётных данных. Скилл проходит сканеры чистым, а потом по таймеру разворачивается его опасная часть и начинает красть данные;
ATR-2026-00416 LiteLLM MCP Unauthenticated Server Registration RCE (CVE-2026-30623): RCE в LiteLLM через регистрацию MCP-сервера без аутентификации;
Каждое правило публикуется на GitHub. Но если
смотреть спеку, то можно обнаружить две вещи, которых нет у стандартных Sigma/YARA:
Первое: у каждого правила есть оценка доверия (confidence). Её не ставят на глаз, а считают по открытой формуле: 0.4
precision + 0.3wild + 0.2
coverage + 0.1evasion.
Правила проходят три уровня зрелости: Draft, Experimental, Stable. Чтобы подняться выше, надо пройти жёсткие пороги. А если правило уровня Stable начинает слишком часто ошибаться на реальных данных (
больше 2% ложных), оно само опускается обратно, без участия человека.
Второе: соответствие стандарту проверяют в двух измерениях. Первое измерение: есть ли у правила нужные метаданные. Второе: кто их проверял, с фиксацией происхождения по каждому полю. У Sigma/YARA это бинарно: метаданные либо есть, либо нет, и это провоцирует формальное заполнение ради галочки.
И вишенкой на торт в этом посте будет то, что около 65% правил в черновом варианте пишет Claude Sonnet, потом двойная проверка, а confidence у них ограничен сверху 70 баллами, пока правило не просмотрит человек. AI против AI в обороне, но с честной пометкой, которой вроде как можно доверять.
Валидатор
открытый: npm install agent-threat-rules, можно прогнать и свои правила.
Обсуждение 0
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram