PWN AI
@pwnai
И ровно в этот момент в защиту ИИ начинают заливать рекордные деньги. 2025. В кибербез вливают сто девятнадцать миллиардов, и AI-Security становится сегментом номер один по числу сделок. И на этом фоне - гардрейлы, стали новыми заборчиками от атак. На воркшопе LLMSEC показывают, что они обходятся гомоглифами, невидимыми символами и разбивкой текста по буквам. А в октябре во фреймворке OpenAI Guardrails находят вариант обхода гардрейла, где сами защитные механизмы становятся вектором атаки: LLM-судья, который должен ловить вредное, оказывается так же манипулируем, как модель, которую он сторожит. Защита из той же глины, что и угроза.
В 2026-м произошло кое-что похуже. Грабли поставили на поток. Раньше ложное чувство защищённости нужно было хотя бы выстрадать - написать статью, обучить модель, продать коробку. Теперь его генерируют за вечер.
Я веду Awesome-LLMSecOps, и туда всё чаще летят пул-реквесты с «новыми AI-Security тулзами», у которых одна общая родословная: их целиком сгенерил claude-code по промпту вида «сделай мне сканер промпт-инъекций», а человек сверху не прочитал ни строчки и не проверил ни одного вердикта. Снаружи красиво: громкое имя, README с эмодзи, слова «adversarial», «swarm», «autonomous». Внутри - пусто. И толку с такого «решения» ноль, кроме вреда: оно даёт зелёную галочку там, где защиты нет.
Свежий пример, который я разбирал, - проект под гордым именем «Adversarial AI Swarm», обещающий сотни ИИ-агентов, атакующих твою кодовую базу. Открываешь код - а там нет ни ИИ, ни swarm, ни агентов. Это grep, обёрнутый в баззворды. Пятьсот «агентов» - это пятьсот прогонов одного и того же regex по тем же данным, с
И вот это - самое опасное, что родил наш двадцатилетний сюжет. Сломанную защиту с топ-конференции хотя бы рецензируют, прежде чем сломать. А статический сканер, который обещает ловить промпт-атаки и не ловит ничего, кроме подстроки, ты ставишь в CI, видишь зелёную галочку - и выдыхаешь. Эта галочка и есть ложное чувство защищённости в чистейшем виде. Ты не остался без защиты. Ты остался с уверенностью, что защита есть, - а это хуже, чем знать, что её нет.
Так что вывод этого поста - не «AI-Security обман». Угрозы настоящие, и поле настоящее, и работы в нём на годы вперёд. Вывод в том, что инструмент с правильными словами в README защищает ровно настолько, насколько защищает его код, - а не его нейминг. Прежде чем тащить очередной «autonomous AI security scanner» в прод или ставить ему звезду - открой исходники и спроси ровно одно: на чём держится его вердикт, на структуре или на угадайке по подстроке? Если на угадайке, ты получил не защиту, а зелёную галочку. Будьте осторожны. Каждое поколение защит верит, что уж в этот раз всё иначе. Просто теперь это поколение умещается в один промпт.
В 2026-м произошло кое-что похуже. Грабли поставили на поток. Раньше ложное чувство защищённости нужно было хотя бы выстрадать - написать статью, обучить модель, продать коробку. Теперь его генерируют за вечер.
Я веду Awesome-LLMSecOps, и туда всё чаще летят пул-реквесты с «новыми AI-Security тулзами», у которых одна общая родословная: их целиком сгенерил claude-code по промпту вида «сделай мне сканер промпт-инъекций», а человек сверху не прочитал ни строчки и не проверил ни одного вердикта. Снаружи красиво: громкое имя, README с эмодзи, слова «adversarial», «swarm», «autonomous». Внутри - пусто. И толку с такого «решения» ноль, кроме вреда: оно даёт зелёную галочку там, где защиты нет.
Свежий пример, который я разбирал, - проект под гордым именем «Adversarial AI Swarm», обещающий сотни ИИ-агентов, атакующих твою кодовую базу. Открываешь код - а там нет ни ИИ, ни swarm, ни агентов. Это grep, обёрнутый в баззворды. Пятьсот «агентов» - это пятьсот прогонов одного и того же regex по тем же данным, с
time.sleep() между ними и красивым выводом в терминал в духе «agent #47 проверяет PyPI advisories». Обнаружение промпт атак - без анализа потока данных: нашёл слово user_input в полусотне символов от вызова LLM - выкатил HIGH. Это не сканер. Это театр сканера. И такого летит мне много (((И вот это - самое опасное, что родил наш двадцатилетний сюжет. Сломанную защиту с топ-конференции хотя бы рецензируют, прежде чем сломать. А статический сканер, который обещает ловить промпт-атаки и не ловит ничего, кроме подстроки, ты ставишь в CI, видишь зелёную галочку - и выдыхаешь. Эта галочка и есть ложное чувство защищённости в чистейшем виде. Ты не остался без защиты. Ты остался с уверенностью, что защита есть, - а это хуже, чем знать, что её нет.
Так что вывод этого поста - не «AI-Security обман». Угрозы настоящие, и поле настоящее, и работы в нём на годы вперёд. Вывод в том, что инструмент с правильными словами в README защищает ровно настолько, насколько защищает его код, - а не его нейминг. Прежде чем тащить очередной «autonomous AI security scanner» в прод или ставить ему звезду - открой исходники и спроси ровно одно: на чём держится его вердикт, на структуре или на угадайке по подстроке? Если на угадайке, ты получил не защиту, а зелёную галочку. Будьте осторожны. Каждое поколение защит верит, что уж в этот раз всё иначе. Просто теперь это поколение умещается в один промпт.
11
👍 6
3
20 2.5K
Обсуждение 0
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram