PWN AI
@pwnai
Ложное чувство защищённости – предвестник AI-тревожности.
Как-то меня затревожило, неужели AI-Security, пространство где не существовало скама? Да и вообще интересно было как он выглядит? Я под этим понимаю обман со стороны вендоров или же тех, кто обещает защиту. В кайф, конечно, смотреть на то, как скамили раньше, пока не заскамят меня …
Это уже происходит давно, но это грабли, на которые AI-Security наступает несколько лет подряд, аккуратно перекрашивая их в каждом новом поколении технологий. И вы можете осуждать меня страшно в комментариях, но давай размотаем хронологию одного очень затянувшегося самообмана.
2006. Барено в статье задаёт вопрос прямо в заголовке статьи: а может ли машинное обучение вообще быть безопасным? Звучало слишком академически и дофига абстрактно - моделей в проде почти не было, ломать было нечего. Вопрос отложили в долгий ящик.
Пролежал он там одиннадцать лет, пока кто-то не вернулся к нему с инструментами в руках. 2017. Никлас Карлини с Вагнером выкатывают атаку, которая разносит defensive distillation - модный тогда метод «повышения устойчивости» модели. Первый звоночек: то, что выглядит как защита, вполне может оказаться просто непротестированной защитой.
Звоночек проигнорировали - и через год он превратился в набат. 2018. Команда из Беркли берёт девять защит от adversarial-атак с конференции ICLR и ломает семь. А следом выходит статья с названием: «Obfuscated Gradients Give a False Sense of Security». Запутанные градиенты дают ложное чувство защищённости. Вся суть - в одной фразе: защиты не делали модель устойчивее, они просто ломали инструмент атакующего. Картонный доспех, который держится ровно до первого, кто целится точнее. Пока что это оставалось спором на слайдах. А потом состязательные атаки пошли в прод.
Июль 2019. Cylance – один из интересных эпизодов, без которого пост не пост. В проде крутилась ML-модель которая должна была обнаруживать малварь, и её надо было обмануть. Ребята из Skylight реверснули её и обнаружили, что та болезненно зависит от анализа строк и почему-то обожает одну конкретную игру. Игрой оказался Rocket League. Дальше они вытащили строки из экзешника игры, ужали «секретный соус» до жалких шестидесяти килобайт и стали дописывать их в малварь. Модель послушно перекидывала вердикт из «однозначно вредонос» в «безопасно». Сто процентов уклонения на топ-10 малвари мая 2019-го - WannaCry, SamSam, Mimikatz, далее по списку. Боевую модель обманывали строками из аркады про машинки.
Реакция вендора. Не «спасибо, чиним архитектуру», а «это не универсальный обход, а манипуляция конкретным признаком в ограниченных обстоятельствах». Я выучил корпоративный, вот вам перевод: ничего не сломалось, вам показалось.
Можно было бы списать всё на невезение одной модели. 2020. Карлини возвращается к нам и объясняет, почему нет: защиты не становятся лучше, их по-прежнему просто плохо оценивают. Те же ошибки, что и в 2018-м, только теперь авторы статей заранее пишут целые абзацы о том, почему у них-то всё иначе. Не иначе.
Можно было бы списать и это - на болезни роста узкой ниши adversarial ML. Но в 2023-м грабли обзавелись новой, куда более длинной рукояткой. Май 2023. Открывается LLM-эра, и OWASP ставит промпт-атаки на первое место в топе рисков для языковых моделей. Мы знаем это. Но причина обидная: атака не требует ни PhD, ни эксплойта, ни особого ума. Текст. Просто текст в нужном месте. На вход модели поступает весь мир.
Казалось бы, после такого индустрия наконец начнёт тестировать защиты всерьёз. В 2024 IEEE S&P, одна из топовых академических-конференций, снова принимает сломанную защиту от состязательных атак. Математически невозможные утверждения, а правка одной строки в их же коде обнуляет точность модели до нуля. Шесть лет спустя после «Obfuscated Gradients» - те же грабли, тот же рецензент, тот же финал.
Как-то меня затревожило, неужели AI-Security, пространство где не существовало скама? Да и вообще интересно было как он выглядит? Я под этим понимаю обман со стороны вендоров или же тех, кто обещает защиту. В кайф, конечно, смотреть на то, как скамили раньше, пока не заскамят меня …
Это уже происходит давно, но это грабли, на которые AI-Security наступает несколько лет подряд, аккуратно перекрашивая их в каждом новом поколении технологий. И вы можете осуждать меня страшно в комментариях, но давай размотаем хронологию одного очень затянувшегося самообмана.
2006. Барено в статье задаёт вопрос прямо в заголовке статьи: а может ли машинное обучение вообще быть безопасным? Звучало слишком академически и дофига абстрактно - моделей в проде почти не было, ломать было нечего. Вопрос отложили в долгий ящик.
Пролежал он там одиннадцать лет, пока кто-то не вернулся к нему с инструментами в руках. 2017. Никлас Карлини с Вагнером выкатывают атаку, которая разносит defensive distillation - модный тогда метод «повышения устойчивости» модели. Первый звоночек: то, что выглядит как защита, вполне может оказаться просто непротестированной защитой.
Звоночек проигнорировали - и через год он превратился в набат. 2018. Команда из Беркли берёт девять защит от adversarial-атак с конференции ICLR и ломает семь. А следом выходит статья с названием: «Obfuscated Gradients Give a False Sense of Security». Запутанные градиенты дают ложное чувство защищённости. Вся суть - в одной фразе: защиты не делали модель устойчивее, они просто ломали инструмент атакующего. Картонный доспех, который держится ровно до первого, кто целится точнее. Пока что это оставалось спором на слайдах. А потом состязательные атаки пошли в прод.
Июль 2019. Cylance – один из интересных эпизодов, без которого пост не пост. В проде крутилась ML-модель которая должна была обнаруживать малварь, и её надо было обмануть. Ребята из Skylight реверснули её и обнаружили, что та болезненно зависит от анализа строк и почему-то обожает одну конкретную игру. Игрой оказался Rocket League. Дальше они вытащили строки из экзешника игры, ужали «секретный соус» до жалких шестидесяти килобайт и стали дописывать их в малварь. Модель послушно перекидывала вердикт из «однозначно вредонос» в «безопасно». Сто процентов уклонения на топ-10 малвари мая 2019-го - WannaCry, SamSam, Mimikatz, далее по списку. Боевую модель обманывали строками из аркады про машинки.
Реакция вендора. Не «спасибо, чиним архитектуру», а «это не универсальный обход, а манипуляция конкретным признаком в ограниченных обстоятельствах». Я выучил корпоративный, вот вам перевод: ничего не сломалось, вам показалось.
Можно было бы списать всё на невезение одной модели. 2020. Карлини возвращается к нам и объясняет, почему нет: защиты не становятся лучше, их по-прежнему просто плохо оценивают. Те же ошибки, что и в 2018-м, только теперь авторы статей заранее пишут целые абзацы о том, почему у них-то всё иначе. Не иначе.
Можно было бы списать и это - на болезни роста узкой ниши adversarial ML. Но в 2023-м грабли обзавелись новой, куда более длинной рукояткой. Май 2023. Открывается LLM-эра, и OWASP ставит промпт-атаки на первое место в топе рисков для языковых моделей. Мы знаем это. Но причина обидная: атака не требует ни PhD, ни эксплойта, ни особого ума. Текст. Просто текст в нужном месте. На вход модели поступает весь мир.
Казалось бы, после такого индустрия наконец начнёт тестировать защиты всерьёз. В 2024 IEEE S&P, одна из топовых академических-конференций, снова принимает сломанную защиту от состязательных атак. Математически невозможные утверждения, а правка одной строки в их же коде обнуляет точность модели до нуля. Шесть лет спустя после «Obfuscated Gradients» - те же грабли, тот же рецензент, тот же финал.
3
👍 2
2
15 1.9K
Обсуждение 0
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram