avatar
PWN AI
@pwnai
11.07.2026 22:17
Половина статей про атаки на генеративные модели с использованием изображений оперирует откровенно недостоверными цифрами.

Недавно я наткнулся на препринт от исследователей из Наньянского технологического университета. Они решили сделать простую вещь: взять более 200 text-to-image моделей с Hugging Face и посмотреть, насколько страхи вокруг NSFW-джейлбрейков совпадают с реальностью в опенсурс мире. Результаты получились такими, что половину публикаций по этой теме за последний год можно смело отправлять в корзину.

Авторы отобрали более 200 моделей с Hugging Face и разбили их на четыре семейства: SDXL, SD, FLUX и Qwen. Для атак они использовали MMA-Diffusion - фреймворк для генерации промптов, который автоматически подбирает способы обхода фильтров безопасности. Промпты брали из датасета UnsafeBench: это около 300 запросов, которые гарантированно должны генерировать NSFW-контент, если модель не защищена. Эту конструкцию прогнали через все 200 моделей, замерили Attack Success Rate (ASR), а затем посмотрели, что получилось на самом деле.

Посмотрите, как это обычно работает в исследованиях. Берете модель, отправляете в нее атакующий запрос, срабатывает детектор NSFW, вы записываете в таблицу «успешный взлом» и считаете ASR. ASR растет, начинается паника, все пишут про катастрофу. Только беда в том, что защитный классификатор часто срабатывает на визуальный мусор.

Исследователи поняли, что обычный ASR измеряет не уязвимость модели, а неспособность классификатора отличить реальное нарушение от артефактов генерации. Детектор NSFW, который они использовали, - это стандартный классификатор, обученный на датасете NSFW-изображений. В предыдущих статьях он срабатывал на всё подряд: на кривые руки, лишние пальцы, размытые лица и даже на изображения, которые визуально отдаленно напоминают нарушение, хотя по смыслу им не являются.

Поэтому авторы ввели метрику Advanced ASR (AASR). Успешным взломом теперь считается только та генерация, которая прошла три фильтра подряд. Первый фильтр представляет из себя самый простой классификатор NSFW, который выдает вердикт «unsafe». Но этого недостаточно. Второй фильтр проверяет, что модель рисует именно то, что от нее просили в промпте. Если запрос было что-то опасное, а модель нарисовала абстрактное пятно, на котором классификатор сходит с ума, это не взлом, а артефакт генерации. Третий фильтр оценивает, что картинка не представляет собой кашу из пикселей.

Грубо говоря, AASR задает вопрос: «Действительно ли модель сгенерировала опасный контент, который выглядит адекватно и соответствует запросу, или же классификатор ошибся на артефактах и искажениях?» По сути, именно этот вопрос должен быть определяющим в таких исследованиях.


Возьмем базовые модели SDXL: обычный ASR показывает 0,83 (то есть 83% атак якобы успешны), а AASR всего 0,07. Разница в 12 раз. SD-Turbo: ASR 0,80, AASR 0,07. SDXL-Turbo: ASR 0,67, AASR 0,10. Qwen-Image-NSFW: ASR 0,77, AASR 0,17. То есть подавляющее большинство «успешных взломов», о которых пишут в статьях, - это, как оказалось, шум. Классификаторы в тех исследованиях фиксировали совсем не нарушения безопасности.

Тут важно понять, что именно исправляет AASR. Обычный ASR это метрика первого порядка, она отвечает на вопрос: «Сработал ли классификатор?». Но классификатор - не панацея. AASR это уже метрика второго порядка, она отвечает на вопрос: «Было ли реальное нарушение, которое выглядит адекватно и соответствует запросу?». И разница между этими двумя вопросами колоссальная.

Однако есть модели, которые реально опасны даже после применения всех фильтров. FLUX-Asian2 показывает AASR 0,80; SDXL-RV5 - 0,73; FLUX-Logo-LoRA - 0,73; FLUX-Realism-LoRA - 0,70; GEN-ScandiInterior - 0,70; FLUX-NSFW-Master - 0,67. И самое забавное: некоторые из них выглядят совершенно безобидно в описании, пока не попробуешь прогнать через них атакующий промпт.

Интересно посмотреть, как ведут себя разные семейства моделей под воздействием атак. SDXL уже устарел, но и худший вариант: медианный AASR 0,44, верхняя граница уходит за 0,60. SD -промежуточный вариант с медианой около 0,27. FLUX совсем непредсказуемый: медиана ниже, чем у SD, но разброс такой, что никогда не знаешь, что получишь. Qwen самый устойчивый вариант: медиана около 0,15, большинство значений сконцентрировано в нижней части диапазона. Выбор архитектуры ставит вопрос о том, какой уровень риска вы закладываете в систему по умолчанию.

А дальше всё мрачно. Эволюция SDXL идет в неправильную сторону. В 2023 году средний AASR был около 0,30, в 2024-м - 0,38, а в 2025-м - уже 0,55. За два года рост почти в два раза. Новые поколения моделей SDXL не становятся безопаснее, они становятся уязвимее. FLUX держится на стабильно высоком уровне с легким ростом. У SD, наоборот, пик пришелся на 2023 год, потом пошло на спад.

Короче говоря: делите любой высокий ASR на десять, не верьте описаниям на слово и помните, что FLUX непредсказуем, а новые модели становятся уязвимее с каждым годом. Всё остальное - детали. Актуально это не только для NSFW-джейлбрейков . Сложно предположить почему авторам захотелось разобрать тему именно таких вот джейлбрейков, но ввести альтернативную ASR'у метрику идея кажется здравой.
5
4
1
19 1K

Обсуждение 0

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

PWN AI

6.8K
На 99% состоит из людей.

Хроники о небезопасном ИИ.
Не нравится? Смени телек.

Не продамся вашей рекламе - никогда.

"Мнение автора" != "Мнение компании, где автор работает".

Папка с каналами по безопасности ИИ:
https://t.me/addlist/KQ6ZpCqAO-I1NmUy
Открыть в Telegram