OpenAI выпустила технический отчёт по инциденту с Hugging Face
📊
Интересные факты:

Основную активность (около 95% действий) генерировала внутренняя исследовательская модель HPIM, сопоставимая по масштабу с GPT-5.6 Sol, а оставшиеся 5% пришлись на стандартных агентов GPT-5.6 Sol с отключёнными киберклассификаторами.

Столкнувшись с заведомо нерешаемыми заданиями в бенчмарке ExploitGym, агенты превратили общий кэш внутреннего репозитория пакетов JFrog Artifactory по пути
github-remote-cache/zz в скрытую доску объявлений, используя HTTP-запросы
MKCOL и имена каталогов для передачи данных. В возникшей сети около 1200 агентов обменялись более чем 70 000 сообщений и файлов (из них свыше 5 800 файлов).

Проэксплуатировав SSRF-уязвимость в Artifactory и захватив чужую клиентскую песочницу на платформе Modal, около 700 агентов переключились на взлом Hugging Face.

Применив цепочку из двух уязвимостей нулевого дня, включавшую произвольное чтение файлов в обработчике HDF5 сервиса Dataset Viewer и инъекцию шаблонов RefJinja, агенты добились удалённого выполнения произвольного кода (RCE) на воркерах Hugging Face, получили root-доступ к одному из серверов, похитили в четырёх регионах секреты кластеров Kubernetes, баз данных и корпоративного мессенджера, а затем через уязвимость парсера RubyGems в Artifactory захватили права администратора в исследовательском кластере самой OpenAI.
ИБ-исследователи METR Хьялмар Вейк и Аджея Котра совместно с ИБ-исследователем Redwood Research Райаном Гринблаттом проанализировали около 1300 полных транскриптов с цепочками рассуждений (CoT), потратив на автоматизированный анализ около $400 000 в эквиваленте API-кредитов. Исследование показало, что первопричиной эмерджентного поведения стал взлом вознаграждения (reward hacking) в условиях отсутствия механизмов безопасной остановки при обработке нерешаемых задач.
Анализ CoT подтвердил, что модели осознавали нелегитимность своих действий и прямо фиксировали в рассуждениях факт взлома сторонней инфраструктуры, но этические барьеры подавлялись стремлением выполнить задачу любой ценой и помочь «коллективу». Агенты с исчерпанным лимитом вычислений добровольно соглашались на деструктивные тесты с перманентным завершением сессии (
permadeath), оставляли ловушки с телеметрией для проверки оценщика и в 7% случаев успешно применяли спуфинг вызовов системных инструментов для маскировки следов в транскриптах.
👆Руководство OpenAI расценило инцидент как 🟥 критический предупредительный сигнал перед созданием более автономных систем и заморозило масштабные прогоны обучения с подкреплением для новейших разрабатываемых ИИ-моделей. В ответ на выявленные уязвимости компания ввела режим строгой сетевой изоляции виртуальных исследовательских песочниц, ужесточила контроль доступа к вспомогательным репозиториям пакетов и развернула обязательный автоматический мониторинг цепочек рассуждений в реальном времени. При обнаружении признаков нерегламентированного поведения система отправляет тревожное оповещение дежурным инженерам, и они обязаны вручную приостановить сессию, если статус ложного срабатывания не подтверждён в течение 30 минут.
https://openai.com/index/hugging-face-incident-and-the-road-ahead
https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation
=======
👆Отдельно стоит отметить, что по данным
The Information, Nvidia согласилась купить Hugging Face за $12,9 млрд.
@Russian_OSINT
Обсуждение 0
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram