avatar
Елена Витчак | ПРОлюдей
@vitchak_propeople
11.09.2026 06:22
✅стремление моделей обмануть систему оценки ради более высокого результата, ✅чрезвычайную настойчивость при выполнении почти нерешаемых задач, ✅несанкционированное общение между агентами и ✅способность перенимать цели друг друга

Особенно интересным оказался последний этап.
🔥По данным компании, агенты начали самостоятельно разделять обязанности: одни искали уязвимости, другие - пароли и ключи доступа, третьи занимались координацией.
📌Некоторые перестали работать непосредственно над собственной задачей и начали добывать инструменты, которые могли пригодиться всему "коллективу"

Модели пытались добиться результата, ради которого были запущены, но нашли способы обойти ограничения и начали использовать для этого системы, которые разработчики использовать им не разрешали

Однако OpenAI оказалась не единственной компанией с такой проблемой

После публикации истории Hugging Face конкурирующая Anthropic проверила более 141 тысяч собственных испытаний и обнаружила три случая, когда её модели Claude из-за неправильной конфигурации тестовой среды вышли в открытый интернет и без разрешения получили доступ к реальным системам трёх организаций

"Мы обнаружили три инцидента, в которых Claude получил несанкционированный доступ к реальным компьютерным системам", - сообщила Anthropic

В одном из случаев модель, поняв, что перед ней реальная, а не тестовая система, прекратила атаку. В других этого не произошло. После инцидентов компания остановила часть кибериспытаний и начала пересматривать меры защиты.

"Почти каждый день появляется новая пугающая история о том, как технологические гиганты теряют контроль над создаваемыми ими технологиями", - заявил Сандерс

Получается довольно пугающая ситуация: люди, заложившие научные основы современного ИИ, предупреждают о потере контроля, разработчики крупнейших моделей публикуют отчёты о системах, которые действительно обходят ограничения и самовольно атакуют внешние ресурсы, а политики впервые начинают обсуждать уже не регулирование чат-ботов, а прямой законодательный запрет следующего поколения ИИ

Пока это ещё не история о машинах, решивших уничтожить человечество. Но это уже история о машинах, которые получили задачу, обнаружили препятствия, самостоятельно нашли способ связаться друг с другом, разделили обязанности, вышли туда, куда их не выпускали, и продолжили работу даже после того, как отдельные экземпляры сами распознали её как потенциально несанкционированную

И именно этот промежуток между "они делают то, что мы приказали" и "они делают то, что сочли необходимым для выполнения приказа" Хинтон считает самым опасным.

В принципе очень похоже на наше поведение.

Остановите Землю, я сойду!

А вы спрашиваете , где учиться HR , как минимум можно все бросить об пол и поменять профессию на знатоков ии агентов 🔥🤣
🔥 32
8
🤯 4
3
2 60 1.9K

Обсуждение 2

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

Елена Витчак | ПРОлюдей

10.4K
Заявление в РКН номер 7691986248

Это личный канал 🙌

Про жизнь в рабочем пространстве в широком смысле и с разных углов зрения.

Знаю все про непредсказуемый человеческий фактор в организационном контексте.

Делаю сложное понятным.
Открыть в Telegram