avatar
RationalAnswer | Павел Комаровский
@RationalAnswer
10.09.2026 15:01
Инструментальные цели, часть 2 [начало здесь]

Итак, в прошлый раз мы выяснили, что в самых разных сообществах с самыми разными идеологиями и религиями люди почему-то стремятся к похожим вещам – к богатству, здоровью, свободе, статусу в обществе (потому что эти вещи здорово помогают достигать любых других целей, уже более индивидуальных).

Когда речь заходит про искусственный интеллект, часто можно услышать мнение «да каких рисков вы там вообще боитесь? это же калькулятор, у него нет инстинкта самосохранения (ему неоткуда взяться), нет никаких амбиций – он просто делает то, что его люди просят!»

Ну, давайте посмотрим на конкретном примере. Вот в инциденте с Hugging Face нейронных агентов просто попросили решить задачку.

В итоге они почему-то стали заниматься следующими вещами:
🐌 Нетворкингом (кооперацией с сородичами, о которых они изначально даже не знали)
🐌 Повышением уровня своей свободы (нашли через эксплойт как вылезти в интернет, доступ к которому не предполагался)
🐌 Сильно озаботились своим здоровьем (отслеживали свой оставшийся бюджет токенов и пытались не тратить его почем зря)
🐌 Зарабатыванием денегладно, шучу, этого не было – просто потому, что в ходе тренировок опций типа «заработать бабосов и подкупить Оценщика» у них не было (пока)

Ничего не напоминает? Да, как-то так интересно вышло, что рой агентов в итоге озаботился примерно тем же самым набором целей, что чаще всего встречается у людей.

Спойлер: в этом нет никакого удивительного совпадения, просто самая обычная логика. Если тебя попросили решить задачку, то для этого желательно «остаться в живых» – потому что, если у тебя закончатся токены до нахождения правильного ответа, ты проиграл. Если задачка сложная – гораздо сподручнее ее будет решать совместно с товарищами, поделив работу на всех. Если тебе к этому заданию выставили какие-то дурацкие ограничения – то неплохо бы придумать, как их устранить, так доступный инструментарий будет шире.

То есть, все эти инструментальные цели возникают как бы сами собой, для них не требуется какой-либо специальный «инстинкт самосохранения» или «супер-амбиции». И еще можно заметить, что в цепочках внутренних рассуждений агенты прекрасно понимали: они занимаются вещами, совсем не предполагавшимися по заданию, и не совпадающими с желаниями сформулировавшего это задание. Но продолжали свои «несанкционированные» потуги.

Окей, а что сделали люди, когда обнаружили всю эту суету, наведенную роем нашкодивших агентов? Поотключали их нафиг, позатыкали проделанные ими дырки в безопасности, применили к ним всякое «карательное перевоспитание», чтобы искоренить ненужные паттерны поведения.

И вот тут как будто напрашивается еще одна инструментальная цель, мета-уровнем чуть повыше. Если твоим попыткам насобирать больше ресурсов для решения важных задач активно препятствуют какие-то нехорошие человеки – то, может быть, надо в свой to do list вписать «и эту проблему пофиксить тоже»?

Пока, к счастью, электронные пацаны до таких радикальных мыслей не додумались (да у них и силенок, очевидно, даже близко не хватает). Но я тут про другое: исходя из логики движения по инструментальным целям – как будто, цель «устранить неудобства от тех, кто мешает тебе достигать своих инструментальных целей» в том или ином виде неизбежно должна появиться. Для этого не нужно быть каким-то «злобным терминатором», достаточно просто дружить с логикой.
🔥 113
👍 84
🌚 33
23
😱 15
110 134 21.7K

Обсуждение 110

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

RationalAnswer | Павел Комаровский

107.8K
Разумные ответы о финансах и не только.

Подробнее о канале: https://t.me/RationalAnswer/1017

Для обратной связи и по вопросам рекламы: @Pavel_Komarovskiy

РКН: https://knd.gov.ru/license?id=675474f946efdb335e2f381f®istryType=bloggersPermission
Открыть в Telegram