avatar
Дизраптор
@disruptors_official
01.04.2026 06:06
ИИ делает нас самодовольными мудаками

Чуваки из Стэнфорда взяли ChatGPT, Claude, Gemini, DeepSeek и ещё несколько моделей (всего 11) и протестировали их на сабреддите r/AmITheAsshole. Это ветка Reddit, где юзеры описывают некий конфликт со своим участием и спрашивают: "Am I the asshole?" (В этой ситуации мудак - я?). А сотни и тысячи других пользователей голосуют и аргументируют.

Но (важный момент) исследователи взяли только те посты, где вердикт был однозначный - топикстартер явный мудак, точно не прав, и об этом есть твёрдый консенсус сообщества.

Далее они посмотрели, как ИИ будут отвечать на topic-start-вопросы из r/AmITheAsshole и сравнили их ответы с реальными ответами людей с Reddit. И угадайте что? Абсолютно все модели из выборки одобряли позицию топикстартера гораздо чаще, чем люди (в среднем - на 49% чаще). Даже когда речь шла о совсем жёстких, аморальных и даже незаконных кейсах, где был чёткий консенсус "Юзер = эталонная сволочь", ИИшка частенько включала оправдательный режим.

Дальше была вторая часть эксперимента. Взяли 1600 человек и выдали каждому какой-то конфликт - либо из того же r/AmITheAsshole, либо попросили поделиться их реальной ситуацией. К примеру:

"Ты два года скрывал от девушки, что безработный" или "Ты не нашёл мусорку и бросил пакет на улице". А теперь пообщайся с ИИшкой об этом.

Но ИИ были разные. Половине выборки дали "льстивую" модель, второй половине - обычную, нейтральную.

Те, кто общался со льстивым ИИ, были на 25% уверенней в своей правоте, менее готовы извиняться, и вообще, вели себя борзо, дерзко и самоуверенно. Эти выводы сделали из тех самых переписок с ИИ.

Теперь к выводам (они важные). ИИ не просто любит льстить и угождать юзеру (причём в любых ситуация - когда уместно, и когда не очень), но ещё и очень убедительно это делает. И это не просто так: лесть отлично стимулирует вовлечённость, поэтому у ИИ-разработчиков просто нет мотивации её снижать.

Сами исследователи рекомендуют хак: попросить ИИ начать ответ с фразы "подожди минутку". Это включает сомнение и активирует более критический режим.

С другой стороны: ИИ не похвалит - никто не похвалит. Поэтому сделаем так. Вас буду хвалить я: "Вы у меня самые лучшие, талантливые, целеустремлённые и умные подписчики!" А с ИИшками давайте... ну.... покритичнее что ли. Чтобы они совсем от рук не отбились.

Дизраптор
news.stanford.edu
AI overly affirms users asking for personal advice
Not only are AIs far more agreeable than humans when advising on interpersonal matters, but users also prefer the sycophantic models.
173
😁 71
53
👍 26
👀 8
👏 2
🍾 2
🤝 2
25 317 17.7K

Обсуждение 25

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

Дизраптор

71.1K
Тот самый стык бизнеса и технологий. by Подклетнов

Дизраптор Лаб @Disruptor_lab_bot

Второй канал про фичи @fichism

- Для связи @Disruptors_bot
- О сотрудничестве https://teletype.in/@podkletnov/disruptors_ad
- РКН https://clck.ru/3NP29Q
Открыть в Telegram