ИИ делает нас самодовольными мудаками
Чуваки из Стэнфорда
взяли ChatGPT, Claude, Gemini, DeepSeek и ещё несколько моделей (всего 11) и протестировали их на сабреддите r/AmITheAsshole. Это ветка Reddit, где юзеры описывают некий конфликт со своим участием и спрашивают: "Am I the asshole?" (В этой ситуации мудак - я?). А сотни и тысячи других пользователей голосуют и аргументируют.
Но (важный момент) исследователи взяли только те посты, где вердикт был однозначный - топикстартер явный мудак, точно не прав, и об этом есть твёрдый консенсус сообщества.
Далее они посмотрели, как ИИ будут отвечать на topic-start-вопросы из r/AmITheAsshole и сравнили их ответы с реальными ответами людей с Reddit. И угадайте что? Абсолютно все модели из выборки одобряли позицию топикстартера гораздо чаще, чем люди (в среднем - на 49% чаще). Даже когда речь шла о совсем жёстких, аморальных и даже незаконных кейсах, где был чёткий консенсус "Юзер = эталонная сволочь", ИИшка частенько включала оправдательный режим.
Дальше была вторая часть эксперимента. Взяли 1600 человек и выдали каждому какой-то конфликт - либо из того же r/AmITheAsshole, либо попросили поделиться их реальной ситуацией. К примеру:
"Ты два года скрывал от девушки, что безработный" или "Ты не нашёл мусорку и бросил пакет на улице". А теперь пообщайся с ИИшкой об этом.
Но ИИ были разные. Половине выборки дали "льстивую" модель, второй половине - обычную, нейтральную.
Те, кто общался со льстивым ИИ, были на 25% уверенней в своей правоте, менее готовы извиняться, и вообще, вели себя борзо, дерзко и самоуверенно. Эти выводы сделали из тех самых переписок с ИИ.
Теперь к выводам (они важные). ИИ не просто любит льстить и угождать юзеру (причём в любых ситуация - когда уместно, и когда не очень), но ещё и очень убедительно это делает. И это не просто так: лесть отлично стимулирует вовлечённость, поэтому у ИИ-разработчиков просто нет мотивации её снижать.
Сами исследователи рекомендуют хак: попросить ИИ начать ответ с фразы "подожди минутку". Это включает сомнение и активирует более критический режим.
С другой стороны: ИИ не похвалит - никто не похвалит. Поэтому сделаем так. Вас буду хвалить я: "Вы у меня самые лучшие, талантливые, целеустремлённые и умные подписчики!" А с ИИшками давайте... ну.... покритичнее что ли. Чтобы они совсем от рук не отбились.
Дизраптор
Обсуждение 25
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram