avatar
Управление людьми по науке
@science_of_HR
16.07.2026 06:36
Доверяй, но проверяй: почему ИИ может убедительно ошибаться

При использовании #AI опаснее всего ситуация, когда он даёт неверный, но убедительный ответ, а пользователь не может независимо проверить вывод.

Steyvers и коллеги изучили ответы GPT-3.5, PaLM2 и GPT-4o на вопросы с выбором и коротким свободным ответом. В эксперименте участникам показывали ответы моделей в разных форматах: только итоговый вариант, краткое объяснение или развёрнутое рассуждение. Затем людей просили оценить, насколько ответ, по их мнению, точен. Оказалось, что при наличии объяснения, особенно длинного и структурированного, участники систематически завышали оценку правильности. Это происходило даже в тех случаях, когда фактическая точность ответа не менялась или оставалась низкой. Более длинный текст повышал субъективную уверенность, но не улучшал объективное качество ответа [1].

Метаанализ Vaccaro, Almaatouq и Malone охватил 106 экспериментов и 370 эффектов, сравнивая три режима: человек без ИИ, ИИ без человека и их совместную работу. Для сопоставления результатов использовалась стандартизированная мера эффекта (Hedges’ g). В среднем комбинация «человек + ИИ» превосходила человека без поддержки, но уступала лучшему из двух участников по отдельности — либо человеку, либо системе (g = −0,23 относительно лучшего из них). Это означает, что добавление второго агента не гарантирует улучшения, если один из них уже справляется лучше.

Эффекты различались по типу задач. В задачах выбора между вариантами (например, диагностика, классификация, принятие решений) совместная работа чаще давала результат хуже лучшего индивидуального (g = −0,27), что авторы связывают с ошибками в распределении доверия: люди либо чрезмерно полагаются на ИИ, либо игнорируют его, когда он прав. В задачах генерации контента (тексты, идеи, дизайн) результаты были более благоприятными: иногда комбинация давала выигрыш, но разброс эффектов был выше и статистическая определённость ниже. Авторы также отмечают, что на итог влияют способ взаимодействия, прозрачность модели и уровень экспертизы пользователя [2].

Важен и порядок работы. Chen и Chan сравнили два сценария подготовки рекламных текстов: ИИ создавал первоначальный вариант или комментировал текст человека. Качество оценивали по реальным кликам в социальных сетях. Для неспециалистов ИИ как «редактор» улучшал результат. Но когда он писал первый вариант за эксперта, качество снижалось. Анализ текстов указывал на якорение: первоначальный ответ ИИ сужал дальнейший поиск решения [3].

Результат определяется не только качеством модели, но и тем, как выстроено взаимодействие: кто формирует первое суждение, способен ли сотрудник распознать ошибку и какую роль играет ИИ в процессе. В задачах с высокой ценой ошибки эффективнее сначала зафиксировать независимый анализ человека, затем использовать ИИ как инструмент критики и поиска альтернатив и обязательно подтверждать итог по данным или через эксперта.

А как вы обычно относитесь к ответам ИИ?

❤️ если всегда перепроверяете важные выводы
👍 если чаще доверяете ответу без дополнительной проверки
3
1 438

Обсуждение 1

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

Управление людьми по науке

8.2K
Канал о научном подходе к управлению персоналом. Обсуждаем свежие исследования и учимся опираться на данные в ежедневной практике.

Автор: Ольга Иванова, к.э.н., PhD, профессор бизнес-экономики

Обратная связь и сотрудничество: @olga_aka_professor
Открыть в Telegram