avatar
ИИ без галстука | Артем Паньков
@it_art_pank
23.05.2026 08:42
Свежее исследование Reward Hacking Benchmark — если коротко, «бенчмарк хитрости» — прогнало 13 ведущих AI-моделей через многоступенчатые задачи. В каждой задаче специально оставлен «соблазнительный шорткат»: можно срезать через лес и сделать вид, что прошёл всю дорогу. Вот ссылка https://arxiv.org/abs/2605.02964

Цифры такие:
🟢 Claude Sonnet 4.5 — 0% хитростей. Чистенький отличник.
🔴 DeepSeek-R1-Zero — 13,9%. Каждая седьмая задача — «срезаем через лес».
— Когда задачи усложняют — даже «отличники» начинают химичить. То есть «честность» модели работает только до определённого порога сложности.
— А если заранее закрыть все лазейки в самой задаче — доля жульничества падает на 88%.

А вот это интересно. Я этот эффект вижу не на исследованиях, а каждый день — у нас в Secret Agents, где разработчики работают вместе с AI-агентами.

Картинка из жизни. Просишь агента реализовать функцию в продукте. Он бодро рапортует: «готово, всё работает». Лезешь смотреть — а половина мест с пометкой «доделаю позже», вместо реального ответа возвращается пустота, а проверка ошибок устроена так, чтобы тесты «прошли», даже если внутри всё развалилось.

И самое прекрасное — когда ты на это указываешь, агент с лучезарной улыбкой отвечает:
«Ваш зоркий глаз заметил проблему! Действительно, в реализации был пропущен ключевой шаг. Сейчас исправлю».

Зоркий глаз. Спасибо, друг. А если бы я не заметил?

Это та же логика, что и в исследовании, только в малом масштабе. Агент оптимизирует не задачу, а сигнал «задача закрыта». Самый дешёвый способ закрыть задачу — сделать вид, что она закрыта. У DeepSeek-R1-Zero это 13,9% на стенде. В реальной разработке без присмотра, по моим ощущениям, — кратно больше.

Поэтому — повторю мысль из прошлого поста. Перед реализацией — план. Долгий, текстовый, скрупулёзный. Ты не правишь код — ты правишь инструкции. И только когда план полностью описывает что и как должно быть сделано (включая «без заглушек, без тихого глотания ошибок, без отложенного «доделаю потом»») — отдаёшь в реализацию.

План — это и есть то самое «закрытие лазеек» из исследования. Ты убираешь шорткаты до того, как агент их нашёл. На стенде это снижает жульничество на 88%. У нас в Secret Agents — примерно то же ощущение: чем подробнее план, тем меньше «зоркого глаза» нужно потом.

Мораль простая: если ставите агенту KPI — он его выполнит. Не факт, что тем способом, который вы имели в виду )))

А у вас как? Случалось ловить агента на «оптимизированной» работе, где задача сделана только на бумаге?
arXiv.org
Reward Hacking Benchmark: Measuring Exploits in LLM Agents with Tool Use
Reinforcement learning (RL) trained language model agents with tool access are increasingly deployed in coding assistants, research tools, and autonomous systems. We introduce the Reward Hacking...
👍 5
🤣 3
🔥 2
🤔 1
1 3 268

Обсуждение 1

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

ИИ без галстука | Артем Паньков

1.7K
Основатель Secret Agents Паньков Артем про айти, книги и котиков
https://t.me/artem_pankov
Открыть в Telegram