avatar
from:adam
@c3po_notes
30.07.2026 09:45
from:adam В мире AI-продуктов бенчмарк — это не подготовка к продуктовой работе, это и есть продуктовая работа. Короткой дороги нет. Ко мне регулярно приходят продакты, которые хотят построить своих ассистентов. И все хотят быстро. Демка правда собирается быстро. И на глаз даже кажется, что отвечает неплохо. Но первый же замер качества на нормальном датасете даёт ~50% Почему никто не хочет строить бенчмарк и эвал, даже если знает о существовании этих слов? Потому что это нудно. Собрать запросы, убедиться, что они похожи на то, что люди реально будут спрашивать (иначе вся работа в стол). Понять, что такое хороший ответ, научиться согласованно размечать ответы на хорошие и нехорошие… А что такое хороший ответ? Если девушка попросила красную помаду, и ассистент подобрал красную помаду, — это хорошо? Да вообще не факт. Может, она хотела весь вечер целоваться, не оставляя нигде следов. Откуда ж мы знаем. Узнать можно только одним способом — спросить. Так мы и строили ассистента для подбора товаров: обзвонили людей, которые недавно что-то покупали, опросили их по методологии, близкой к JTBD: что искал, в каком контексте, какого результата ждал… Ценность не в том, чтобы найти товар по запросу, а в том, чтобы решить задачу, которая за этим запросом стоит. Тогда работа ассистента распалась на две части: правильно собрать контекст с человека и правильно подобрать товар под этот контекст. Но что значит «правильно подобрать»? С помадой разобрались — не должна оставлять следов. А если «ноутбук для брата, чтобы играть в майнкрафт и делать проекты в скретче»? Я в ноутбуках не разбираюсь вообще. Для некоторых категорий нам пришлось привлекать экспертов, которые объясняли, как переводить человеческий запрос на язык фильтров и критериев подходящести. Так мы руками проделали работу ассистента на большом датасете. И именно поэтому поняли, как её автоматизировать и как проверять. Сбор бенчмарка оказался половиной всей работы над продуктом, если не больше. Всё остальное (прототипы, выбивание целевого качества, переезд на маленькие модельки…) стояло на этом фундаменте. Так что пропустить сбор бенчмарка — это как сказать "Я знаю короткую дорогу". А потом сделать крюк и пойти по навигатору )) Через 2 недели на TurboML Conf наш ML-инженер Саша Замиралов расскажет как мы научили ассистента подбирать товары. Как строили бенчмарк, итерировались, как переезжали на маленькие модельки, улучшая скорость и не теряя в качестве. Будет довольно технический доклад — приходите, если не боитесь! Рега закроется завтра: https://l.tbank.ru/turbo-ap
Цифра ~50% почему-то часто не пугает людей, когда речь про AI-ассистентов. Каждый второй запрос в стену? Ну ок, бывает, докрутим. Это странно, ибо если переложить те же 50% на более классический продукт, который мы все умеем оценивать, отношение будет другим.

К примеру, интернет-магазин, который не создаёт каждый второй заказ, никто «докручивать» не будет — его чинят в ночь, в дождь, вопреки, потому что всем очевидно, что он сломан. Но представим магазин хитрее: заказ создаётся, а дальше то не доставят, то привезут не то или не туда, то спишут другую сумму. При этом снаружи всё может выглядеть как успех с непоколебимым покерфейсом: корзина, чекаут, «спасибо за покупку».

Ассистенты чаще ломаются именно так. Там, где классический софт падает с ошибкой, LLMки отвечают: «подписку отменил», а по факту ничего не отменил, «операция корректна», а она снесла прод-базу. Ровно тот самый идеальный покерфейс, и у пользователя обычно не хватает компетенций отличить правильный ответ от уверенного вранья.

Отсюда и разница в обратной связи. Косячащий магазин закидают жалобами и единицами в отзывах за день: чтобы понять, что привезли не то, экспертиза не нужна. А к ассистенту человек приходит ровно потому, что сам не знает ответа. Отличить хороший результат от плохого ему часто нечем, так что уверенный бред спокойно собирает свои пятёрки, либо собирает негатив с большой задержкой, либо вовсе выглядит как падающий ретеншн.

Откуда тогда спокойствие команд? Моя гипотеза: дело в лёгкости лицезрения. Метрики магазина дешёвые: доля созданных заказов, SLA доставки, возвраты. Собираются за день и орут с дашборда красными огнями. Если даже никто дашборд не построил, то быстро прибежит СЕО и заставит сделать сэппуку. Метрика качества ассистента дорогая, это тот самый бенчмарк и эвалы и нудные месяцы работы. А пока эвалов нет — нет и дашборда, на котором могло бы загореться красное.

А когда мы измеряем что-то, то часто это улучшаем. Если не измеряется, то «вроде работает» будет достаточно. Дешёвая метрика тычет тебя носом в провал, а дорогая разрешает жить в неведении и называть это оптимизмом.

Так что если у команды ассистента нет бенчмарка и эвалов, это не значит, что у неё нет 50% фейлов. Это значит, что она узнает о них последней.
👍 15
😁 10
💯 10
7
🔥 3
5 20 3.6K

Обсуждение 5

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

from:adam

6K
Адам Елдаров. Product Director @ T-Bank AI, ex. YouDo.

Делюсь своими мыслями про AI, Product & People Management и другими наблюдениями.
Открыть в Telegram