В мире AI-продуктов бенчмарк — это не подготовка к продуктовой работе, это и есть продуктовая работа. Короткой дороги нет.
Ко мне регулярно приходят продакты, которые хотят построить своих ассистентов. И все хотят быстро. Демка правда собирается быстро. И на глаз даже кажется, что отвечает неплохо. Но первый же замер качества на нормальном датасете даёт ~50%
Почему никто не хочет строить бенчмарк и эвал, даже если знает о существовании этих слов? Потому что это нудно. Собрать запросы, убедиться, что они похожи на то, что люди реально будут спрашивать (иначе вся работа в стол). Понять, что такое хороший ответ, научиться согласованно размечать ответы на хорошие и нехорошие…
А что такое хороший ответ? Если девушка попросила красную помаду, и ассистент подобрал красную помаду, — это хорошо? Да вообще не факт. Может, она хотела весь вечер целоваться, не оставляя нигде следов. Откуда ж мы знаем.
Узнать можно только одним способом — спросить. Так мы и строили ассистента для подбора товаров: обзвонили людей, которые недавно что-то покупали, опросили их по методологии, близкой к JTBD: что искал, в каком контексте, какого результата ждал… Ценность не в том, чтобы найти товар по запросу, а в том, чтобы решить задачу, которая за этим запросом стоит.
Тогда работа ассистента распалась на две части: правильно собрать контекст с человека и правильно подобрать товар под этот контекст. Но что значит «правильно подобрать»? С помадой разобрались — не должна оставлять следов. А если «ноутбук для брата, чтобы играть в майнкрафт и делать проекты в скретче»? Я в ноутбуках не разбираюсь вообще. Для некоторых категорий нам пришлось привлекать экспертов, которые объясняли, как переводить человеческий запрос на язык фильтров и критериев подходящести. Так мы руками проделали работу ассистента на большом датасете. И именно поэтому поняли, как её автоматизировать и как проверять.
Сбор бенчмарка оказался половиной всей работы над продуктом, если не больше. Всё остальное (прототипы, выбивание целевого качества, переезд на маленькие модельки…) стояло на этом фундаменте.
Так что пропустить сбор бенчмарка — это как сказать "Я знаю короткую дорогу". А потом сделать крюк и пойти по навигатору ))
Через 2 недели на TurboML Conf наш ML-инженер Саша Замиралов расскажет как мы научили ассистента подбирать товары. Как строили бенчмарк, итерировались, как переезжали на маленькие модельки, улучшая скорость и не теряя в качестве. Будет довольно технический доклад — приходите, если не боитесь!
Рега закроется завтра:
https://l.tbank.ru/turbo-ap
Обсуждение 0
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram