SOTA: почему лучшая модель не всегда нужна твоему продукту
На очередном викли кто-то приносит новость, что вышла новая модель и она
SOTA. И вот уже хочется всё бросить, сменить провайдера и сделать презу для c-level что работаем только с самыми передовыми моделями (
и сколько денег ЕЩЕ нам на это нужно) Давайте разбираться, что такое SOTA и почему продакту важно понимать это
Что это за аббревиатура
SOTA расшифровывается как State of the Art и зто лучший заявленный или опубликованный результат на конкретной задаче, по конкретной метрике и на конкретном тестовом наборе. То есть SOTA не означает, что модель топчик. Она означает, что сегодня она показала лучший результат в определённом тесте.
Те, модель может быть SOTA в математике, но это не гарантирует, что она так же хороша в решении других задач
Обученная для распознавания лиц европеоидов модель, едва ли хорошо импортируется в Китай. А обученная на английском языке фича по модерации отзывов едва ли поймёт что «ёшкин кот» это ругательство, а «фиг с ним» выражает неготовность обсуждать тему дальше
Что такое бенчмарк
Бенчмарк это стандартизированный экзамен для моделей, где есть набор заданий, правила подсчёта и итоговый балл. Он нужен, чтобы сравнивать модели в одинаковых условиях.
Проблема в том, что не надо путать экзамен и работу в реальных условиях
Где подвох
Первое, бенчмарк измеряет только то, что в него положили. Высокий балл по одной метрике не гарантирует, что модель полезна для вашей задачи.
Второе, часть публичных тестов годами доступна в инете, они могут попадать в обучающие данные, поэтому высокий балл не всегда означает, что модель научилась решать новые задачи, а не встретила похожие примеры раньше
Третье, в лидерборде обычно не видно того, что волнует продукт
сколько стоит 1 успешный сценарий
какая задержка ответа
как часто модель глючит на ваших данных
что происходит с безой и перс данными
может ли пользователь вообще понять и принять её ответ
И самое важное, в ИИ-фиче пользователь общается не с моделью, а с целой системой. Там есть ваши данные, поиск по ним, промпты, инструменты, интерфейс, ограничения и человек, который потом разгребает косяки) Поэтому SOTA-модель в кривой обвязке может проиграть более скромной модели в нормальном продукте
Что проверяем перед переходом на новую SOTA
на какой задаче и по какой метрике она стала лучшей
похожи ли эти задачи на наши реальные сценарии
какую цену, задержку и качество мы получим на своих данных
что покажет наш собственный тестовый набор, а не чужой лидерборд
Вот тут и начинается продуктовая работа. Не выбрать модель с самым громким маркетингом, а понять, решает ли она конкретную проблему лучше, быстрее и за вменяемые деньги
Короче, SOTA это хороший сигнал, что модель стоит проверить, но точно не повод немедленно тащить её в прод и выбивать бюджет
Что еще почитать по теме
РБК Тренды. Как оценивать качество ответов нейросетей
Habr. Оценка мультиагентных систем
Ciao! 💚
@alice_product
#этобаза #ИИ
Обсуждение 0
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram