avatar
Слезы продакта
@alice_product
31.08.2026 05:32
SOTA: почему лучшая модель не всегда нужна твоему продукту

На очередном викли кто-то приносит новость, что вышла новая модель и она SOTA. И вот уже хочется всё бросить, сменить провайдера и сделать презу для c-level что работаем только с самыми передовыми моделями (и сколько денег ЕЩЕ нам на это нужно) Давайте разбираться, что такое SOTA и почему продакту важно понимать это

Что это за аббревиатура
SOTA расшифровывается как State of the Art и зто лучший заявленный или опубликованный результат на конкретной задаче, по конкретной метрике и на конкретном тестовом наборе. То есть SOTA не означает, что модель топчик. Она означает, что сегодня она показала лучший результат в определённом тесте.
Те, модель может быть SOTA в математике, но это не гарантирует, что она так же хороша в решении других задач
Обученная для распознавания лиц европеоидов модель, едва ли хорошо импортируется в Китай. А обученная на английском языке фича по модерации отзывов едва ли поймёт что «ёшкин кот» это ругательство, а «фиг с ним» выражает неготовность обсуждать тему дальше


Что такое бенчмарк
Бенчмарк это стандартизированный экзамен для моделей, где есть набор заданий, правила подсчёта и итоговый балл. Он нужен, чтобы сравнивать модели в одинаковых условиях.
Проблема в том, что не надо путать экзамен и работу в реальных условиях

Где подвох
Первое, бенчмарк измеряет только то, что в него положили. Высокий балл по одной метрике не гарантирует, что модель полезна для вашей задачи.
Второе, часть публичных тестов годами доступна в инете, они могут попадать в обучающие данные, поэтому высокий балл не всегда означает, что модель научилась решать новые задачи, а не встретила похожие примеры раньше
Третье, в лидерборде обычно не видно того, что волнует продукт
сколько стоит 1 успешный сценарий
какая задержка ответа
как часто модель глючит на ваших данных
что происходит с безой и перс данными
может ли пользователь вообще понять и принять её ответ

И самое важное, в ИИ-фиче пользователь общается не с моделью, а с целой системой. Там есть ваши данные, поиск по ним, промпты, инструменты, интерфейс, ограничения и человек, который потом разгребает косяки) Поэтому SOTA-модель в кривой обвязке может проиграть более скромной модели в нормальном продукте

Что проверяем перед переходом на новую SOTA
на какой задаче и по какой метрике она стала лучшей
похожи ли эти задачи на наши реальные сценарии
какую цену, задержку и качество мы получим на своих данных
что покажет наш собственный тестовый набор, а не чужой лидерборд
Вот тут и начинается продуктовая работа. Не выбрать модель с самым громким маркетингом, а понять, решает ли она конкретную проблему лучше, быстрее и за вменяемые деньги

Короче, SOTA это хороший сигнал, что модель стоит проверить, но точно не повод немедленно тащить её в прод и выбивать бюджет

Что еще почитать по теме
РБК Тренды. Как оценивать качество ответов нейросетей
Habr. Оценка мультиагентных систем

Ciao! 💚

@alice_product
#этобаза #ИИ
3
👍 1
🔥 1
138

Обсуждение 0

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

Слезы продакта

839
🤖AI-полезности для продактов
💪🏼Кейсы, практика, гайды
🚀Лайфхаки, тренды, болтовня😎

Присоединяйся!
Реклама и коллабы - @alice_only
Открыть в Telegram