AI-агенты окружены огромным количеством мифов. И один из главных — что основные расходы связаны со стоимостью самой модели.
Наши коллеги уже
развенчали этот миф: «Оценка эффективности агента может стоить как сам агент».
Но это не значит, что оценку можно отложить. Ее нужно встраивать в проект с первого дня.
Обсуждаем с
Ильей Филипповым, CEO red_mad_robot AI, как приручить дракона и выстроить оценку эффективности, сделав ее частью системы.
Кто внутри компании «владеет» агентом — и платит за анализ эффективности
Обычно владелец агента — лидер бизнес-функции, которая отвечает за конкретный процесс и его P&L. HR-агент — у HR-подразделения, агент службы поддержки — у команды поддержки.
При этом почти всегда есть представители ИТ: они выступают техническими владельцами и отвечают за работу в продакшене.
Но оценивать бизнес-эффективность будет, конечно, бизнес. Потому что именно он получает экономию (или не получает).
С чего начать оценку и на какие метрики равняться
1-й слой оценки — accuracy
Это базовый критерий допуска системы к использованию. Если показатель ниже нужного порога, агента нельзя выпускать в процесс. При этом для разных процессов этот уровень будет своим. Но требование по точности хотя бы на валидационном датасете — это порог допуска ко второму слою.
2-й слой оценки — TCO (совокупная стоимость владения)
В него входят разработка, инференс, интеграции, поддержка, мониторинг и, главное, ревью человеком. Бывает, что классные результаты достижимы только на дорогих облачных моделях или на моделях, которым требуется дорогое железо. Это нужно считать прямо на старте.
3-й слой оценки — экономия и доходы
Это высвобожденное время в FTE, стоимость одного обращения или операции до и после внедрения, прирост пропускной способности, сокращение цикла и влияние на выручку через конверсию и удержание.
А как же ROI?
ROI — понятная и точная метрика, но на первых этапах ИИ-проектов её часто сложно измерить, поэтому начинать лучше с другого.
К чему нужно быть готовым — «подводные камни» подсчета эффективности
Один из главных — нелинейные эффекты.
Например, банковская операция из-за множества проверок документов занимает два-три рабочих дня.
На рынке все участники предлагают примерно такой же срок.
Проектируем систему, которая почти мгновенно проводит основные проверки и передает человеку уже подготовленный результат на проверку. Общее время операции сокращается до двух-трех часов.
С точки зрения экономии в FTE и TCO такой агент может не окупиться.
Но банк за счет скорости выходит из «кровавого океана» одинаковых сервисов и предлагает рынку уникальную по скорости услугу.
Результат — прирост новых клиентов и рост NPS текущих.
Но такие вторичные эффекты уже сложно считать и обосновывать на уровне бюджетов. Поэтому подобные проекты чаще реализуют лидеры с более визионерской позицией: они смотрят не только на прямую экономию, но и на то, как ИИ может изменить саму логику сервиса.
#голос_AI
Подписывайтесь на AI Inside в
Max |
ВКонтакте
Обсуждение 1
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram