H₁₃₉ — а может этот ваш ИИ пользователей тоже заменит?
Такой вот веселый заголовок пришел в голову после очередного поста про ИИ-юзеров вместо реальных. Идея простая: зачем нам ждать недели до набора выборки и вызревания метрики в АБ, если мы можем нажечь токенов и напустить ИИ-агентов проходить А/Б-тестируемые сценарии, собирать метрики и катить лучшее день-в-день.
А чего вы ждали в пятницу, кроме надежд на легкую жизнь???
Что ж, интересная идея. А теперь подумайте: насколько ваш чат-гпт/дип-сик/клод/гемини и далее по списку похож на вас самих?
Многие скажут: мы доучим на прошлых экспериментах и данных наших юзеров. Может быть. Но если агенты могут писать код или тексты еще не значит, что они могут заменять людей.
Спотифай даже тщательно поработал, попробовал дотюнить и проверить это утверждение, вот, что пишет Mårten Schultzberg:
Ключевое различие: рандомизированный эксперимент выявляет эффект воздействия за счёт дизайна. LLM-суррогат выявляет его только за счёт допущений.
Мы формализовали эти допущения через теорию суррогатных конечных точек и проверили их на примерно 3 600 реальных A/B-экспериментах из Upworthy Research Archive. Сырые предсказания LLM восстановили лишь 39% истинного эффекта от воздействий на людей. Калибровка этих предсказаний на исторических данных сократила разрыв, но только при двух условиях, которые невозможно проверить для воздействий, которые вы ещё никогда не тестировали.
То есть тестироваться вы так можете, иногда будете правы, гарантий нет, но в итоге все равно на данном этапе уж кого-кого, но наших юзеров агенты не заменят.
Но! Я тут подумал: ок, мы далеки от таких симуляций сейчас, но ведь и юзерами являются больше не только люди, но и сами агенты )
То есть мы можем найти такие подсценарии, где решения принимают ИИ-агенты, их симулировать должно быть проще, то есть вот как раз там мы можем попытаться получить заветное ускорение. Пожалуй займусь этим как-нибудь в Q5, но идея красивая.
Нас с вами, кстати, ИИ заменить уже очень спешит, по ожиотажу на обучение "аналитику нового времени" из реакций выше мне кажется многие разделяют позицию.
А я еще раз напомню, что это 2 кита: ИИ грамотность и очень фундаментальные харды, каждый под соусом бизнес-приложения. И именно хардам в соусе бизнеса можно
начать учиться 29 июня на нашем курсе. 👈 тык и в будущее прыг
Обсуждение 6
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram