21.11.2025 20:22
Реализовал эту систему самообучающихся агентов для 2х клиентов, по одному уже можно сказать, что это работает очень хорошо

Какой в итоге процесс в продакшне:
1) Сначала разработчик оценивает approval rate: то есть, как часто сейлз соглашался с предложенным AI вариантом. Если не устраивает, то идем дальше
2) Если есть хотя бы 3 кейса, то запускаем процесс мета-анализа —> для этого используется reasoning модель
3) Выдержка из мета-анализа:
"The AI response kept pressing for information after the prospect had clearly declined. That can feel pushy, disrespect privacy, and risk damaging rapport. The human chose to acknowledge the ‘no’ and end the exchange courteously"


4) Разработчику предлагается сгенерировать и посмотреть новый промпт с diff-ами, что изменилось. Например
If the prospect is clearly not interested or has ended the thread, reply with a brief acknowledgement and polite goodbye. Do NOT ask for reasons, feedback, or more personal details.


5) Если все гуд, то он апрувит и новый промпт начинает работать.
6) Через недельку разработчик оценивает, повысился ли approval rate

Что еще можно сделать:
1) A/B тест и gradual deployment —> новый промпт раскатываем только на часть кейсов, и, когда уверены в улучшении approval rate, раскатываем на всех
2) Автономия —> пока есть везде human in the loop, но может быть с реализацией пункта 1 можно попробовать и автономно раскатывать новую версию на малую долю кейсов и принимать решение о раскатке на всех без участия человека
Telegram
EDU
Самообучающиеся агенты Запилил вчера на хакатоне такую штуку: слек-бот, который обучается на том, как его исправляет человек, и другим ботам передает это знание, если оно им релевантно. Например, у вас сейлз бот и он помогает вам отвечать на запросы клиентов, но иногда он выдает слишком длинное сообщение, или напридумывает всякого. Вы просто отвечаете клиенту так, как вы хотите, а система учится и учит ботов других клиентов или других ботов - саппорт, например - этого же. Такая вертикальная и горизонтальная эволюция. Причем я решил не делать сложные reinforcement learning и тп, а просто динамическая подправка правил в промптах. Так, по моему мнению, выходит проще, понятнее (можно обьяснить правила, проаудировать их) и гораздо быстрее. Без ретрейнинга модели и privacy проблем Ничего не выиграл, к сожалению, но запилил, что хотел и будем точно встраивать в продакшн. Назыму особое спасибо за видео!
👍 15
8
3 60 3.8K

Обсуждение 3

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

EDU

15.5K
Мои мысли про стартапы и продукты.

Байрам Аннаков, фаундер and CEO onsa.ai - автоматизация B2B продаж

Мой сайт: https://empatika.com
Мой YouTube: https://www.youtube.com/BaykaAnnakov
Мой LinkedIn: https://linkedin.com/in/bayramannakov
Открыть в Telegram