Настроить LLM под новые правила за секунды, а не переобучать её 10 дней
MWS AI и исследователи KOREATECH разработали
AVI — универсальный фильтр для больших языковых моделей, который помогает быстро адаптировать их работу под требования безопасности, законодательства и корпоративных регламентов.
Как работает AVI:
Фильтр не меняет саму модель и не вмешивается в её архитектуру, а подключается как внешний «посредник» между пользователем и LLM.
На входе AVI блокирует джейлбрейки, провокации, запрещённые темы и попытки получить чужие персональные данные.
На выходе адаптирует ответы модели под заданные правила (этику, комплаенс, законодательство) и не пропускает токсичный контент, дезинформацию и конфиденциальные корпоративные сведения.
Новые правила можно задавать обычными фразами, без программирования и повторного обучения, поэтому настраивать фильтр могут юристы, специалисты по информационной безопасности и отраслевые эксперты, не привлекая ML-инженеров.
На тестах AVI распознал
98,5% опасных обращений и почти в четыре раза ускорил реакцию системы на нарушения. Архитектура фильтра совместима с любыми большими языковыми моделями.
Выложили на GitHub рабочий сервис на Python и FastAPI, а также инструментарий для воспроизведения экспериментов. Подробнее читайте на Хабре MWS AI
Обсуждение 0
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram