avatar
MWS AI
@mtsai
07.07.2026 13:27
Настроить LLM под новые правила за секунды, а не переобучать её 10 дней

MWS AI и исследователи KOREATECH разработали AVI — универсальный фильтр для больших языковых моделей, который помогает быстро адаптировать их работу под требования безопасности, законодательства и корпоративных регламентов.

Как работает AVI:

Фильтр не меняет саму модель и не вмешивается в её архитектуру, а подключается как внешний «посредник» между пользователем и LLM.


На входе AVI блокирует джейлбрейки, провокации, запрещённые темы и попытки получить чужие персональные данные.


На выходе адаптирует ответы модели под заданные правила (этику, комплаенс, законодательство) и не пропускает токсичный контент, дезинформацию и конфиденциальные корпоративные сведения.


Новые правила можно задавать обычными фразами, без программирования и повторного обучения, поэтому настраивать фильтр могут юристы, специалисты по информационной безопасности и отраслевые эксперты, не привлекая ML-инженеров.


На тестах AVI распознал 98,5% опасных обращений и почти в четыре раза ускорил реакцию системы на нарушения. Архитектура фильтра совместима с любыми большими языковыми моделями.

Выложили на GitHub рабочий сервис на Python и FastAPI, а также инструментарий для воспроизведения экспериментов. Подробнее читайте на Хабре MWS AI
5
4
4
2
17 771

Обсуждение 0

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

MWS AI

7.3K
Мы разрабатываем решения и продукты на базе технологий NLP, CV и Gen AI. Формируем AI-сообщество, сотрудничаем с ведущими технологическими компаниями и экспертами, проводим исследования, инвестируем в перспективные проекты и команды.
Открыть в Telegram