MWS AI
@mtsai
8 401
Сегодня в России более 40 000 публичных библиотек с совокупным фондом почти 900 млн единиц хранения. При таких объемах вручную обрабатывать поступления и вести библиографические записи уже затруднительно. Ценность нашего совместного проекта — не в отдельных технологических решениях, а в том, что мы выстраиваем тиражируемую модель для всей отрасли.
Фильтр не меняет саму модель и не вмешивается в её архитектуру, а подключается как внешний «посредник» между пользователем и LLM.
На входе AVI блокирует джейлбрейки, провокации, запрещённые темы и попытки получить чужие персональные данные.
На выходе адаптирует ответы модели под заданные правила (этику, комплаенс, законодательство) и не пропускает токсичный контент, дезинформацию и конфиденциальные корпоративные сведения.
Новые правила можно задавать обычными фразами, без программирования и повторного обучения, поэтому настраивать фильтр могут юристы, специалисты по информационной безопасности и отраслевые эксперты, не привлекая ML-инженеров.
Доверенные посредники — это защищённые платформы, где финансовые организации смогут добровольно обмениваться и объединять данные для разработки ИИ-моделей. Например, для антифрода, оценки рисков, противодействию отмыванию доходов и других задач, где данных одной компании может быть недостаточно, чтобы модель лучше выявляла мошенничество, снижала число ошибочных решений и точнее работала с рисковыми сценариями.
В отчёте Банка России среди требований называют использование российского ПО, выстроенную систему информационной безопасности, независимый технический аудит и заранее утверждённые правила работы.
Для них нужны обезличивание, шифрование, запрет выгрузки за пределы платформы, использование данных только для обучения ИИ и уничтожение после завершения обработки.
В отчёте отдельно говорится, что нужно проработать распределение ответственности между пользователями платформы и оператором, а также механизм компенсации ущерба при инцидентах.
Команда сравнила модели разных размеров и в итоге выбрала одно семейство SegFormer: B0 для маленьких моделей, B2 для средних и B4 для больших.
Для маленьких моделей отдельно проверили, какой претрейн лучше использовать перед обучением. Лучше всего сработал вариант, где готовые веса применялись только для энкодера, а декодер обучался с нуля и точнее подстраивался под конкретные данные.
Постпроцессинг оказался особенно полезен там, где данных мало или модель изначально слабее — морфологические операции помогают убирать шум, закрывать дырки в масках и подтягивать качество поверх основной модели.