Что делать, если модель компьютерного зрения нужно обучить не на тысячах размеченных масок, а на 10–1000 изображениях?
На Хабре MWS AI вышла вторая часть статьи про оптимальное обучение моделей в Luna Line. В
первой публикации команда VisionLabs разбиралась с классификацией, а теперь усложняет задачу и переходит к сегментации.
В этот раз исследователи пересмотрели сам подход к бенчмаркингу: отдельно сравнили модели разных размеров, проверили влияние предобучения и добавила постпроцессинг, чтобы улучшить качество масок на маленьких датасетах.
Главные инсайты:
Команда сравнила модели разных размеров и в итоге выбрала одно семейство SegFormer: B0 для маленьких моделей, B2 для средних и B4 для больших.
Для маленьких моделей отдельно проверили, какой претрейн лучше использовать перед обучением. Лучше всего сработал вариант, где готовые веса применялись только для энкодера, а декодер обучался с нуля и точнее подстраивался под конкретные данные.
Постпроцессинг оказался особенно полезен там, где данных мало или модель изначально слабее — морфологические операции помогают убирать шум, закрывать дырки в масках и подтягивать качество поверх основной модели.
За двумя статьями стоит больше 20 000 экспериментов, полгода работы и практический результат для Luna Line, где пользователь нажимает «Обучить», а система сама выбирает подходящую архитектуру, параметры обучения и при необходимости запускает постпроцессинг.
Читайте вторую часть на Хабре и подписывайтесь на блог MWS AI
Обсуждение 0
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram