Ещё недавно перевод изображений документов (фото, сканов) в цифровой редактируемый формат базировался на технологии оптического распознавания символов (OCR). Она хорошо работает на ровном печатном тексте, но когда дело доходит до таблиц, рукописей и документов со сложной версткой, получается путаница.
Здесь на помощь приходят мультимодальные генеративные модели, которые могут работать и с текстами, и с изображениями. Вместе со Львом Богдановым, старшим разработчиком MWS AI, разобрали в карточках, где лежат пределы возможностей традиционного OCR и какие преимущества открывает VLM для решения реальных бизнес-задач
2
2
1
8 401
Обсуждение
0
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Мы разрабатываем решения и продукты на базе технологий NLP, CV и Gen AI. Формируем AI-сообщество, сотрудничаем с ведущими технологическими компаниями и экспертами, проводим исследования, инвестируем в перспективные проекты и команды.
Обсуждение 0
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram