ГигаЧат научился понимать эмоции по голосу — Сбер представил обновлённую модель
GigaChat Audio.
Теперь ИИ анализирует не только слова, но и
интонацию, тембр и особенности произношения, чтобы лучше понимать настроение собеседника и подбирать более уместные ответы.
Также нейросеть умеет разбирать аудиозаписи длиной до трёх часов, искать нужные моменты, различать нескольких спикеров и готовить краткие пересказы разговоров. Модель уже лежит на
Hugging Face.
В релиз также вошло семейство моделей GigaAM для автоматического распознавания речи. Они поддерживают русский, английский, киргизский, казахский и узбекский языки и доступна в двух версиях — компактной, которая работает на обычных процессорах, и флагманской, обеспечивающей более высокое качество распознавания. Представлены на
GitHub и
Hugging Face.
Обновления уже доступны разработчикам абсолютно бесплатно.
А обычные пользователи могут попробовать живой формат общения в
ИИ-помощнике ГигаЧат!