Теперь создавать реалистичную озвучку еще проще
Google выпустили новую модель генерации аудио: Gemini 3.1 Flash TTS. Принцип работы похож на ElevenLabs, там так же используются аудиотеги. Это команды в квадратных скобках прямо внутри текста. Написали
[шёпотом] или
[как будто выиграл в лотерею] - и голос мгновенно меняет окраску
Что можно создавать:
- Озвучка книг с разными персонажами и репликами.
- Генерация подкастов и голосовых ассистентов.
- Создание реалистичных диалогов для игр или видео.
Доступно более 70 языков, из них 24 в премиум-качестве (включая русский, японский, хинди).
Есть 30 предустановленных голосов + возможность «кастинга» персонажа через текстовое описание.
Можно попробовать бесплатно в
Google AI Studio, там же доступен API
P.S. По ощущениям генерит лучше 11Labs
@n2d2ai
Обсуждение 17
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram