Голосовой помощник от Hugging Face и Cerebras. Сверхбыстрое железо позволяет создавать сервисы реального времени
⚡️ Hugging Face и Cerebras показали демку полностью открытого речевого конвейера реального времени: голос → Nvidia Parakeet для распознавания → Gemma 4 31B (Google DeepMind) на
инференсе Cerebras → синтез речи Qwen3TTS от Alibaba.
Каждый компонент модульный и заменяемый, весь код открыт.
🎯 Качество моделей уже достаточное, узкое место голосового ИИ сегодня — задержка отклика. Медианная скорость многих систем выглядит прилично, но на хвосте распределения, в 95-м процентиле, случаются паузы в несколько секунд, и разговор перестаёт быть естественным.
Cerebras решает именно это: инференс ускорен настолько, что диалог течёт без рывков, а предсказуемость задержки сохраняется даже под нагрузкой.
🤖 Стек работает в проде: больше десяти тысяч роботов Reachy Mini используют этот же голосовой конвейер Hugging Face в реальной эксплуатации.
Для роботов и воплощённого ИИ отзывчивость определяет, чувствуется ли взаимодействие живым, - потому тут без компромиссов.
📦 Демо-стенд доступен на Hugging Face Spaces (smolagents/hf-realtime-voice), репозиторий —
github.com/huggingface/speech-to-speech.
Любой разработчик может взять конвейер и адаптировать под своего ассистента, робота или исследовательский проект.
Избыточность определяет появление новых сервисов. В данном случае пример избыточности в производительности.
Все как с интернетом в своё время.
#Voice #HuggingFace #Cerebras
———
@tsingular
Обсуждение 2
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram