Несуществующие агенты для аудио
В последнее время много работаю с генерацией аудио. И удивляет, что в основном аудио пайплайны собираются в условном comfy – визуальном блочном редакторе. Удивляет, потому что это как писать код пайплайном в n8n вместо клода/кодекса
Основная проблема тут – нет полноценного агентного цикла, где модель видит, а точнее слышит, результаты предыдущих действий и может сама выбирать что с этим делать дальше
Но тут есть одна техническая сложность, которая многое объясняет: у моделей пока тупо нет нативного восприятия аудио. Например, умение "видеть" картинки уже есть. Поэтому клод код может посмотреть скриншоты лендинга, который он сделал, увидеть косяки и поправить их. Картинки – в контексте той же модели, которая пишет код
А с аудио так не работает – большинство моделей не умеют в нативный аудио input
Вы скажете: так есть же gemini. Это да.
Но: ни одна агентная обертка не поддерживает чтение аудио файлов чисто на уровне тулов. Агентный экзоскелет просто не может просунуть аудиофайл в API запрос к "мозгу".
Да, можно подключить gemini по api к основному агенту и отправлять туда аудио с промптом, мол "расскажи, чего не хватает" (кстати, китайская glm-5.2 все еще с картинками работает именно так). Но это все равно что глухой композитор, который зовет своего племянника послушать музыку и сказать, что он там слышит – работает, очевидно, плохо из-за эффекта глухого телефона
Вот и получается, что сейчас просто нет привычного нам агентного решения (со скиллами, запуском терминальных комманд, форками сессий, субагентами и т.д.), которое может полноценно работать с аудио (= замыкая фидбэк луп)
———
UPD: Спустя два часа после написания текста выше:
1. Собран простенький самодельный агент вокруг gemini на 300 js строк, с агентным циклом, интерактивностью, fork/edit/resume – чисто проверить подход
2. Это все перенесено в PI в виде экстеншна, который патчит тул чтения файлов (он там by design умеет и текст читать, и бинарные данные)
Короче, теперь добавить своему агенту "уши" можно в 1-2 строки:
npm install -g pi-agent
pi install git:github.com/toolittlecakes/pi-gemini-audio-read
(не забываем потом /login → google → api key и выбрать модель gemini-3.5-flash)
Где нужно: генерация музыки, качественные аудио переводы, работа с voice cloning, монтаж аудио (и видео, если это подкаст)
Ограничения: 20мб на файл – не добавлял загрузку файлов через file api. И нет видео инпута
Вообще, забавно, как вдохновляют задачки, у которых в целом нет существующего решения (по крайней мере публичного). Ощущение, что оказываешься на землях, где "ни ступала нога человека"
Репо
Обсуждение 3
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram