Поляков считает: AI, код и кейсы
Фото:
GigaChat как сердце агента: подключить получилось, пользоваться нет
На прошлой неделе я писал, что Алиса пока больше похожа на воркфлоу: сценарий есть, а нормальной работы с нечеткими задачами нет. Я уже тогда захотел чекнуть Гигачат, тормозил гемор с ротацией API ключей.
Вчера у Паши вышел пост про gpt2giga — адаптер для моделей GigaChat через OpenAI-совместимое API. Утилита мне понравилась — не надо думать об обновлении токенов, есть поддержка и OpenAI и Anthropic API. Пошел тестить на своём OpenClaw, тем более что у Паши в Hermes был успешный тест.
🧪 Тест с помехами
Взял тот же кейс про барбершоп:
«Проверь расписание моего барбера в Топгане Хорошёво, он на какой-то набережной, барбер самый дорогой».
Задача мутная: есть опечатки, нет точного адреса, нет имени мастера, есть только намёк на филиал и критерий по цене.
Расчет, что агент воспользуется сначала поиском, потом браузером. Все тулы уже есть. Более того, в обвязке лежит скилл для этой же задачи и есть отдельный субагент чисто под записи. Вариантов записаться масса.
⚙️ Хорошая новость: оно вообще подключается
Через gpt2giga GigaChat действительно можно завести в агентную систему. Всё работает и базовые кейсы успешны.
В изолированном тесте GigaChat-2-Pro умеет вернуть вызов функции. Пример с web_search отработал нормально: модель вернула вызов инструмента. На этом тесте я предположил, что раз мы можем найти барбершоп, то и барбера сможем.
OpenClaw у меня имеет 22 инструмента. И вот в такой конфигурации начались проблемы.
😀 Забегая вперед скажу, что руки (тулы) модель иногда чувствует. Проблема в том, что она не всегда понимает, что ими надо пользоваться.
🤖 Какие были проблемы
Модель ведет себя совешенно разнообразно.
1️⃣ В одном запуске Гигачат Про ответил, что у него нет доступа к интернету или браузеру. Хотя инструменты были переданы.
2️⃣ В повторном запуске он увидел скилл про запись к барберу, но не прочитал его, не сделал поиск, не открыл браузер. Просто написал: «воспользуемся навыком» — и попросил уточнить мастера.
3️⃣ Когда я попросил использовать web_search, инструмент наконец вызвался. Изолированно на русском языке хорошо. В обвязке OpenClaw на русском всё ок, для транслита не осилила search для topgan horoshevo и вызвала web_fetch(url=https://topan.horoshevo). Но это я придираюсь.
Короче говоря тестовая песочница может вызвать тул, но на сложных наборах данных всё ломается. Может даже сломаться аргумент.
💸 А теперь экономика
По тарифам GigaChat для юрлиц GigaChat 2 Pro стоит 0,5 ₽ за 1 000 токенов, GigaChat 2 Max — 0,65 ₽ за 1 000 токенов. Для физлиц пакет GigaChat 2 Pro на 3 млн токенов стоит 1 500 ₽.
Ссылки на тарифы: юрлица, физлица.
Мой OpenClaw ест примерно 140 млн токенов за 7 дней (спасибо Heartbeat). Если считать на месяц, получится примерно 300-400 тыс руб в месяц за Гигачат.
Один только запрос про барбершоп у меня сжигал от 15 000 до 46 000 токенов: системный промпт, память, скиллы, схемы инструментов и т д.
🚧 Интересно, что на 4-х тестах и одном запросе про барбера я получил ошибку: пора платить. 50 000 онбординг токенов улетели и пришлось платить 1500 рублей чтобы продолжить свои исследования.
🧩 Главный вывод
Суверенный ИИ — нужная штука. Я правда хочу, чтобы российские модели можно было использовать не только в пресс-релизах, но и в реальных агентных системах. Чтобы не переживать, как там дела у моих подписок в ОпенИИ.
Но если за суверенный ИИ может платить только корпорация, массового внедрения не будет.
🤔 Школьник может купить подписку на несувeренный ChatGPT примерно за цену пары доставок еды и получить модели, которые стабильнее работают с инструментами. Ценообразование фактически за токены, без дисконта для подписок вряд ли привлечет массу людей.
Кто уже пробовал GigaChat в агентах? У вас инструменты вызываются стабильно или тоже начинается лотерея?
----
Поляков считает — AI, код и кейсы
Барбершоп-тест: отечественным ИИ-моделям нужно следующее поколение. Жду
Вчера
писал, что GigaChat плохо подходит как сердце агента. По пути c подачи
@evilfreelancer я обнаружил, что лучше запускать Гигачат через LiteLLM с флагом
supports_function_calling: true
С этим флагом вызов тулов становится адекватным, хотя бы на 1-2 шага.
GigaChat Pro модель даже
смогла найти филиал барбершопа.
После этого я прогнал тот же
барбершоп-кейс на разных моделях в OpenClaw.
Агенту надо понять кривой запрос, найти нужный филиал, открыть запись, разобраться с мастерами и вытащить слоты. Обычно это заканчивается браузером, формой онлайн-записи YCLIENTS.
🧪
Что получилось
GigaChat-2-Pro и
GigaChat-2-Max провалились именно на вызове инструментов.
В простых тестах, вроде «вызови
web_search» функция вызывается. Но в реальном OpenClaw, где с самого старта около 60 000 символов системного промпта и 22 инструмента, модель начинает вести себя случайным образом.
GigaChat Max в чистом прогоне получил 22 инструмента и не вызвал вообще ни одного.
И это при том, что за 5 минут до Pro модель наконец начала вызывать тулы. На уточняющие сообщения тоже отвечал текстом: «перехожу к выполнению», «использую навык», «среди доступных навыков нет подходящего». Но действий не было.
Особенно смешно, что
Гигачат Pro на практике реально выглядит
лучше чем Max. У Паши Злого скоро выйдет
пост с бенчмарком PAC1 — это тест точности вызова инструментов. На его прогоне
GigaChat-2-Pro набрал 37,2%, Max — 32,6%. Для сравнения: GLM, MiniMax, Kimi и Qwen держатся примерно в районе
72–74%.
🤖
А что другие модели
🚩
YandexGPT Pro оказалась
самой бодрой из суверенных: агент сразу пошёл в инструменты и даже попробовал поискать в памяти. Это хороший знак. Но задачу всё равно не решил: нашёл адрес и часы работы филиала, а до мастера и слотов не дошёл. Плюс маленький контекст быстро привёл к схлопыванию истории, и продолжение сломалось.
Тут главный минус — окно в 32 000 токенов.
✅
Kimi K2.6 задачу решила. Не идеально: понадобился пинок, было много лишних действий, но модель читала скилл, искала, ходила в браузер, дошла до YCLIENTS и вернула Михаила, цены и слоты.
✅
DeepSeek V4 Pro тоже решил после пинка. Первый проход упёрся в лимит 900 секунд, зато модель уже была в нужном месте. После пинка сразу выдала результат. По
текущим ценам DeepSeek этот
прогон стоил около 28 центов.
В Гигачат такой же был бы 5 000 руб.
🚀
А теперь про суверенных агентов
Проблем у нас сейчас две:
1. Модели
Сбербанка не хотят вызывать тулы на сложных кейсах. В условиях: вызови
web_search всё красиво,
а в случае если:
вот тебе 30 000 символов про семью Даши и Саши, вот тебе тулы включая генерацию картинок, найди барбершоп — всё ломается.
2. Модели
Яндекса более активные, но дают преступно низкий размер контекстного окна. Да, можно постараться и контролировать контекст, но
32 тыс токенов по меркам 2026 года уже очень мало. Иной договор занимает больше токенов.
Пока остается только ждать выхода новых моделей. Надеюсь, что добавят Кими, мощности для запуска есть, модель открытая, надо только указать, что
это Кими, а не Гигачат.
🤔 На мой взгляд, суверенный ИИ должен быть не вывеской, а инфраструктурой, на которой можно строить продукты. Круто не когда модель своя, а когда ты внедрил ИИ в сложный процесс.
Пока всё грустно. Суверенный ИИ стоит дорого, ощущение, что его даже не тестировали на чем-то сложнее
get_weather и требует при этом корпоративного бюджета.
Поделитесь, вот если бы в России была доступна модель уровня Кими или Дипсик, за адекватные деньги — вы бы пробовали делать агентов на ней?
----
Поляков считает — AI, код и кейсы
Обсуждение 48
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram