Поляков считает: AI, код и кейсы
Фото:
Барбершоп-тест: отечественным ИИ-моделям нужно следующее поколение. Жду
Вчера писал, что GigaChat плохо подходит как сердце агента. По пути c подачи @evilfreelancer я обнаружил, что лучше запускать Гигачат через LiteLLM с флагом supports_function_calling: true
С этим флагом вызов тулов становится адекватным, хотя бы на 1-2 шага. GigaChat Pro модель даже смогла найти филиал барбершопа.
После этого я прогнал тот же барбершоп-кейс на разных моделях в OpenClaw.
Агенту надо понять кривой запрос, найти нужный филиал, открыть запись, разобраться с мастерами и вытащить слоты. Обычно это заканчивается браузером, формой онлайн-записи YCLIENTS.
🧪 Что получилось
GigaChat-2-Pro и GigaChat-2-Max провалились именно на вызове инструментов.
В простых тестах, вроде «вызови web_search» функция вызывается. Но в реальном OpenClaw, где с самого старта около 60 000 символов системного промпта и 22 инструмента, модель начинает вести себя случайным образом.
GigaChat Max в чистом прогоне получил 22 инструмента и не вызвал вообще ни одного. И это при том, что за 5 минут до Pro модель наконец начала вызывать тулы. На уточняющие сообщения тоже отвечал текстом: «перехожу к выполнению», «использую навык», «среди доступных навыков нет подходящего». Но действий не было.
Особенно смешно, что Гигачат Pro на практике реально выглядит лучше чем Max. У Паши Злого скоро выйдет пост с бенчмарком PAC1 — это тест точности вызова инструментов. На его прогоне GigaChat-2-Pro набрал 37,2%, Max — 32,6%. Для сравнения: GLM, MiniMax, Kimi и Qwen держатся примерно в районе 72–74%.
🤖 А что другие модели
🚩 YandexGPT Pro оказалась самой бодрой из суверенных: агент сразу пошёл в инструменты и даже попробовал поискать в памяти. Это хороший знак. Но задачу всё равно не решил: нашёл адрес и часы работы филиала, а до мастера и слотов не дошёл. Плюс маленький контекст быстро привёл к схлопыванию истории, и продолжение сломалось. Тут главный минус — окно в 32 000 токенов.
✅ Kimi K2.6 задачу решила. Не идеально: понадобился пинок, было много лишних действий, но модель читала скилл, искала, ходила в браузер, дошла до YCLIENTS и вернула Михаила, цены и слоты.
✅ DeepSeek V4 Pro тоже решил после пинка. Первый проход упёрся в лимит 900 секунд, зато модель уже была в нужном месте. После пинка сразу выдала результат. По текущим ценам DeepSeek этот прогон стоил около 28 центов. В Гигачат такой же был бы 5 000 руб.
🚀 А теперь про суверенных агентов
Проблем у нас сейчас две:
1. Модели Сбербанка не хотят вызывать тулы на сложных кейсах. В условиях: вызови web_search всё красиво,
а в случае если: вот тебе 30 000 символов про семью Даши и Саши, вот тебе тулы включая генерацию картинок, найди барбершоп — всё ломается.
2. Модели Яндекса более активные, но дают преступно низкий размер контекстного окна. Да, можно постараться и контролировать контекст, но 32 тыс токенов по меркам 2026 года уже очень мало. Иной договор занимает больше токенов.
Пока остается только ждать выхода новых моделей. Надеюсь, что добавят Кими, мощности для запуска есть, модель открытая, надо только указать, что это Кими, а не Гигачат.
🤔 На мой взгляд, суверенный ИИ должен быть не вывеской, а инфраструктурой, на которой можно строить продукты. Круто не когда модель своя, а когда ты внедрил ИИ в сложный процесс.
Пока всё грустно. Суверенный ИИ стоит дорого, ощущение, что его даже не тестировали на чем-то сложнее get_weather и требует при этом корпоративного бюджета.
Поделитесь, вот если бы в России была доступна модель уровня Кими или Дипсик, за адекватные деньги — вы бы пробовали делать агентов на ней?
----
Поляков считает — AI, код и кейсы
Перешел на DeepSeek v4 Pro для своих агентов, полёт нормальный
В марте я писал, что у меня на
Mac Mini живет OpenClaw, который тратит 100 рублей в неделю. Логика была в покупке очень дешевых Plus подписок через
https://lzt.market/llm/?order_by=price_to_up и подключение Codex подписок в
CLIProxyAPI который прикрыт Cloudflare Warp.
С начала апреля к моей коллекции агентов добавился Hermes
(и я точно могу сказать, что он не всегда круче глючного OpenClaw) потребление токенов увеличивалось.
🩼 Конечно это не могло нравится OpenAI
Такая схема у нас во внутренних кругах называется «абьюз подписок» — получение сервиса через нарушение условий его использования.
Anthropic за такое ранее банил аккаунты, OpenAI подключили смс-верификацию. Для получения смс и одноразовых номеров телефона я использовал
https://smsfast.cc, в совокупности в конце мая уходило порядка 300-400 рублей на один аккаунт с подпиской Plus + подтверждение.
🤔 Короче я понял, что у меня уходит неприятно много времени на такой абьюз-менеджмент и стал морально готовиться к тому, чтобы платитить за API. Осталось найти кому.
🐳 DeepSeek продлил дисконт навсегда
Когда делал
барбершоп тесты, я отметил DeepSeek v4 Pro как реальный конкурент SOTA моделей за супер-низкую цену. Тогда было майское промо — 1 доллар за миллион токенов. 22 мая DeepSeek написал
твит, что промо продлевается навсегда. Вот тогда я решил, что можно смело мигрировать своих агентов с OpenAI GPT 5.4 на Deepseek.
Короче уже 5 дней я работаю через Дипсик и траты в сутки составляют в среднем полтора доллара. Месяц использования будет стоить около 50 долларов: дороже одной подписки плюс, но по лимитам на одной такой подписке было бы тесно.
⚠️ Я не использую OpenClaw и Hermes для кодинга и какого либо ассистирования в работе — только рутина: тулы для бронирования парковок, запись на стрижку и т д
🔬 Пара проверок
Основной работой агентов в моем случае является вызов различных тулов: заказ пропусков, парковок для гостей, стрижки, поэтому я решил проверить не только DeepSeek, но и локальные модели
на бенчмарке PAC1 — чтобы сравнить, насколько они будут хорошо справляться с вызовом инструментов.
Тут есть еще и профессиональный интерес, так как я активно тестирую MCP для бронирования путешествий, там есть бенчмарк с эвалами и один из прогонов я делаю локальными моделями — чтобы понимать, как они держат большой контекст с кучей инструкций.
Короче сравнил на этом бенчмарке Опус без ризонинга и другие модели. Вывод — Дипсик близок к SOTA, надо брать.
Из интересного — результаты квантованного Qwen 3.6, я был очень удивлен, когда увидел, что он обходит полносвязную Gemma 4 — кажется отличный кандидат для туристического бенчмарка.
Короче говоря ставка на дорогих агентов, кажется будет скомпенсированна Китаем. Хочется верить, что осенью Сбер всё-таки выпустит обновление и сделает цены на свои модели преемлемыми.
Если у вас был опыт запуска агентов на локальных или недорогих моделях — буду рад отзывам в комментариях.
----
Поляков считает — AI, код и кейсы
Обсуждение 54
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram