avatar
Поляков считает: AI, код и кейсы
@countwithsasha
20.06.2026 12:33
Поляков считает: AI, код и кейсы Фото: Чтобы агенты могли планировать поездки: MCP для работы с сервисом путешествий Туту Подключаете https://mcp.tutu.ru/mcp к своему агенту (я гонял на Codex, Hermes и OpenCode) — и он сможет искать вам самые дешевые билеты, следить за трендами, подбирать интересные отели и планировать путешествия полностью. Зимой я тестировал MCP для бытовых задач — писал про «Вкусвилл» и про управляющую компанию. ✈️ Весной мы с Дашей обсуждали первый отпуск с ребёнком, она предложила слетать в Японию на сакуру — и я поймал себя на мысли: обидно, что не могу прямо в агенте посмотреть билеты. Оказалось, в Туту уже думали про агентный MCP. Так и познакомились. 🧭 Что умеет сейчас Поиск по пяти направлениям — авиа, отели, ЖД, автобусы, электрички — повторяет витрину мобильного приложения. Плюс сборка ссылки на оформление: для отелей, поездов и автобусов она ведёт прямо в корзину с выбранными местами. Мне очень нравится кейс с поиском подходящих отелей, агенту доступны отзывы — может аналлизировать плюсы и минусы по ним, а не только по описанию. Пара инсайтов, которые я вынес из разработки. 🧪 Три набора тестов — обязательны 🔸 юниты — ловят баги в логике и изменения в сигнатурах API; 🔸 лайв-тесты — ходят на реальные хосты Туту; 🔸 эвалы — сценарии, которые прогоняет сам агент. Эвалы гоняю после каждого заметного изменения логики — и баг находился почти каждый раз. Обычно это корнер-кейсы, которых юнитами не видно. Поэтому сделал так, чтобы вместе с доработкой функционала шла доработка эвал-кейсов и их прогон. 🪫 Токен-диета: маленькие модели задыхались Сначала собрал демо, потом запустил его на локальной Qwen3-30B-A3B — и почти все эвалы были красными. Оказалось, что у меня огромные результаты вызова тулов, а контекстное окно локальной всего ~130тыс токенов. Некоторые тулы переполняли его, и агент просто забывал результаты поиска. Можно было решить как в моём скилле «Яндекс Метрики» — гонять данные через файлы. Но не хотелось требовать лишнего инжиниринга на стороне клиента, поэтому посадил MCP на токен-диету: 🔸 детали по ЖД: были 66–75 КБ — стали 14–17 КБ (−75%); 🔸 отели: были 58 КБ — стали 16 КБ; 🔸 контекст на сценарии с 7 поездами: было ~133k — стало ~34k токенов. После этого даже маленький квен стал тянуть эвалы нормально. 🤝 Бизнес-инсайт: акцепт оферты живёт на стороне вендора Самый интересный вопрос был не технический, а продуктовый: как пользователь аксептует оферту? 💡 Вывод шире одного проекта: любые commerce-протоколы и агентные автоматизации пока упираются в сессию вендора — финальный акцепт и оплата остаются на его стороне. Агент доводит вас до кнопки «купить», но не может нажать ее без вас, иначе будут юридические сложности. 🎁 Буду рад идеям Хочу усиливать MCP. Если у вас есть сценарии или улучшения — пишите в комментарии или в личку. У меня есть бюджет на подарки: предложили улучшение, забрал в прод — приду в ЛС дарить подарок. Подарки — это подписки за 100 баксов если что. 🔗 Ссылка на MCP: https://mcp.tutu.ru/mcp Буду рад результатам, отзывам и идеям по продукту. ---- Поляков считает — AI, код и кейсы
Если делаете себе MCP: не забудьте дать ему лендинг

Когда я анонсировал MCP для сервиса путешествий Туту, то первый же отзыв прилетел мне от моей жены Даши, причем он был не про какие-то баги или потребление контекста, Даша вопросительно показала мне телефон с белым экраном, на котором было написано что-то про {"detail" : "Method Not Allowed}

Кажется это очень логично: пользователь первым делом кликает то, что выглядит как ссылка, а там тарабарщина. Как этим пользоваться, не понятно. AI-адопшен пошел под откос.

🚀 Что с этим делать или благодарности Рефату

В тот же день, вечером в комментарии под постом пришел Рефат @nobilix и вбросил крутую идею. Раз мы можем отличать агентов и браузеры, то почему бы не показывать браузерам (пользователям) инструкцию, что с этим делать, вместо какое-то непонятной ошибки про Streamable HTTP.

🌟 Сервер различает человека и ИИ-агента по заголовку Accept: есть text/html (браузер) — показываем красивую страницу-инструкцию, нет — отдаём JSON-RPC агенту. Один URL, две аудитории.


🔗 Так что теперь у Туту красивый MCP c инструкциями по подключению: https://mcp.tutu.ru/mcp

Короче, кажется это прям хорошая точка для всех MCP серверов. Можно описать возможности + подключение + интересные кейсы.

Теперь Даша открывает mcp.tutu.ru и видит инструкцию, а не ошибку.

🙋🏻‍♂️ Обратная связь

Мне очень приятна обратная связь в комментариях, ощущается, что продукт реально появился в момент, когда общество готово. Хочется верить, что в России агентная коммерция будет развиваться, в том числе благодаря крупным компаниям.

Если найдете чем улучшить сервис: пишите комментарии.

----

Поляков считает — AI, код и кейсы
👍 25
🔥 16
7
14 68 1.8K
avatar
Поляков считает: AI, код и кейсы
@countwithsasha
17.06.2026 15:48
Чтобы агенты могли планировать поездки: MCP для работы с сервисом путешествий Туту

Подключаете https://mcp.tutu.ru/mcp к своему агенту (я гонял на Codex, Hermes и OpenCode) — и он сможет искать вам самые дешевые билеты, следить за трендами, подбирать интересные отели и планировать путешествия полностью.

Зимой я тестировал MCP для бытовых задач — писал про «Вкусвилл» и про управляющую компанию.

✈️ Весной мы с Дашей обсуждали первый отпуск с ребёнком, она предложила слетать в Японию на сакуру — и я поймал себя на мысли: обидно, что не могу прямо в агенте посмотреть билеты. Оказалось, в Туту уже думали про агентный MCP. Так и познакомились.


🧭 Что умеет сейчас

Поиск по пяти направлениям — авиа, отели, ЖД, автобусы, электрички — повторяет витрину мобильного приложения.

Плюс сборка ссылки на оформление: для отелей, поездов и автобусов она ведёт прямо в корзину с выбранными местами.

Мне очень нравится кейс с поиском подходящих отелей, агенту доступны отзывы — может аналлизировать плюсы и минусы по ним, а не только по описанию.

Пара инсайтов, которые я вынес из разработки.

🧪 Три набора тестов — обязательны

🔸 юниты — ловят баги в логике и изменения в сигнатурах API;
🔸 лайв-тесты — ходят на реальные хосты Туту;
🔸 эвалы — сценарии, которые прогоняет сам агент.

Эвалы гоняю после каждого заметного изменения логики — и баг находился почти каждый раз. Обычно это корнер-кейсы, которых юнитами не видно. Поэтому сделал так, чтобы вместе с доработкой функционала шла доработка эвал-кейсов и их прогон.

🪫 Токен-диета: маленькие модели задыхались

Сначала собрал демо, потом запустил его на локальной Qwen3-30B-A3B — и почти все эвалы были красными.

Оказалось, что у меня огромные результаты вызова тулов, а контекстное окно локальной всего ~130тыс токенов. Некоторые тулы переполняли его, и агент просто забывал результаты поиска.

Можно было решить как в моём скилле «Яндекс Метрики» — гонять данные через файлы. Но не хотелось требовать лишнего инжиниринга на стороне клиента, поэтому посадил MCP на токен-диету:

🔸 детали по ЖД: были 66–75 КБ — стали 14–17 КБ (−75%);
🔸 отели: были 58 КБ — стали 16 КБ;
🔸 контекст на сценарии с 7 поездами: было ~133k — стало ~34k токенов.

После этого даже маленький квен стал тянуть эвалы нормально.

🤝 Бизнес-инсайт: акцепт оферты живёт на стороне вендора

Самый интересный вопрос был не технический, а продуктовый: как пользователь аксептует оферту?

💡 Вывод шире одного проекта: любые commerce-протоколы и агентные автоматизации пока упираются в сессию вендора — финальный акцепт и оплата остаются на его стороне. Агент доводит вас до кнопки «купить», но не может нажать ее без вас, иначе будут юридические сложности.


🎁 Буду рад идеям

Хочу усиливать MCP. Если у вас есть сценарии или улучшения — пишите в комментарии или в личку.

У меня есть бюджет на подарки: предложили улучшение, забрал в прод — приду в ЛС дарить подарок.

Подарки — это подписки за 100 баксов если что.

🔗 Ссылка на MCP: https://mcp.tutu.ru/mcp

Буду рад результатам, отзывам и идеям по продукту.

----

Поляков считает — AI, код и кейсы
🔥 28
8
👍 4
😐 1
54 328 7.4K
avatar
Поляков считает: AI, код и кейсы
@countwithsasha
16.06.2026 07:33
Рецепты для вайбкодера: глючит UI, агент не понимает что не так? Чиним

Надавно писал, как удобно в кодексе в режиме рецензирования собирать сайты чисто по макетам в Figma (раз, два про SSR). В общем я довел сайт до продакшена, но столкнулся с одним глюком.

🤷‍♂️ Постоянно моргали карточки форм ламелей при переключении. Записал видео, чтобы проиллюстрировать. Косяк вроде мелкий, но неприятный. Я пытался обращать внимание кодекса по всякому (в душе понимал, что нужно фиксировать высоту блока и всё), но Codex не хотел исправлять. Окно так и дрыгалось.


Рассказываю как решать.

🚀 Решение или Спасибо Тимуру Хахалеву за курс

Решение пришло во время просмотра одного из уроков курса от @the_ai_architect.

Я 20 лет работаю в диджитал (причем в что ни на сеть браузерном стеке — я начинал SEO-специалистом в 2006), а о том, как сгрузить отладочную информацию из браузера не знал.

Нажимаем F12 или cmd+options+i — откроется консоль браузера. Там переключаемся во вкладку Perfomance, нажимаем кнопку записи, воспроизводим глюк, сохраняем запись (проставив все галки). Получите архив с логами, его отдаете агенту и описываете проблему.
В случае с описанным глюком решилось через ваншот.

😀 Когда у меня получилось, я пошел к Тимуру сыпать благодарностями и спрашивать разрешения поделиться фишкой из курса и рассказать о программе. Оказалось, что сейчас я могу поделиться только лайфхаком, продажи курса сейчас не идут. Но летом Тимур обещал их открыть и поделиться со мной промокодом для подписчиков. А я поделюсь с вами.


🔭 Где исхать лайфхаки

В который раз поражаюсь, что проходя различные обучения и обмен опытом можно круто подсматривать хаки, которые сильно упрощают работу. Так например, когда-то когда я проходил iOS разработку на Яндекс.Практикуме, то подсмотрел утилиту Charles, и очень активно использую ее для разработки скиллов агентам.

Когда учился на Middle Python, проникся описанием компонентов и приложения через PlantUML и активно использовал эту механику для передачи данных об архитектуре для ИИ-кодинг агентов.

Теперь вот кейс с курсом Тимура — и почему я этого не знал.

Если у вас есть какие-то прикольные хаки при работе с ИИ и передаче агентам обратной связи — делитесь в комментариях.

🔗 Ссылка на курс Тимура «AI Coding для разрабочиков» — https://courses.khakhalev.com

UPD: В комментариях пара ссылок, которые лучше демонстрируют консоль браузера и профайлинг: https://t.me/c/2097983096/8534 + https://t.me/c/2097983096/8553

----

Поляков считает — AI, код и кейсы
🔥 18
👍 7
3
33 94 2.3K
avatar
Поляков считает: AI, код и кейсы
@countwithsasha
13.06.2026 06:25
Поляков считает: AI, код и кейсы Фото: Вышла Fable 5 от Anthropic — квантованный Mythos. У меня в интерфейсе написано «Included until June 22» — потому что после 22 Июня эта модель перестанет работать за лимиты подписки и станет оплачиваться через кредиты Extra Usage. 🐸 К фулл-прайсу надо приучать Вспоминается лягушка, которую варят медленно, чтобы она не заметила. Правильный ход, чтобы прощупать рынок. Если хотим приучить пользователей платить за токены, надо дать им модель, которая хороша и предлагать платить за нее деньги. Думаю стоит ожидать подобного и от OpenAI. Уже оценили новую модель? Что скажете? ---- Поляков считает — AI, код и кейсы
Паспортный ИИ: правительство США ограничило использование Fable 5.

У меня для вас две новости, хорошая и плохая:

Хорошая: 22 июня Fable 5 не станет платным
Плохая: Fable 5 вообще не будет больше работать.


Судя по анонсу Anthropic передовые ИИ-модели теперь станут passport based https://www.anthropic.com/news/fable-mythos-access

Причем это распространяется в том числе на сотрудников компании, а в случае если вы использовали Fable как часть продукта (не знаю кто это мог быть), то и ваших пользователей.

Короче сегодня ночью Anthropic отключили Fable 5 для всех.

Возвращаемся на gpt-5.5?

Возможно это не единичное отключение. В своем пресс-релизе Anthropic решили напомнить и про GPT 5.5, так что если это не гениальная рекламная кампания, то завтра ночью нам могут выключить еще пару моделей.

Помню было такое эссе про лидерство в США в области ИИ: https://www.anthropic.com/research/2028-ai-leadership, так что я могу верить, что всё это попытка реально ввести идентификацию личности для фронтир моделей.

🤔 Зачем всё это

Мне кажется, что главный аргумент тут не в поиске уязвимостей, и не в том, что русские пользуются, а в том, что компании из Китая дистиллируют топовые модели и потом выпускают свои.

Блокировать по IP или по платежным системам — выстрел в ногу, поэтому вариант с паспортом решает задачу:

1. Даже если вы договоритесь с кем-то о валидации по его паспорту
2. Этот кто-то может получить материальные последствия за участие в обходе санкций.
3. Получается, что если ты гражданин США — ты точно не будешь в этом участвовать, есть что терять.

🚀 Что делать теперь

Я очень рад, что успел посмотреть, насколько четко работает Fable 5 в Ultracode режиме. Так как все кодовые изменения у меня валидирует Codex, то количество итераций ревью — можно сказать бенчмарк. Короче на результат Fable 5 он ничего не добавлял.

Всем разработчикам, энтузиастам или ИИ-предпринимателям хочется посоветовать:

• оценивать все инструменты так, как будто завтра их могут отключить
• пробовать передовой ИИ в своих задачах, чтобы понимать уровень технологий
• смотреть какие задачи можно решать на локальных моделях (я всё чаще прибегаю к использованию локальных Qwen, особенно в кейсах, где обсуждение может касаться каких-то обходов ограничений и других серых зон).

Что думаете? Что будем делать, если ИИ перейдет на паспортный контроль?

----

Поляков считает — AI, код и кейсы
8
👍 7
🔥 4
❤‍🔥 2
🤝 1
44 35 2.5K
avatar
Поляков считает: AI, код и кейсы
@countwithsasha
12.06.2026 17:09
Codex раздает сбросы лимитов

Ребята разогнались в привлечении пользователей и запустили две новые фичи:

— каждому подписчику теперь доступен 1 сброс лимитов (и вот хорошо бы чтобы это было раз в месяц, но как будто всего один раз): работа кипит и лимиты израсходованы, сбрасываем лимиты и продолжаем. Не уходим трогать траву.

— можно приглашать новых пользователей (не более трех) и получить еще +1 сброс за каждого. Мне кажется гораздо круче безлимитных недельных триалов. Так как пользователи, кому ценны сбросы 100% активные. А триальщики нет.

🤔 Сам я не буду вписываться в приглашения

Лично меня пугает история, что все приглашенные юзеры как будто будут залинкованы. Соответственно если потом меня или кого-то забанят за санкционную геолокаюцию, я опасаюсь, что будет бан по цепочке.

Но сама идея прям очень годная и позволит привлекать именно сильных пользователей заинтересованных в постоянном использовании = подписчиков за 200 долларов в будущем.

🌟 А кодекс лучше клод кода?

Мне сегодня очень зашел пост Максима Этихлид. Я уже два месяца гоняю и Claude Code и Codex на Pro подписках. Оба поставщика годные дают крутой результат. У кодекса очень крутой удаленный доступ (на мак мини) + работа с дизайном. Дизайн я теперь только в нем и делаю.

Так что мне кажется, что куда важнее то, насколько вам вообще подходит сама обвязка, модели сильные и у одних и у других.

----

Поляков считает — AI, код и кейсы
👍 8
6
🔥 3
31 21 2.4K
avatar
Поляков считает: AI, код и кейсы
@countwithsasha
11.06.2026 12:27
Поляков считает: AI, код и кейсы Три протокола агентной коммерции: кто кого контролирует За полгода появились три протокола, позволяющие ИИ покупать товары от имени человека: ACP от OpenAI и Stripe (сентябрь 2025), UCP от Google и Shopify (январь 2026), и вчера — YCP от Яндекса. Плюс десятки MCP-серверов для отдельных магазинов (вроде ВкусВилл). Когда я вижу новый протокол, я не читаю пресс-релиз. Я смотрю на роли: кто покупатель, кто продавец, а главное — кто между ними и сколько власти у каждого. 🎭 Роли в агентной коммерции В обычном e-commerce всё просто: покупатель и продавец (иногда мёрчант и платежная система). В агентном — между ними появляются посредники: 🔸 AI-провайдер — чей ИИ общается с покупателем (ChatGPT, Gemini, Алиса) 🔸 Платёжный провайдер — кто проводит деньги (Stripe, Yandex Pay, Visa) 🔸 Платформа — где живёт магазин (Shopify, KIT, 1С-Битрикс) 🔸 Владелец протокола — кто написал правила игры 🔸 Разработчик агента — кто-то кто создал своего агента поверх протокола И вот тут начинается самое интересное. 🔍 Кто совмещает роли В ACP роли формально разнесены: OpenAI делает ИИ, Stripe — платежи, Shopify — платформу. Спека открыта (Apache 2.0). Но нюанс: Instant Checkout в ChatGPT — только для одобренных партнёров, платёжный токен пока только через Stripe, а механизма discovery для внешних агентов ещё не существует. Спека открытая, канал — «по приглашениям». В UCP Google разделил роли сильнее: 4 транспорта (REST, MCP, A2A, крипто-мандаты), 20+ партнёров включая Visa и Mastercard. Мерчант публикует манифест на /.well-known/ucp — это как robots.txt, только для ИИ-покупателей (пример https://store.moma.org/.well-known/ucp). Архитектурно — самый открытый. Но в продакшне пока тоже только Google AI Mode. В YCP Яндекс — одновременно AI-провайдер (Алиса), платёжка (Yandex Pay), платформа (KIT) И владелец протокола. Четыре роли в одном. Спека закрыта, MCP не поддерживается, внешних агентов нет даже в теории. 💡 Все три протокола — lock-in, вопрос лишь в жёсткости замка. YCP — железный засов (только Алиса). ACP — дверь открыта, но на защелке. UCP — ближе всех к реальной открытости, но пока тоже один работающий канал. ⚡ Три вопроса, которые всё решают 1️⃣ Могу ли я подключить своего бота? ACP — спека открыта, но в продакшне работает только ChatGPT, и мерчанты сертифицированы под него. UCP — архитектурно да (четыре транспорта, Agent-to-Agent), но в дикой природе тоже пока один канал. YCP — нет, только Алиса. По факту ни один протокол сегодня не даёт тебе взять спеку и запустить своего shopping-агента «из коробки». 2️⃣ Могу ли я влиять на то, как ИИ выбирает мой товар? ACP вообще не покрывает discovery — только чекаут. UCP даёт мерчанту манифест возможностей. А в YCP Алиса сама решает: у неё агент «Найти дешевле», индикаторы цен и персональные скидки. Продавец не контролирует ранжирование. 3️⃣ А если я — не продавец, а покупатель-гик? Допустим, я хочу агента для себя. Который покупает продукты по моим правилам, а не по правилам рекомендательной системы. ACP и UCP теоретически это позволяют — спеки открыты, бери и пиши. На практике — discovery нет, оплата только через определенную платежную систему, работающих примеров ноль. YCP — даже теоретически не подключить. А ведь еще предстоит решить вопрос возврата заказов (доступен только в UCP), работы с отзывами, ограничением возможностей скрапинга контента. 🎯 Вот главный гэп: все три протокола заточены под связку «продавец → ИИ → покупатель». Но никто не строит протокол от лица покупателя — чтобы мой агент ходил по магазинам с моими требованиями и договаривался на моих условиях. Пока ближе всех к этому UCP с его Agent-to-Agent транспортом, но реализаций я пока не видел. А вы ждёте агентную коммерцию? И что важнее — чтобы подключение было гарантированно простым, или чтобы можно было гибко настроить под себя? ---- Поляков считает — AI, код и кейсы
Яндекс пришёл подключать меня к YCP. Пока бесплатно — и поэтому я всем рекомендую

Три месяца назад я разбирал UCP, ACP и анонсированный YCP, протокол агентной коммерции Яндекса (тот пост). На этой неделе Яндекс пришёл подключать меня сам.

Штука, которую назвали как протокол для покупок в Алисе, пока работает в первую очередь как буст заметности в поиске.

Ну и конечно, Яндекс будет пытаться приучать аудиторию к покупкам в Алисе AI — что из иэтого получится, пока не понятно, всё же явный вендор-лок и в ранжировании и в настройках ИИ.

🛒 Что это сейчас

Кнопка «Купить в 1 клик» рядом с карточкой магазина: в органике Поиска, в чате с Алисой AI, в ленте Ритма и в корзине на сайте (и вот в корзине сайта я считаю, это пока что размещать не надо). Покупатель жмёт — открывается чекаут Яндекса с уже подставленными данными из Яндекс ID.

Режима два:

🔸 с Яндекс Пэй — доводит до оплаты прямо в чекауте;
🔸 без него — заказ с данными клиента падает в твою систему, оплату принимаешь сам (ссылка, звонок, как удобно). Вариант для тех, кто Яндекс Пэй у себя не хочет.

💰 Вот что я думаю насчет подключения

Сейчас подключение бесплатное. С 2027 года планируют комиссию 4–7% с покупки через кнопку. Мне тут не нравится, что есть доля отказов, и бывают товарные категории, в которых вся маржа 5% — заплатить с таких продуктов комиссию Яндексу, равносильно остаться без прибыли.

⚡ Кнопка делает карточку заметнее в поиске. В рамках теста пробуют размещение кнопки в рекламном блоке Яндекс.Директа. Подключаться выгодно ровно сейчас, на бесплатном окне.


🚪 Как подключиться

Всё делается через Яндекс.Товары, плюс надо делать доработки:

🔸 1С-Битрикс — готовый модуль «Яндекс Товары: генерация фидов и интеграция с YCP»;
🔸 другие CMS и самописные — по API в режиме беты;
🔸 магазины на Маркете — почти автоматом.

Берут только физические товары с доставкой по РФ и корзиной. Цифровые товары, опт, продажи юрлицам и т.д. пока не поддерживают.

Подключение идёт по заявкам. Можно на сайте, можете мне в личку прислать сайт, я передам менеджеру в Яндексе.

Кто нибудь уже пробовал? Есть прирост заказов с Алисы?

----

Поляков считает — AI, код и кейсы
9
🔥 5
👍 2
23 42 2.1K
avatar
Поляков считает: AI, код и кейсы
@countwithsasha
09.06.2026 17:14
Вышла Fable 5 от Anthropic — квантованный Mythos.

У меня в интерфейсе написано «Included until June 22» — потому что после 22 Июня эта модель перестанет работать за лимиты подписки и станет оплачиваться через кредиты Extra Usage.

🐸 К фулл-прайсу надо приучать

Вспоминается лягушка, которую варят медленно, чтобы она не заметила.

Правильный ход, чтобы прощупать рынок.

Если хотим приучить пользователей платить за токены, надо дать им модель, которая хороша и предлагать платить за нее деньги. Думаю стоит ожидать подобного и от OpenAI.

Уже оценили новую модель? Что скажете?

----

Поляков считает — AI, код и кейсы
10
🔥 4
🤔 4
9 40 3.1K
avatar
Поляков считает: AI, код и кейсы
@countwithsasha
08.06.2026 13:26
Внезапно осознал, что первая линия поддержки может быть автоматизирована через Codex.

Сегодня обсуждал с клиентом первичную оценку задач в сервис-деске. Обычно задачи ждут разработчиков, которые должны прочитать тикет, залезть в код, оценить объем. Кажется это дорогой человеческий труд, который может быстро решаться через ИИ за несколкьо минут.

Клиент изначально ориентировался на обучение разработчиков использованию ИИ, чтобы ускорить оценки, а тут оказалось, что разработчик вообще не нужен.

Просто запускаешь процесс, который после получения вебхука запускает codex exec. Если немного подумать получаются связки задача-сессия и полная автоматизация службы поддержки. На парадигму отлично ложится и работа со скиллами агентов и подключение локальных кодинг моделей через кастомизацию API-эндпоинта.

🔌 Есть даже SDK

В пятницу OpenAI выложил Python-SDK для Codex (pip install openai-codex).

То есть просто запускаем


thread = codex.thread_start(
working_directory="/path/to/repo", # где работать
skip_git_repo_check=True, # если репо нет — снять требование
sandbox=Sandbox.read_only, # для оценки: только чтение
)


Даже Codex CLI отдельно ставить не надо: официальный openai-codex тащит рантайм с собой.

Внутри библиотеки:
🔸 песочница тремя режимами: read_only для оценки (агент только читает код), workspace_write — если надо ещё и патч предложить
🔸 уровень рассуждений задаётся в конфиге: low/medium/high.
🔸 по умолчанию Codex ждёт, что рабочая папка — git-репозиторий, поэтому может пригодиться флаг skip_git_repo_check

💸 Где подвох — два места

Первое: это работает, только если оценка реально лезет в код. Если задача — классифицировать текст тикета (приоритет, категория), Codex здесь выглядит пушка по воробьям. Дешевле и быстрее один вызов Responses API. Агент оправдан там, где надо зайти в репозиторий, использовать MCP и различные тулы со скиллами.

Второе: деньги и правила. Подписочная авторизация под такую автоматизацию — серая зона ToS OpenAI, а чистый путь, API-ключ — может быть дорогим. И тут красиво ложится Kimi K2.6: открытые веса, OpenAI-совместимый эндпоинт, токены в разы дешевле, а при желании модель поднимаешь локально — данные не уходят наружу вообще.

❓Кто уже отдал агенту первичную оценку задач — что он реально тянет, а где всё равно зовёте человека?

----

Поляков считает — AI, код и кейсы
9
👍 5
🔥 2
39 67 3K
avatar
Поляков считает: AI, код и кейсы
@countwithsasha
06.06.2026 14:13
Поляков считает: AI, код и кейсы Фото: В комментариях к предыдущему посту мне посоветовали посмотреть DeepSeek v4 flash как более дешевый аналог. Уверен, что еще надо тестировать эту модель на больших контекстах, обычно именно от величины контекстного окна зависит деградация маленьких моделей. Но на бенчмарке она показала себя достаточно хорошо. Можно попробовать и сэкономить --- Поляков считает — AI, код и кейсы
Еще один тест DeepSeek v4 Flash

Сделал из одного клиентского MCP наивный бенчмарк.

Всё очень грубо: заморозил ответы реального сервера и если агент задает «правильные вопросы» — получает моковые ответы, иначе мусор. Короче добиться отметки о прохождении можно только сделав цепочку правильных вызовов.

В конце проверяем последовательность вызовов и ответ. Если хоть где-то ошибка — попытка не прошла.

Я очень удивлен, что DeepSeek v4 Flash получает такие высокие результаты.

---

Поляков считает — AI, код и кейсы
👍 5
3
36 26 3.1K
avatar
Поляков считает: AI, код и кейсы
@countwithsasha
04.06.2026 12:09
Поляков считает: AI, код и кейсы Фото: Перешел на DeepSeek v4 Pro для своих агентов, полёт нормальный В марте я писал, что у меня на Mac Mini живет OpenClaw, который тратит 100 рублей в неделю. Логика была в покупке очень дешевых Plus подписок через https://lzt.market/llm/?order_by=price_to_up и подключение Codex подписок в CLIProxyAPI который прикрыт Cloudflare Warp. С начала апреля к моей коллекции агентов добавился Hermes (и я точно могу сказать, что он не всегда круче глючного OpenClaw) потребление токенов увеличивалось. 🩼 Конечно это не могло нравится OpenAI Такая схема у нас во внутренних кругах называется «абьюз подписок» — получение сервиса через нарушение условий его использования. Anthropic за такое ранее банил аккаунты, OpenAI подключили смс-верификацию. Для получения смс и одноразовых номеров телефона я использовал https://smsfast.cc, в совокупности в конце мая уходило порядка 300-400 рублей на один аккаунт с подпиской Plus + подтверждение. 🤔 Короче я понял, что у меня уходит неприятно много времени на такой абьюз-менеджмент и стал морально готовиться к тому, чтобы платитить за API. Осталось найти кому. 🐳 DeepSeek продлил дисконт навсегда Когда делал барбершоп тесты, я отметил DeepSeek v4 Pro как реальный конкурент SOTA моделей за супер-низкую цену. Тогда было майское промо — 1 доллар за миллион токенов. 22 мая DeepSeek написал твит, что промо продлевается навсегда. Вот тогда я решил, что можно смело мигрировать своих агентов с OpenAI GPT 5.4 на Deepseek. Короче уже 5 дней я работаю через Дипсик и траты в сутки составляют в среднем полтора доллара. Месяц использования будет стоить около 50 долларов: дороже одной подписки плюс, но по лимитам на одной такой подписке было бы тесно. ⚠️ Я не использую OpenClaw и Hermes для кодинга и какого либо ассистирования в работе — только рутина: тулы для бронирования парковок, запись на стрижку и т д 🔬 Пара проверок Основной работой агентов в моем случае является вызов различных тулов: заказ пропусков, парковок для гостей, стрижки, поэтому я решил проверить не только DeepSeek, но и локальные модели на бенчмарке PAC1 — чтобы сравнить, насколько они будут хорошо справляться с вызовом инструментов. Тут есть еще и профессиональный интерес, так как я активно тестирую MCP для бронирования путешествий, там есть бенчмарк с эвалами и один из прогонов я делаю локальными моделями — чтобы понимать, как они держат большой контекст с кучей инструкций. Короче сравнил на этом бенчмарке Опус без ризонинга и другие модели. Вывод — Дипсик близок к SOTA, надо брать. Из интересного — результаты квантованного Qwen 3.6, я был очень удивлен, когда увидел, что он обходит полносвязную Gemma 4 — кажется отличный кандидат для туристического бенчмарка. Короче говоря ставка на дорогих агентов, кажется будет скомпенсированна Китаем. Хочется верить, что осенью Сбер всё-таки выпустит обновление и сделает цены на свои модели преемлемыми. Если у вас был опыт запуска агентов на локальных или недорогих моделях — буду рад отзывам в комментариях. ---- Поляков считает — AI, код и кейсы
В комментариях к предыдущему посту мне посоветовали посмотреть DeepSeek v4 flash как более дешевый аналог.

Уверен, что еще надо тестировать эту модель на больших контекстах, обычно именно от величины контекстного окна зависит деградация маленьких моделей. Но на бенчмарке она показала себя достаточно хорошо. Можно попробовать и сэкономить

---

Поляков считает — AI, код и кейсы
🔥 9
6
39 17 3.3K
avatar
Поляков считает: AI, код и кейсы
@countwithsasha
04.06.2026 06:35
Сохраняемые посты мая: топ-3 по пересылкам

С небольшим опозданием традиционный дайджест месяца. Лучшие посты мая 2026, оцениваю по пересылкам (сохранениям себе).

В мае 21 пост, около 59 600 просмотров и 2 010 пересылок. Постов меньше, чем в апреле поэтому суммарные просмотры просели, зато средний пост собрал больше: 2 840 против 2 431 в апреле. Хотя по ощущениям к концу месяца начался спад.

🥉 Третье место: самый скачиваемый скилл оказался не Вордстатом

Зашёл на skills.sh за статистикой по установкам скиллов из моего репо (гит). По установкам победил крошечный навык для подключения агента к серверу по SSH — тот, про который я писал в канале лишь раз.

131 пересылка на 2 575 просмотров — 5,1%

🥈 Второе место: книги для агентов

Knowledge-compiler — навык, который превращает техническую книгу в карту знаний для агента: понятия, решающие правила, анти-паттерны, словарь.

Заодно поговорили про серую зону: чьи это книги, когда их «читает» не человек, а агент в проекте: пиратство ли распространение таких скиллов?

214 пересылок на 3 834 просмотра — 5,6% + море комментариев.

🥇 Первое место: навайбкодили сайт — а в выдачу он не попадёт

Codex красиво собрал лендинг, а в исходнике пустой <div id="root"> и гора JavaScript. Разобрал, как лечить через SSR.

265 пересылок на 3 004 просмотра — 8,8%

📈 Рекорд по охвату: GigaChat как сердце агента

7 334 просмотра — больше всех в мае. Подключаем отечественную модель в агента и, спойлер, дорого и бесполезно.

💡 Что видно за пять месяцев

Скиллы по-прежнему тащат сохранения: два из трёх призёров снова про навыки агентов. В прошлом году так было с промптами, теперь со скиллами.

🔮 Прошлые выпуски

🔸 Январь — скилл Вордстата
🔸 Февраль — парсинг выдачи Яндекса
🔸 Март — гайд по интерфейсам от OpenAI
🔸 Апрель — чтение X через агентов

Если у вас есть надоедливый рабочий процесс — несите в комментарии. Обычно именно из них и получаются лучшие посты.

-----

Поляков считает — AI, код и кейсы
5
👍 4
🔥 2
50 2.8K
avatar
Поляков считает: AI, код и кейсы
@countwithsasha
03.06.2026 15:33
Поляков считает: AI, код и кейсы Фото: Барбершоп-тест: отечественным ИИ-моделям нужно следующее поколение. Жду Вчера писал, что GigaChat плохо подходит как сердце агента. По пути c подачи @evilfreelancer я обнаружил, что лучше запускать Гигачат через LiteLLM с флагом supports_function_calling: true С этим флагом вызов тулов становится адекватным, хотя бы на 1-2 шага. GigaChat Pro модель даже смогла найти филиал барбершопа. После этого я прогнал тот же барбершоп-кейс на разных моделях в OpenClaw. Агенту надо понять кривой запрос, найти нужный филиал, открыть запись, разобраться с мастерами и вытащить слоты. Обычно это заканчивается браузером, формой онлайн-записи YCLIENTS. 🧪 Что получилось GigaChat-2-Pro и GigaChat-2-Max провалились именно на вызове инструментов. В простых тестах, вроде «вызови web_search» функция вызывается. Но в реальном OpenClaw, где с самого старта около 60 000 символов системного промпта и 22 инструмента, модель начинает вести себя случайным образом. GigaChat Max в чистом прогоне получил 22 инструмента и не вызвал вообще ни одного. И это при том, что за 5 минут до Pro модель наконец начала вызывать тулы. На уточняющие сообщения тоже отвечал текстом: «перехожу к выполнению», «использую навык», «среди доступных навыков нет подходящего». Но действий не было. Особенно смешно, что Гигачат Pro на практике реально выглядит лучше чем Max. У Паши Злого скоро выйдет пост с бенчмарком PAC1 — это тест точности вызова инструментов. На его прогоне GigaChat-2-Pro набрал 37,2%, Max — 32,6%. Для сравнения: GLM, MiniMax, Kimi и Qwen держатся примерно в районе 72–74%. 🤖 А что другие модели 🚩 YandexGPT Pro оказалась самой бодрой из суверенных: агент сразу пошёл в инструменты и даже попробовал поискать в памяти. Это хороший знак. Но задачу всё равно не решил: нашёл адрес и часы работы филиала, а до мастера и слотов не дошёл. Плюс маленький контекст быстро привёл к схлопыванию истории, и продолжение сломалось. Тут главный минус — окно в 32 000 токенов. ✅ Kimi K2.6 задачу решила. Не идеально: понадобился пинок, было много лишних действий, но модель читала скилл, искала, ходила в браузер, дошла до YCLIENTS и вернула Михаила, цены и слоты. ✅ DeepSeek V4 Pro тоже решил после пинка. Первый проход упёрся в лимит 900 секунд, зато модель уже была в нужном месте. После пинка сразу выдала результат. По текущим ценам DeepSeek этот прогон стоил около 28 центов. В Гигачат такой же был бы 5 000 руб. 🚀 А теперь про суверенных агентов Проблем у нас сейчас две: 1. Модели Сбербанка не хотят вызывать тулы на сложных кейсах. В условиях: вызови web_search всё красиво, а в случае если: вот тебе 30 000 символов про семью Даши и Саши, вот тебе тулы включая генерацию картинок, найди барбершоп — всё ломается. 2. Модели Яндекса более активные, но дают преступно низкий размер контекстного окна. Да, можно постараться и контролировать контекст, но 32 тыс токенов по меркам 2026 года уже очень мало. Иной договор занимает больше токенов. Пока остается только ждать выхода новых моделей. Надеюсь, что добавят Кими, мощности для запуска есть, модель открытая, надо только указать, что это Кими, а не Гигачат. 🤔 На мой взгляд, суверенный ИИ должен быть не вывеской, а инфраструктурой, на которой можно строить продукты. Круто не когда модель своя, а когда ты внедрил ИИ в сложный процесс. Пока всё грустно. Суверенный ИИ стоит дорого, ощущение, что его даже не тестировали на чем-то сложнее get_weather и требует при этом корпоративного бюджета. Поделитесь, вот если бы в России была доступна модель уровня Кими или Дипсик, за адекватные деньги — вы бы пробовали делать агентов на ней? ---- Поляков считает — AI, код и кейсы
Перешел на DeepSeek v4 Pro для своих агентов, полёт нормальный

В марте я писал, что у меня на Mac Mini живет OpenClaw, который тратит 100 рублей в неделю. Логика была в покупке очень дешевых Plus подписок через https://lzt.market/llm/?order_by=price_to_up и подключение Codex подписок в CLIProxyAPI который прикрыт Cloudflare Warp.

С начала апреля к моей коллекции агентов добавился Hermes (и я точно могу сказать, что он не всегда круче глючного OpenClaw) потребление токенов увеличивалось.

🩼 Конечно это не могло нравится OpenAI

Такая схема у нас во внутренних кругах называется «абьюз подписок» — получение сервиса через нарушение условий его использования.

Anthropic за такое ранее банил аккаунты, OpenAI подключили смс-верификацию. Для получения смс и одноразовых номеров телефона я использовал https://smsfast.cc, в совокупности в конце мая уходило порядка 300-400 рублей на один аккаунт с подпиской Plus + подтверждение.

🤔 Короче я понял, что у меня уходит неприятно много времени на такой абьюз-менеджмент и стал морально готовиться к тому, чтобы платитить за API. Осталось найти кому.


🐳 DeepSeek продлил дисконт навсегда

Когда делал барбершоп тесты, я отметил DeepSeek v4 Pro как реальный конкурент SOTA моделей за супер-низкую цену. Тогда было майское промо — 1 доллар за миллион токенов. 22 мая DeepSeek написал твит, что промо продлевается навсегда. Вот тогда я решил, что можно смело мигрировать своих агентов с OpenAI GPT 5.4 на Deepseek.

Короче уже 5 дней я работаю через Дипсик и траты в сутки составляют в среднем полтора доллара. Месяц использования будет стоить около 50 долларов: дороже одной подписки плюс, но по лимитам на одной такой подписке было бы тесно.

⚠️ Я не использую OpenClaw и Hermes для кодинга и какого либо ассистирования в работе — только рутина: тулы для бронирования парковок, запись на стрижку и т д


🔬 Пара проверок

Основной работой агентов в моем случае является вызов различных тулов: заказ пропусков, парковок для гостей, стрижки, поэтому я решил проверить не только DeepSeek, но и локальные модели на бенчмарке PAC1 — чтобы сравнить, насколько они будут хорошо справляться с вызовом инструментов.

Тут есть еще и профессиональный интерес, так как я активно тестирую MCP для бронирования путешествий, там есть бенчмарк с эвалами и один из прогонов я делаю локальными моделями — чтобы понимать, как они держат большой контекст с кучей инструкций.

Короче сравнил на этом бенчмарке Опус без ризонинга и другие модели. Вывод — Дипсик близок к SOTA, надо брать.

Из интересного — результаты квантованного Qwen 3.6, я был очень удивлен, когда увидел, что он обходит полносвязную Gemma 4 — кажется отличный кандидат для туристического бенчмарка.

Короче говоря ставка на дорогих агентов, кажется будет скомпенсированна Китаем. Хочется верить, что осенью Сбер всё-таки выпустит обновление и сделает цены на свои модели преемлемыми.

Если у вас был опыт запуска агентов на локальных или недорогих моделях — буду рад отзывам в комментариях.

----

Поляков считает — AI, код и кейсы
🔥 17
👍 4
3
54 106 2.7K

Поляков считает: AI, код и кейсы

6.4K
Пишу про AI, вайбкодинг и кейсы применения. Связаться: @polyakovbest
Открыть в Telegram