avatar
AI и грабли
@oestick
30.07.2026 15:34
Никто не делится факапами

Выступал недавно на оффлайн конфе в Омске. Организация и доклады по качеству лучше чем на многих столичных конфах

Но что меня бесит вообще на любой из них – это что обычно все рассказывают истории успеха, а они почти всегда бесполезны – их сложно переложить на реальность вашей конкретной компании и команды

А если слепо повторять все действия, то это будет просто карго культ как у аборигенов, которые пытались воссоздать самолеты белых пришельцев, повторяя их форму из деревяшек в надежде, что они тогда полетят

Поэтому, хоть это и менее комфортно, но я стараюсь факапами. На этой конфе рассказывал не про то, как круто мы все внедрили AI в SDLC наших клиентов, а где и как проебались и как это потом исправляли. И вот эти факапы точно будут релевантны для большинства людей

Записи всех докладов с конфы можно получить за 10к

Там есть еще несколько крутых:
- про поверхности атаки на агентные системы и способы защиты от них
- про сложности работы AI систем с русским языком от рисерчера с лингвистическим бэкграундом (мы с ней на афтерпати забрали чью-то гитару и развлекали народ песнями, хах)
- и про кастомный сетап для AI разработки от Кости Доронина


Но я подумал, что не все захотят платить за записи и предложил оргам по нашей прошлогодней схеме дать подписчикам бесплатный доступ за подписки на нескольких спикеров

Так что платно забирать тут, а бесплатно – в моем ботике
22
🔥 7
👍 5
💯 2
💩 1
4 33 2.8K
avatar
AI и грабли
@oestick
29.07.2026 09:53
Из новых не особо документированных изменений в codex агент теперь сам может ходить в соседние диалоги и даже писать в них.

↑ Это не про субагентов, это прям полноценные чаты


Пока не придумал, как это прям эффективно использовать, но знаю, что позиционируется как одна из фишек нового голосового режима – голосом можно управлять всеми своими текущими чатами

Кто уже пользуется, накидайте в комментах кейсы, пожалуйста
🔥 29
2
👍 1
17 39 3.7K
avatar
AI и грабли
@oestick
28.07.2026 09:50
Все, с выходом Fable и 5.6 sol вы больше не должны понимать, что происходит у вас в коде. Не до всех еще дошло, но вы больше не software engineer, вы loop engineer

↑ Я думал, что это типичный твиттер шитпостинга, но реально начал видеть вокруг себя серьезных людей, кто так считает. Мол, раз у Бориса в антропике получается, то и мы так должны делать


Ну камон, ребят. Все же понимают, что публичные лица компаний, который продают лопаты всегда будут преувеличивать ценность этих лопат и формировать хайп, который через какое-то время действительно пушанет технологии до уровня, который они продвигали. Типичный fake it till your make it – так все технологии развиваются и всегда развивались. Но мы то с вами не обязаны собой жертвовать ради этого, ну

Почему я считаю, что сейчас это все еще не работает и хорошие инженеры должны понимать что происходит под капотом систем, которые они строят (даже если они строят их печатая/наговаривая английский/русский текст)?

Постараюсь порассуждать "из первых принципов":

Дело в том, что это всегда так и было – хороший инженер всегда понимал систему как минимум на один уровень абстракции ниже того, на котором её писал.

Хороший Python разработчик знает про GIL и 3.13, PyMalloc, сборщик мусора, ссылочную природу объектов, и что многие библиотеки написаны на других языках со своими ограничениями и возможностями. И для него код на пайтоне на самом деле раскрывается гораздо глубже чем он выглядит на первый взгляд – тот самый tacit context

Хороший C++ разработчик скорее всего знает не только про разные виды памяти, устройство умных указателей и виртуальные таблицы, но и в курсе про уровни хардварного кэша, особенности архитекутры процессора и хаки, которые использует компилятор для компиляции под эти архитекутры. И может даже знать, в какие конкретно ассемблерные инструкции раскроется его код. Понимает как треды устроены на уровне ОС, какие механизмы их переключения на уровне ядра, и как писать lock-free код

↑ Этого всего нет напрямую в синтаксисе языка. Это особенности поведения систем на гораздо более низких уровнях. И проблема в том, что если инженер их не знает, то он даже не знает чего он не знает. А значит, не узнает и о наличии проблем на этих уровнях.

В итоге прод ложится под растущей нагрузкой, баги не находятся неделями и затыкаются костылями, из-за которых прод снова ложится, но уже в следующем квартале

———

Короче, мало топить за loop enginering. Нужно понимать что в результате этих циклов получится

Так же как когда вы раньше писали цикл на C++, вы понимали, как данные будет лежать в кэше (и в каком), будут ли лишние аллокации в куче, и раскроется ли ваша числодробилка в SIMD-инструкции

В общем, это фундаментальное свойство любого профессионала – видеть систему глубже чем она описана

Подгорело, @ai_grably
68
👍 48
🔥 12
🤡 4
🌚 4
🤣 2
31 123 11.8K
avatar
AI и грабли
@oestick
27.07.2026 11:31
Разбор кейса с поиском работы

В начале лета я запостил тут всратый пост про набор на марафон в последний день этого самого набора 🤡

Это было странно, но я стараюсь перебарывать перфекционизм и запускать штуки как можно быстрее, чтобы замыкать свой собственный feedback loop, а не пытаться все заранее отполировать (чтобы все равно обнаружить, что реальность сложнее, чем можно предположить)

Так вот, тот марафон оказался офигенным! Много что было криво, но мы быстро перестраивались в процессе, и оттачивали формат прям в реальном времени

Реально, огромное удовольствие было читать отзывы (на скринах) – люди оценили и задачки почти без теории, и странный формат на вылет (на платном то курсе!), и даже общие задачки вместо заточенных на одну конкретную роль (а скорее показывающие универсальный подход).

Короче, все о чем меня предупреждали опытные курсоделы, что это не сработает

Мы скоро запустим второй поток, но прежде чем кто-то даст нам свои денюжки хочется дать какую-то ценность + показать, как примерно все устроено.

Поэтому завтра (28.07) в 18:00 по мск мы проведем эфир, где разберем одно из заданий, которое не влезло в программу – подбор агентом вакансий, подгон резюме под них и автоотклики. Посмотрим на типичные косяки агентов на таких задачах, научимся их исправлять, поделимся промптами и лайхаками.

Если хочется прям полное погружение – можно попробовать решить задачу заранее и приходить на разбор уже с вопросами (минимальная версия задания делается за 15 минут)

Рега на эфир и полная формулировка задачки [тут]

↓ Отзывы тут ↓
14
🔥 7
🎉 2
👍 1
🤔 1
🤨 1
2 27 3.9K
avatar
AI и грабли
@oestick
18.07.2026 15:24
Несуществующие агенты для аудио

В последнее время много работаю с генерацией аудио. И удивляет, что в основном аудио пайплайны собираются в условном comfy – визуальном блочном редакторе. Удивляет, потому что это как писать код пайплайном в n8n вместо клода/кодекса

Основная проблема тут – нет полноценного агентного цикла, где модель видит, а точнее слышит, результаты предыдущих действий и может сама выбирать что с этим делать дальше

Но тут есть одна техническая сложность, которая многое объясняет: у моделей пока тупо нет нативного восприятия аудио. Например, умение "видеть" картинки уже есть. Поэтому клод код может посмотреть скриншоты лендинга, который он сделал, увидеть косяки и поправить их. Картинки – в контексте той же модели, которая пишет код

А с аудио так не работает – большинство моделей не умеют в нативный аудио input

Вы скажете: так есть же gemini. Это да. Но: ни одна агентная обертка не поддерживает чтение аудио файлов чисто на уровне тулов. Агентный экзоскелет просто не может просунуть аудиофайл в API запрос к "мозгу".

Да, можно подключить gemini по api к основному агенту и отправлять туда аудио с промптом, мол "расскажи, чего не хватает" (кстати, китайская glm-5.2 все еще с картинками работает именно так). Но это все равно что глухой композитор, который зовет своего племянника послушать музыку и сказать, что он там слышит – работает, очевидно, плохо из-за эффекта глухого телефона

Вот и получается, что сейчас просто нет привычного нам агентного решения (со скиллами, запуском терминальных комманд, форками сессий, субагентами и т.д.), которое может полноценно работать с аудио (= замыкая фидбэк луп)

———

UPD: Спустя два часа после написания текста выше:

1. Собран простенький самодельный агент вокруг gemini на 300 js строк, с агентным циклом, интерактивностью, fork/edit/resume – чисто проверить подход

2. Это все перенесено в PI в виде экстеншна, который патчит тул чтения файлов (он там by design умеет и текст читать, и бинарные данные)

Короче, теперь добавить своему агенту "уши" можно в 1-2 строки:

npm install -g pi-agent
pi install git:github.com/toolittlecakes/pi-gemini-audio-read


(не забываем потом /login → google → api key и выбрать модель gemini-3.5-flash)

Где нужно: генерация музыки, качественные аудио переводы, работа с voice cloning, монтаж аудио (и видео, если это подкаст)

Ограничения: 20мб на файл – не добавлял загрузку файлов через file api. И нет видео инпута

Вообще, забавно, как вдохновляют задачки, у которых в целом нет существующего решения (по крайней мере публичного). Ощущение, что оказываешься на землях, где "ни ступала нога человека"


Репо
36
🔥 24
👍 14
👏 2
🤯 1
3 136 6.2K
avatar
AI и грабли
@oestick
13.07.2026 14:12
Хз как люди пользуются OpenRouter

По дурости тестили на нем систему, которая на локалках должна будет работать в контуре клиента, и это такая боль:

- низкие лимиты у провайдеров
- хрен пойми у кого реально есть поддержка structured output, даже если заявлено
- а у кого есть, часто некорректная – натолкнулся на имплементацию с сортировкой ключей в алфавитном порядке 🥴
- нет моделей в целевом кванте
- в какой-то момент провайдер просто лег на два часа (а другие не поддерживают норм SO для нужной модели, ага)

Да, можно сразу тестить на целевой системе, но а) это нужно получать доступ в контур клиента и б) ждать пока одна его карточка все обработает

А у нас autoresearch-like флоу, где агенты в 4 потока эксперименты крутят, нам такое не подходит

Короче, надо было сразу арендовать GPU и поднимать там, а не страдать херней. Благо это делается в один промпт (если настроено управление браузером):

Codex, сходи через мой браузер на hf и подними мне vLLM на h200 с <model-name> на <context-len> токенов максимального контекста с <concurrency-num> параллельных запросов. Посмотри в документации и на реддите рекомендации по конфигам и проверь, что мои требования вообще выполнимы или предложи трейдоф


P.s. если нужно часто, установите huggingface_hub и дайте токен админский, чтобы агент через браузер не мучался

P.p.s. не забываем потом остановить ноду, а то можно без штанов остаться (если хочется автоматически, юзаем scale_to_zero_timeout=20)

Альтернативы: runpod.io, vast.ai, modal.com, cloud.ru (не реклама, а зря)

Хз, для кого-то это очевидно, но у нас это первый проект, на котором сошлись локальные модели, отсутствие доступа к железу клиента, и огромный трафик autoresearch подхода
🔥 34
👍 8
1
🫡 1
35 137 7.4K
avatar
AI и грабли
@oestick
03.07.2026 07:31
Нужен GUI агент для опенсорсных моделей?

Пока нет ничего лучше OpenCode. Шутка.

Z.ai сделали не только топовую опенсорсную модель, но и свой гуи агент ZCode – клон Codex App

Но codex работает по дефолту только с Responses API (который никто кроме OpenAI нормально не поддерживает). А ZCode нативно поддерживает кастомные эндпоинты всех трех типов (chat.completions, responses, anthropic)

Управление с мобилки тоже есть, правда не через аппку, а через веб (зато не заблочат в сторах)

P.s. можно и к codex подключать разные модели через отдельный враппер (cliproxyapi), но такое не всем подходит
🔥 30
6
👍 3
40 128 9.1K
avatar
AI и грабли
@oestick
02.07.2026 10:00
Байки с полей

Сгонял в конце прошлой недели на Conversations, сейчас расскажу, что было интересного, а что полезного

Ну во первых, был очень рад контингенту на конфе – развиртуализовался с кучей селеб нашего ИИ-пузыря – от Ромы Куцева из llmarena и vsellm до Ярослава Шмулева из R77, попил пива с шашлыками у Валеры Ковальского и покатался на тачке Глеба Кудрявцева

Но мы же на такие конфы не за этим ездим? Вернее не только за этим

Если прям честно, я очень хотел пообщаться с ребятами из реального сектора (всегда говорю, что там гораздо больше простор для оптимизаций и гораздо меньше экспертизы как ее делать)

И они там были. Я смог добраться до КМЗ (Кенгиссепский Машиностроительный Завод), Московского Метро и еще кое-каких нефтянников. Ну все, похвастался, теперь расскажу, какие сейчас запросы нарыл:

- голосовой ввод для инспекторов ОТК (которые руками проверяют изделия)
- контроль рабочего времени конструктора (по камерами и записи экрана)
- сравнение цен/условий закупок у поставщиков
- и поиск у них просрочек + оформление претензий
- автоматизация ввода первички и номенклатур + регистрация чертежей в их системе
- семантическая аналитика 500 млн чат бот сессий в месяц
- ну и конечно, q&a боты по базе знаний компании (нормативка, поставщики, рынок и т.д.)

Еще из любопытного, узнал в кулуарах про схему, когда на тендер залетает компания однодневка, жестко демпингует, а потом требует откупные, чтобы выйти из тендера. А если не дать, то они выиграют тендер и потом ничего не будут делать, только жрать месяцы простоя, пока не получиться их выпнуть через юристов.

Из решений – нанять нормального тендерного специалиста, который поможет так составить тендер под конкретную компанию, что такие паразиты в него не пролезут

Ну и еще есть всратая история, как одна девушка смогла без опыта устроиться дата аналитиком не скажу куда, чтобы клеить CEO. И наняла себе реального аналитика за часть зп, чтобы он закрывал её таски. Эффективный менеджмент, получается. И такое бывает, вау

P.s. короче, конфа – огонь, теперь еду в мск на Agentic Dev Conf, приходите слушать доклад, зовите пить пиво
44
🤣 29
🔥 21
🏆 3
24 63 7.9K
avatar
AI и грабли
@oestick
01.07.2026 21:21
Астрологи объявили неделю fable 5, количество упоминаний Антропик в ИИ каналах увеличилось втрое (а сна – уменьшилось вдвое)

А если по сути, то гоняем в хвост и гриву до 7 июля на все 50% подписки и ждем GPT-5.6

Как человек, который успел провести в обнимку с ней двое суток, гонять советую на задачах, где нужно много неявного контекста, а старые модели не улавливают "вайба". Это либо архитектура core компонентов и либ, либо сложные рефакторинги, либо дизайн экспериментов

Короче, задачки, где нужно понимание "на кончиках пальцев". В остальных разницу скорее всего не заметите, не тратьте токены

UPD: reddit для вдохновения
💯 20
🔥 14
6
👍 4
🤔 1
🥱 1
🐳 1
14 37 6.8K
avatar
AI и грабли
@oestick
29.06.2026 11:25
Чем CC на самом деле круче Codex с точки зрения бизнеса?

В целом, будем честны, они уже плюс-минус одинаковые. Да, Claude лучше делает UI, а Codex педантичнее следует правилам. Обгоняют друг друга по разным фичам, но в основном в мелочах

Но есть одна особенность, которая может быть критической при выборе Codex vs Claude Code для компании. По крайней мере, для тех компаний, где разрешен гитхаб

Это automations (codex) vs routines (cc)

Просто один из самых частых запросов у бизнеса сейчас:

1. Научите наших доменных экспертов автоматизировать себе задачки
2. А потом сделайте, чтобы часть задачек запускалась в фоне, чтобы не тратить на них фокус (и не продалбываться)

Переход из первого во второе можно сделать с помощью Automations в кодексе

Но они работают только когда устройство включено. Так еще и хочется запускать их не только по таймеру, но и по какому-то событию (aka вебхук)

И честный переход в автономный режим означает деплой собственной системы, а это сразу приседания с CI/CD, Docker, Cron и кучей других слов, которые доменные эксперты учить не будут

Так вот, Routines в Claude Code берут это на себя – там вы пушите проект с AGENTS.md и скиллами на гитхаб (проверено, с этим справляются вообще все) и антропик сможет разворачивать его в своей песочнице, отправляя прописанный промпт

Можно по таймеру, можно по событию (вебхуки)

Главный вопрос – а че там с секретами для коннекторов: достаточно просто скопировать .env с нужными токенами прям в окне настройки

Короче, вся сложность по деплою, триггерам, и т.д. антропики берут на себя

И для компаний, где не достаточно разрабов на создание такой инфраструктуры, либо просто не хочется собирать велосипед – это прям киллер фича

@ai_grably
🔥 31
9
🤔 9
👍 4
👀 2
30 115 7.2K
avatar
AI и грабли
@oestick
22.06.2026 18:54
Только сейчас узнал про флаг, который включает в codex'е request_user_question. Он и раньше был, но работал только в режима планирования, которым я не пользуюсь

[features]
default_mode_request_user_input = true



С чем особенно хорошо работает (в AGENTS.md):

Ты сам автономно идешь до результата, пока путь ожидаемый. Если уперся в неожиданную проблему – не нужно скрытно костылить воркэраунд. Правильно – объяснить проблему и дать варианты ее решения (и обхода). Иначе – будем ходить костыльными путями, а пользователь даже не будет в курсе


Бтв, узнал про флажок в чатике курса от @the_ai_architect, мб вы тоже не знали
43
👍 17
🔥 10
🥱 1
25 293 8.2K
avatar
AI и грабли
@oestick
20.06.2026 20:58
Лечим Dictation

Мой Wispr Flow чет совсем испортился, а вот встроенный диктейшн в Codex App – очень хорош. Но сделать нормально, чтобы он работал по всей системе (пост) у openai так и не получилось – у меня стабильно теряет результат

Психанул, раздебажил Codex App (благо написан на электроне), нашел internal url и параметры запроса, и воткнул его как новую модель в Handy – опенсорсный аналог Wispr Flow

Кастомные эндпоинты в Handy прописывать нельзя, так что он был быстренько клонирован и запатчен

Промпт для повторения:

Сделай кастомный Handy с моделью `Codex Dictation`.

Важно знать заранее:

Endpoint:
POST https://chatgpt.com/backend-api/transcribe

Auth читать кодом из локального Codex:
~/.codex/auth.json

Поля:
- tokens.access_token → `Authorization: Bearer ...`
- tokens.account_id → `ChatGPT-Account-Id: ...`, если есть
- refresh_token и id_token не использовать

Headers:
- originator: codex_desktop
- User-Agent: Codex Desktop/26.611.62324

Body:
multipart/form-data
- file: audio bytes, audio/wav, filename handy.wav
- language: optional; `auto` не отправлять; `zh-Hans/zh-Hant` → `zh`

Response:
```json
{ "text": "..." }
```

Склонируй github.com/cjpais/handy, найди, что в нем поменять, чтобы нативно встроить Codex Dictation в список моделей, собери приложение и установи



Так Handy будет мимикрировать под вызов из Codex App
Для работы нужен аутентифицированный codex (берем его секреты)

Disclaimer: это может являться нарушением ToS OpenAI, хотя мы тут просто получаем сервис, который нам обещают (если используем локально)


@ai_grably
🔥 60
19
👍 5
🤝 5
🤯 2
🌚 1
64 246 7.4K

AI и грабли

13K
Строил HR продукты для американского бигтеха. Внедряю AI в бизнес, пишу про свои ошибки и находки

Co-founder https://entropy.talk и https://grably.tech

@nikolay_sheyko
Открыть в Telegram