avatar
AI-Driven Development. Родион Мостовой
@ai_driven
25.06.2026 11:32
AI-Driven Development. Родион Мостовой Фото: OS Deep Cleaner + Health Checker: новый кейс с кодагентами С чего бы это в канале про AI кодинг я рассказываю об очистке мака и поддержании его в здоровом состоянии? Да все дело в том, что ваш покорный слуга в последнее время весьма активно начал работать в 4-5 параллельных сессий (почти как Борис Черный), а также еще и использовать субагентов. С чем я столкнулся работая в таком режиме? (помимо ментального перегруза) - да банально с тем, что ПК стал перегружаться - ЦП на 100%+, RAM в минусе и т.д., а в некоторые моменты мак и попросту аварийно вырубался с фатальной ошибкой. Так вот, после очередного такого фейла всей системы после перезагрузки я отправил Opus разбираться в реальных причинах такого падения и в том и как его избежать в дальнейшем. Здесь важно отметить, что перед запуском расследования я попросил клода провести исследование в интернете о том, как бы профессиональный инженер из Apple проводил такое расследование - выяснить его подходы и методологию. Исследование выявило несколько проблем, но ключевая в нехватке места на диске для файла подкачки. И вот тут начинается самое интересное. Ранее для периодической чистки диска я использовал Mole - у него несколько режимов работы, но основной просто сканирует кеши инструментов разработки (npm, brew, cargo, gradle, pip и прочее), плюс чистит системные логи и temp-файлы старше недели - это команда mo clean. И есть ещё mo purge, который сканирует уже поумнее - находит dev-проекты по маркер-файлам (package.json, Cargo.toml, *.csproj и т. д.) и предлагает снести node_modules, target, bin/obj и прочее регенерируемое. И изначально я завернул эти команды в скилл, которым периодически проходился по системе. Но в реальности этого, конечно, мало - в системе в самых неожиданных местах появляются папки на десятки гигабайт, которые тихонько лежат на диске до тех, пока кто-нибудь не начнет искать большие файлы/папки каким-нибудь сканом. Почему бы такой скан тоже не завернуть в скилл? А почему бы еще не научить скилл определять разные другие пути в которых может лежать мусор? И вообще, пусть скилл себя ведет как опытный сисадмин - предлагая разных стоящих кандидатов к удалению. И зацените еще в какую красивую HTML-ку агент заворачивает отчет для выбора списка на удаление (на скрине) - есессно, списочек итоговый вы сами определяете (с оптимальными дефолтами, ведь UX наше всё). Предупреждаем беду Ок, уже получилось довольно круто. Но что если мы со всеми этими бесконечными сессиями забыли о том, что нам периодически нужно запускать чистку - в этом случае в какой-то момент опять может случиться маковский BSOD. Тогда почему бы нам не добавить проактивный режим - а именно, вотчер, наблюдающий за системой и сообщающий нам о надвигающихся проблемах по тригеру. Сказано - сделано: LaunchAgent раз в 5 минут проверяет: диск меньше 10%, memory pressure Critical вместе со swap больше 8 ГБ, и появление новых JetsamEvent файлов с тегом vm-compressor-space-shortage (это как раз про мой кейс). При триггере - macOS уведомление через alerter. Отмечу, что у скилла есть неплохой список чувствительных мест, которые трогать не стоит, поэтому он достаточно уверенно сам подсвечивает исключения. Вообще, в итоге получилась на удивление идеальная чистилка, которая еще и понятным языком объясняет значения каждого кандидата. Чистилка на голову выше всего софта для очистки, что я видел раньше. Хоть в продукт заворачивай :) У себя я совершенно безобидно вычистил около 150 гбайт. Ссылка на скилл: https://github.com/CodeAlive-AI/ai-driven-development/tree/main/skills/maintaining-macos-health (звезды сюда, если оказалось полезно). P.S. PR с адаптацией под Windows приветствуется. @ai_driven | AI-Driven Development. Родион Мостовой.
OS Deep Cleaner теперь доступен для Windows.

Напомню, что это безопасная и мега удобная чистилка ОС, реализованная в виде скилла для агента - он сначала анализирует систему, находит как мусор/кеш и тд, так и большие файлы, затем позволяет пользователю выбрать что убрать, а что оставить. Без подтверждения ничего не удаляет, а каждый кандидата на удаление поясняет.

Версия для Windows: https://github.com/CodeAlive-AI/ai-driven-development/tree/main/skills/maintaining-windows-health

Версия для macOS: https://github.com/CodeAlive-AI/ai-driven-development/tree/main/skills/maintaining-macos-health
GitHub
ai-driven-development/skills/maintaining-windows-health at main · CodeAlive-AI/ai-driven-development
Practices, protocols, and skills for AI-driven software development. Skills and safety hooks for Claude Code, Codex, OpenCode, Cursor, Antigravity, and any agent supporting the Agent Skills standar...
👍 7
2
4 43 937
avatar
AI-Driven Development. Родион Мостовой
21.06.2026 17:26
Уря! Выпуск про .net уже доступен для просмотра. И все равно мы там в середине скатились в обсуждение clean code, solid и потом заели все агентами 🙂 https://www.youtube.com/watch?v=7uj6IxxW13w

Альтернативные ссылки: Аудио | vk
YouTube
Как Microsoft развивает .NET: производительность, Developer Experience и AI / Сергей Тепляков #88
🔹 Присоединяйся к курсу «ИИ для разработчиков» https://ru.hexlet.io/programs/ai-for-developers?utm_source=youtube Кажется, впервые за последние двадцать лет разработчики всерьёз перестали понимать, что будет ценным через пять лет. Языки программирования стремительно сближаются, архитектурные войны теряют смысл, а AI уже сегодня пишется значительная часть кода. На этом фоне особенно интересно посмотреть на экосистемы, которые пережили несколько технологических эпох и продолжают меняться быстрее многих новых игроков. В гостях Сергей Тепляков — разработчик с более чем двадцатилетним опытом, Microsoft MVP, автор одного из самых известных русскоязычных блогов о .NET и инженер, который последние 12 лет работает в Microsoft. Мы поговорили о том, как менялся C# от «клона Java» до одного из самых быстро развивающихся языков индустрии, почему .NET Core стал переломным моментом для всей экосистемы и как внутри Microsoft принимаются решения, влияющие на миллионы разработчиков по всему миру. Отдельно обсудили инженерную сторону больших систем: производительность, внутреннее устройство рантайма, эволюцию TypeScript, роль Андерса Хейлсберга, компромиссы между архитектурой и скоростью разработки, а также реальные кейсы, когда знание внутренних механизмов платформы позволяло находить и устранять проблемы, которые невозможно увидеть на уровне обычного прикладного кода. Большая часть разговора неожиданно ушла далеко за пределы самого C#. Мы поговорили о паттернах проектирования, SOLID, «Чистом коде» Роберта Мартина, причинах популярности этих идей и о том, почему многие опытные инженеры со временем начинают смотреть на архитектуру совсем иначе. Обсудили, что на самом деле стоит за понятиями связанности, ответственности, тестируемости и почему формальные принципы нередко оказываются менее полезными, чем понимание фундаментальных причин их появления. Получился разговор одновременно про C#, архитектуру, инженерное мышление и будущее профессии. Один из тех выпусков, где обсуждение конкретной технологии постепенно превращается в попытку понять, куда вообще движется разработка программного обеспечения. Полезные ссылки: Youtube: https://www.youtube.com/@DissectingTheCode, Linkedin: https://www.linkedin.com/in/sergeyteplyakov/ X: https://x.com/steplyakov Github: https://github.com/SergeyTeplyakov https://dometrain.com/ Подписывайтесь на канал «Организованное программирование» в Telegram: https://ttttt.me/orgprog – Список подкаст-платформ (Apple Podcast, Google Podcast, Spotify, Яндекс.Музыка и другие): https://podcast.ru/1734325321 - Смотрите нас на площадке "Вконтакте" - https://vkvideo.ru/video-224967259_456239328 🔹 Курсы по искусственному интеллекту: https://ru.hexlet.io/courses_artificial-intelligence?utm_source=youtube 🔹Хекслет Клуб в Telegram https://t.me/HexletClubBot В этом видео: 00:00 Ввдение: от блогера до Principal в Microsoft: путь длиной в 20 лет 02:56 Что скрывается внутри Microsoft: BuildXL, гигантские билды и наука о счастье разработчиков 07:58 Гений за C# и TypeScript: как Андерс Хейлсберг переписал компилятор и ускорил его в 5 раз 21:42 На чём на самом деле написан Microsoft: почему C++ не умирает, а C# захватывает Azure 29:06 «C# — только для Windows»? Миф, который до сих пор мешает языку расти 38:30 От клона Java до собственного пути: как C# стал одним из самых продуманных языков 44:00 Full Framework против .NET Core: почему один мир застрял в прошлом, а другой рванул вперёд 53:25 Всё ещё на C# 7.3? Фичи последних лет, которые экономят часы работы каждый день 56:37 Реклама: Hexlet и будущее агентной разработки 57:18 Следующая эволюция C#: union-типы, records и идеи, которые пришли из других языков 59:30 Span, память и скорость: как .NET научился конкурировать с Rust и C++ 1:05:23 Структурная или номинальная типизация: спор, который когда-то разделил индустрию 1:09:45 Что ещё можно добавить в C#? Кажется, язык уже почти всё умеет 1:12:04 Монады проиграли? Почему индустрия выбрала Result и прагматичный подход 1:13:18 Разгром «Чистого кода»: что не так с SOLID и почему дядька Боб оказался неправ 1:20:56 Реклама: Telegram…
12
4 21 1.8K
avatar
AI-Driven Development. Родион Мостовой
@ai_driven
21.06.2026 17:26
Вижу Сергея Теплякова - ставлю лайк. Сергей - один из самых хардкорных чуваков из мира .NET (один только его доклад про отладку асинхронного кода чего стоит) и довольно известный деятель в индустрии. Он автор книги "Шаблоны проектирования на C#", которая в до ИИ эпоху у меня была настольной. А ещё, Сергей всегда очень интересно рассказывает. В общем, не могу с вами не поделиться. За ИИшку и всякие солиды ребята тоже поговорили.
Спасибо Кириллу за такого крутого гостя: @orgprog489

По теме выпуска поделюсь сразу своими мыслями. Я раньше с большим интересом следил за обновлениями своего, можно сказать, родного языка C# - кайфовал когда появился NRT (nullable ссылочные типы, нынче это база во многих современных ЯП), радовался всяким switch expression, pattern matching и тд и очень ждал появления поддержки discriminated union, (которого, кстати, так до сих пор и нет). Так вот, для меня лично, с появлением и развитием агентной разработки, практически все вопросы фич языка потеряли смысл по очевидной причине - 99% я теперь пишу на русском или на английском языке. Больше того, я убежден, что, как минимум, для условных MVP уже можно в принципе выбирать тот ЯП, который лучше подходит под решение конкретной задачи - я сам уже успешно пишу программы на Python, TypeScript, Go и даже на Swift когда это нужно. Мне, кстати, представляется, что в большинстве случаев, когда мы говорим о бытовом софте с веб интерфейсом: full stack TypeScript + какой-нибудь ultracite может быть лучшим выбором по умолчанию. Вот такие мысли у меня.
А что вы думаете про новые фичи в ЯП и про возможность выбрать ЯП под задачу?

@ai_driven
4
2 14 1.6K
avatar
AI-Driven Development. Родион Мостовой
@ai_driven
21.06.2026 08:02
Тут друг нашего канала Глеб Кудрявцев запускает новый поток по вайбкодингу. Я отправил на него своего брата (он у меня композитор, на секундочку!), расскажу вам потом про результаты по итогу. Может, даже стрим с ним сделаем про его путь (надеюсь не забросит).

@gleb_pro_ai625
Telegram
Глеб Кудрявцев про AI
Если вы по каким-то причинам еще не вайбкодите, но зачем-то читаете меня, то объявляю last call на третий поток курса по вкатыванию в вайб-кодинг. Стартуем 22 июня, уже в этот понедельник. Инструменты развиваются стремительно, поэтому собрал офигенную обновленную программу под современные реалии. Расскажу и покажу, как делать ботов, сайты, мобильные приложения. Помогу с настройкий и покупкой необходимых инструментов. Рассказываю не просто «что и как», но еще и «почему», короче, до кучи это экспресс-курс по вкатыванию в архитектуру современного IT Курс веду лично, так что вы все узнаете непосредственно от меня, а не в десятом перессказе 🙂 Отзывы и подробную программу смотрите тут: https://glebkudr.com/courses/vibecoding Скидка 10% по промокоду GLEB3 💵
11
👎 4
2 1.5K
avatar
AI-Driven Development. Родион Мостовой
Переслано от Глеб Кудрявцев про AI
21.06.2026 08:00
Если вы по каким-то причинам еще не вайбкодите, но зачем-то читаете меня, то объявляю last call на третий поток курса по вкатыванию в вайб-кодинг.

Стартуем 22 июня, уже в этот понедельник. Инструменты развиваются стремительно, поэтому собрал офигенную обновленную программу под современные реалии.

Расскажу и покажу, как делать ботов, сайты, мобильные приложения.
Помогу с настройкий и покупкой необходимых инструментов.
Рассказываю не просто «что и как», но еще и «почему», короче, до кучи это экспресс-курс по вкатыванию в архитектуру современного IT

Курс веду лично, так что вы все узнаете непосредственно от меня, а не в десятом перессказе 🙂

Отзывы и подробную программу смотрите тут: https://glebkudr.com/courses/vibecoding

Скидка 10% по промокоду GLEB3 💵
👍 6
👎 3
3 4 1.1K
avatar
AI-Driven Development. Родион Мостовой
@ai_driven
19.06.2026 12:34
Голосовой ввод + параллельная работа агентов

Вы же уже используете голосовой ввод? И агентами параллельными наверняка работаете над одним проектом. Там есть тонкая грань между worktrees и no worktrees - я обычно использую ворктри при параллельной работе над большими фичами, а если же ведется точечная работа не очень большими ченжсетами, то часто достаточно правильно проинструктировать агентов.
В общем, вот неплохой сетап для вашего AGENTS.md / CLAUDE.md при AI-Native разработке, который должен упростить жизнь вам и вашим агентам:

## Workflow

- Parallel agent sessions may work on this project at the same time. Treat unexpected file changes as legitimate work by another correctly running agent unless there is clear evidence otherwise. Do not clean, revert, overwrite, reformat, or "fix" changes you did not make. If your work conflicts with concurrent changes, pause briefly, re-read the affected files and `git status`, then retry with a smaller, targeted change that preserves the other agent's work. If the conflict still cannot be resolved safely, stop and explain the conflict instead of forcing your version.
- Tasks in this project are often dictated by voice and transcribed through ASR, so task text may contain recognition errors, especially in technical terminology, names, commands, and product terms. When the intended meaning is clear from repository and club-agent context, infer the likely intended term and proceed. When the ambiguity materially affects the implementation or safety of the work, ask the user for a concise clarification before continuing.
- At the end of every agent session, commit completed work to the local Git repository.
- Do not push commits unless the user explicitly asks for or approves a push.


Это, конечно, чисто под AI-native сетап. Главное тут то, чтобы агенты уважали работу друг друга и никогда не портили ее, и то, чтобы работа ведется через голосовой ввод, в котором могут возникать ошибки - чтобы агент либо догадывался если очевидно, либо спрашивал вас в противном случае.

Upd: Для ASR использую Codex. Он с недавних пор умеет на уровне ОС тоже работать, а задачи на русском языке надиктовываю.

@ai_driven
👍 9
6
16 51 1.6K
avatar
AI-Driven Development. Родион Мостовой
@ai_driven
18.06.2026 22:37
Похоже, что последнее обновление Codex App врубило какую-то дико назойливую песочницу, которая задает кучу лишних вопросов когда не надо, да еще и с ходу не отключается.
В общем, нашел как отключить полностью.
В файле ~/.codex/config.toml нужно указать:
default_permissions = ":danger-full-access"
approval_policy = "never"


Как обычно, используем осторожно. Обязательно в связке с собственными хуками типа моих.

@ai_driven
Telegram
AI-Driven Development. Родион Мостовой
Safety Hooks моей мечты Наконец-то сделал хуки моей мечты - достаточно безопасные и практически без false-positive. Хуки вымученные, эволюционировали на граблях можно сказать. Собсна, любой, кто проработал с агентами какое-то время отлично знает, что иногда они чудят, удаляя лишнее - папки, докер образы или даже целые базы вместе с инфрой. И их важно вовремя ловить за руку. Хуки - это важнейшая часть работы с кодинг агентами, привносящая в них не только детерменированности, но и безопасности. Соответственно, когда хуков нет совсем или их мало, безопасность хромает - агент может уронить базу, сделать rm rf и тд, а если хуков слишком много , то... вы привыкаете клацать Enter на Allow, уже даже не читая о чем вообще сыр-бор. Поэтому, нужен тонкий баланс и хуками важно закрывать только действительно деструктивные, необратимые или критические действия. Ну, и сразу второй нюанс - для блоков я предпочитаю использовать ask хуки вместо блокирующих, т. к. агенты нынче слишком умные и получив блокирующий хук, наверняка…
12
9 55 1.9K
avatar
AI-Driven Development. Родион Мостовой
@ai_driven
18.06.2026 18:39
"Исходи из того, что пьяный пользователь использует наш продукт"

Вы же знаете как я люблю UX (понятность и удобство продукта)? В общем, небольшой, но очень мощный пет-проект сейчас пилю для безопасного хранения API ключей и прочих секретов, там немало GUI/CUI и в очередной раз сталкиваюсь с тем, что агент делает плохой UX, его постоянно приходится поправлять. Добавил вот такую строчку в AGENTS.md, чтобы поправлять его не так часто:

For every product-facing change, think through the "drunk user" path: a tired, distracted, impatient user should still understand what just happened, what is safe to click next, and whether the system is waiting, broken, or done. Avoid ambiguous labels, hidden toggles, silent waits, stale loading states, and choices that require remembering implementation details. Prefer one explicit next best action.


Т. е. "При каждом изменении продукта, продумывай флоу с точки зрения пьяного пользователя". Понятно, что не панацея, но точно сильно лучше, чем ничего. Увы, так получается, что программисты сами часто не понимают как сделать хороший UX/DX. И вообще, мало кто понимает. А лучшим UX-чекапом будет наблюдение за вашим целевым пользователем-человеком за тем, как он использует ваш продукт с нуля без всяких объяснений.
И повторюсь, что я искренне верю, что будь в приложениях продуманный UX, люди в мире был бы немного счастливее :)

P.S. Много о чем есть рассказать на тему безопасности в эпоху агентной разработки - напишите в комментариях какие конкретно сабтопики для вас наиболее актуальны. И напомню про свои хуки безопасности для агентов, которыми делился недавно.

@ai_driven
👍 17
😁 6
21 54 1.9K
avatar
AI-Driven Development. Родион Мостовой
@ai_driven
17.06.2026 10:03
Друзья, через пол часа стартуем стрим с Иваном Закутным, будем говорить про ошибки Spec-Driven Development - у Ивана очень интересный практический опыт на эту тему.

Стартуем в 13:30 МСК, 15:30 по Алматы: https://youtube.com/live/N01bvw44P60?feature=share
YouTube
Когда Spec-Driven Development хуже вайб-кодинга? Иван Закутный и Родион Мостовой.
Tg-канал Родиона AI-Driven Development: https://t.me/ai_driven Tg-канал Ивана: https://t.me/neuralstack
👍 16
42 2K
avatar
AI-Driven Development. Родион Мостовой
@ai_driven
16.06.2026 20:55
И... тут дядя Боб свой опенсорсный оркестратор зарезил с акцентом на локальные модели: https://github.com/unclebob/swarm-forge
Интересно, что написан он на Clojure... А файлы CLAUDE.md/AGENTS.md отсутствуют, так что не знаю что и думать)
Еще из забавного - мне казалось, что может быть интересным покопаться в его промптах. И там действииельно есть такая строка Prefer the Babashka APS tools for gherkin-parser - "бабашка"?? какая-то секретная техника от дедушки дядюшки Боба подумал я... но нет, просто популярный интерпретатор для Clojure. Вот так вот, век живи, век учись :)

А если серьезно, то даже в том же промпте Боб Мартин упомянает, к примеру, crap4clj - а это как раз нишевая, но очень интересная метрика от Google, которая пытается <объективно> оценить качество кода, на основе его цикломатической сложности и % покрытия тестами - я, кстати, давно хотел посвятить этой метрике отдельный пост и прикольно, что дядюшка эту метрику тоже использует - учитесь, вайбкодеры ;))

А сворм этот если кто попробует - расскажите. Пока выглядит скорее загадочно.

@ai_driven
👍 11
4
16 54 2K
avatar
AI-Driven Development. Родион Мостовой
@ai_driven
16.06.2026 20:20
GLM 5.2 - чуть лучше GPT 5.5 в SWE-Marathon

Как вам задача переписать Kubernetes на Rust?
Или создать копию Slack?
Безумие - скажете вы? "SWE-Marathon" скажут ребята из Abundant.
Бенмарк измеряет сразу несколько вещей:
1. Прежде всего, автономность - то есть возможно агента крутиться без пинков до решения задачи столько, сколько нужно. Размер задачи там 7.6M токенов в медиане и 877.4M в пределе.
2. Внимательность к контексту - на длительных задачах навык модели удерживать контекст, не теряя цели и детали крайне важен.
3. Агентность, т. е. способность грамотно применять tools use (function calling).
4. И... Честность. Да, да, каким-то моделям более свойственно читерить, каким-то менее - то есть, некоторые модели банально хакают тесты и подстраиваются под них (ну, вы и сами знаете). Модели в целом довольно ленивы, как правило, а некоторые еще и жульничают. Любопытно, кстати, что этот показатель зависит не только от модели, но и от обвязки (harness).
Собсна, мне этот бенч особенно понравился, т. к. крупные автономные задачи на тысячи и десятки тысячи строк в моем воркфлоу - довольно типичная история, и это как раз про марафон. Спасибо Ибрагиму, что показ мне этот бенч у нас на недавнем стриме.
Так вот, интересно, что новенькая GLM 5.2 там выбивает очень бодрые результаты на уровне GPT 5.5. Из неочевидного: токенов при этом выжирает почти в 8 раз больше, чем GPT 5.5, при том, что из топов жульничает меньше всех. Моделька открытая, т. е. потенциально организации могут такую мощь и в закрытом контуре развернуть. Ждем в ближайшее время на OpenCode Go и на Synthetic.
Напоследок, поворчу про бенч: вообще, такие задачи нужно как минимум в режиме /goal запускать, а по-хорошему на кастомном поэтапном флоу (а-ля ultracode только более контролируемом). Следов goal я paper не нашел, поэтому задал вопрос одному из авторов в X.

Там, кстати, еще Kimi K2.7 Code - пробовал кто ее? В OpenCode Go вижу уже доступна. Бенчей нормальных они, к сожалению, не дали.
И подключайтесь завтра в 13:30 МСК, 15:30 по Алматы на стрим с Иваном Закутным, будем говорить про ошибки Spec-Driven Development: https://youtube.com/live/N01bvw44P60?feature=share

Бенчмарк SWE-Marathon, блогпост по GLM 5.2.

@ai_driven | AI-Driven Development: Родион Мостовой.
11
👍 10
2 39 1.7K
avatar
AI-Driven Development. Родион Мостовой
@ai_driven
14.06.2026 14:06
Друзья, познакомлю вас со своей замечательной сестрой - Кариной. Она у нас профессиональная актриса и певица - играет главные роли в спектаклях и дает концерты. А еще она занимается подготовкой к публичным выступлениям таких, как мы с вами - программистов, лидов и стартаперов. Я лично привел к ней нескольких своих друзей и они в полном восторге от занятий (уверенность в себе подросла, выступления проходят совсем на другом уровне, работа стала еще успешнее и вот это вот все ).
В общем, с чистой совестью пиарю Карину в своем канале и горячо ее рекомендую всем, кто хотел прокачать голос и скилл публичных выступлений.
По поводу занятий пишите ей в личку: см. комментарий к посту.

Еще, Карина только что запустила свой tg-канал про публичные выступления, так что если тема для вас актуальна или может стать актуальной в будущем, то подписывайтесь смело: @golosmost
Telegram
Карина Мостовая| Голос и публичные выступления
Тренер по голосу и публичным выступлениям, актриса и певица IT, стартапы, публичные выступления — для тех, кто много говорит и хочет делать это в кайф. Голос — это не только про звук. Это про то, как близко ты подпускаешь себя к себе. @mostovaya_karina
19
👎 11
6 5 2.2K
avatar
AI-Driven Development. Родион Мостовой
@ai_driven
13.06.2026 17:11
Забрали Фейбл? Вы расстроились?

Я расстроился. Мне очень понравилась новая модель и я уже даже начал планировать пост в с юзкейсами в канал.
А ключевые юзкейсы там если кратко - это задачи, с которыми модели предыдущего поколения все еще справляются плохо: продумывание нестандартной архитектуры, поиск запутанных и очень сложных багов, помощь с генерацией действительно качественного контента. Словом, кажется, что у этой модели появился тот самый мифический judgement ("суждение"), о котором писали в Sequoia. Это то, что часто называют вкусом или насмотренностю и то, что предлагалось не делегировать LLMкам.
Так вот, все-таки у большинства вайб-кодеров и agentic engineers такие задачки возникают не часто, поэтому подход с usage-based для этой модели меня лично не сильно огорчил - результат бы точно стоил своих денег, с учетом точечного использования.

Так забрали или нет?
Сейчас обсуждают и переживают о том, что антропики теперь будут проверять паспорт у пользователей и давать доступ только гражданам США.
Только вот "проблема" в том, что и это не ограничит людей без американского паспорта от использования Фейбл+ моделей.
Цены по API на перепродажу таких моделей просто скакнут немного. Короче, кому надо доступ-то все равно получат. А простым вайб кодеры вроде нас с вами жизнь подусложнят.
Так вот, антропики в любом случае обещали доступ к Фейбл после 22-го июня перевести на usage-based - т. е., фактически, на оплату за токены. А когда доступ откроют гражданам США, то довольно быстро и у остальных появится возможность использовать эту замечательную модель, только с оплатой за токены (ага, считайте все тот же usage-based).
Раньше санкции на USA-LLM обходили только из подсанкционных стран, теперь (если так пойдет) штаты вынудят на обход и все остальные страны.
А вообще, идея ограничивать что-то по национальному или расовому признаку мне крайне неблизка, да и делать так по-моему не очень умно.
И, конечно, трудно придумать более мощный PR для Антропик, чем подобные события.

@ai_driven | AI-Driven Development: Родион Мостовой.
👍 15
👎 3
6 6 2.7K
avatar
AI-Driven Development. Родион Мостовой
@ai_driven
08.06.2026 11:54
Бенчмарки! Новый митап про DeepSWE, SWE-rebench v2 и др

Друзья, вы все еще верите бенчмаркам? Я вот все меньше. Наверняка уже все видели DeepSWE бенчмарк - пожалуй, наиболее противоречивый бенчмарк за последнее время, причем с полярными мнениями: для одних это единственный объективный бенчмарк, для других он абсолютно не имеет отношения к реальности. В общем, я подумал, что будет интересно разобраться глубже в современных бенчмарках - обсудить их достоинства и недостатки, чтобы понимать есть ли вообще смысл обращать внимание на SWE бенчмарки в 2026-м. Отдельно разберем обновленный SWE-rebench v2.
На митап мы позвали, вероятно, наиболее подкованного человека из русскоязычного пространства - Ибрагима Бадертдинова, он один из ключевых авторов бенчмарка SWE-rebench, который как раз недавно обновили. А еще, Ибрагим автор канала @c0mmit. А неудобные вопросы будет задавать горячо любимый друг нашего канала Максим Этихлид (@etechlead).

Будем обсуждать важность harness, утечки, бенчхакинг, важность флоу проекта (AGENTS.md, верификации и т. д.) и, конечно, методологии.

Дата и время: 9 июня 14:00 по МСК, 16:00 по Алматы, 13:00 CET, 12:00 по Лондону.
Ссылка на регистрацию на встречу.

Готовьте свои коварные вопросы, ведь будет уникальная возможность задать их Ибрагиму - автору одного из топовых бенчмарков.



Кстати, у нас было интервью с Ибрагимом, в котором мы разбирали подробно бенчмарк SWE-rebench, поэтому рекомендую к просмотру всем AI-энтузиастам и в качестве подготовки к нашему новому стриму: https://youtu.be/a5jf-kyV12Y

@ai_driven | AI-Driven Development: Родион Мостовой.
Luma
Можно ли верить SWE бенчмаркам в 2026? Прожарка бенчмарков от профи. DeepSWE, SWE rebench v2, Terminal Bench 2.1... · Luma
Друзья, вы все еще верите бенчмаркам? Я вот все меньше. Наверняка уже все видели DeepSWE бенчмарк - пожалуй, наиболее противоречивый бенчмарк за последнее…
👍 10
12 31 5.2K
avatar
AI-Driven Development. Родион Мостовой
@ai_driven
08.06.2026 08:10
[2/2] Пример промпта для кодинг агента на Июнь 2026

Давай добавим нового агента для супер глубокого и скрупулезного исследования контекста и назовем его `ScrupoloAgent`. У него будет 3 tools: get_ontology, read_file (с обязательным указание диапазона строк при чтении для экономии контекста), ask (вызывает @ContextResearchAgent.cs ). См. @agent-development.md.

Идея в том, что этот Scrupulo - фактически техлид-менеджер, который может итеративно задавать любые вопросы к ContextResearchAgent, относящиеся к теме, в тч уточняющие, чтобы предельно глубоко разобраться в теме. У нас уже есть отличный промпт deep режима для этих целей в @codealive-app/src/agents/CodeAlive.Agents/Prompts/codebase/context-research-agent-prompt.liquid , возьми deep промпт в основу для Scrupolo Agent. Scrupolo может вызывать ContextResearchAgent в параллель. Важно, что Scrupolo должен сделать минимум 3 вызова ContextResearchAgent прежде, чем отвечать на вопрос, а финальным шагом Scrupolo должен разрешить все противоречия и неоднозначности через верификацию через четение файлов и дополнительные вызовы ask если нужно; а если какие-то из противоречий достоверно разрешить не удается, то Scrupolo в своем ответе в таких места должен так явно и указать, что "участок/утверждение противоречивое и достоверно разрешить противоречие не удалось".

Главным агентом (Scrupulo) пусть будет qwen3.5-397b-a17b max, а для ContextResearchAgent используй qwen3.6-35b-a3b max (в deep режиме).

Нужно сначала покрыть этого агента минимальными тестами в CodeAlive.Agents.

Затем когда все будет готово прогнать этого агента через бенчмарка RepoQA - при этом важно четко фиксировать токены главного - то, как нужно расширить трейсинг и бенчмарк для грамотного учета токенов, цен и тулов главного агента и субагенов продумай через отдельного субагента на opus max. Таблицу Runs в бенчмарке тоже нужно будет обновить соответствующим образом. В самом конце - запусти opus max субагента провести глубокое ревью, а также убедись, что все консистентно.

В основной флоу CodeAlive Scrupolo пока интегрировать не нужно - сейчас нужна только качественная реализация, верификация через тесты и прогон через RepoQA (agent-framework).

Начни с глубокого исследования контекста CodeAlive через субагентов + в параллель через /codealive-context-engine на основе кода и примеров выясни как в agent-framework эффективно делать мульти-агентную систему с учетом лучших практик, fault tolerance и тд, можешь даже еще одного агента в интернет отправить изучать актуальный контекст лучших практик по мультиагентным системам в 2026-м.
Как только будет готов план, сохрани его в @specs и проведи ревью через Codex GPT 5.5 xhigh и улучши план, затем приступай к реализации.

Делай системно, не срезая углов. Если после исследования ко мне останутся вопросы - задавай.


Если внимательно вчитаться, немало интересных фишек можно почерпнуть.
Ах да, конкретно эту задачу запускаю через Opus 4.8 ultracode. Но в GPT 5.5 high в такой формулировке должно работать не хуже. Ну и примечательно, что еще пол года назад подобный промпт практически не имел бы никакого смысла, в виду своей сложности и отсутствия поддержки субагентов.

PS. Кстати, как вам название для нового агента? :)



@ai_driven - AI-Driven Development. Родион Мостовой
👍 19
🤯 3
14 94 2.6K
avatar
AI-Driven Development. Родион Мостовой
@ai_driven
08.06.2026 08:10
[1/2] Пример промпта для кодинг агента на Июнь 2026

Для контекста
Мы доделали новый бенчмарк QA по кодовой базе для CodeAlive, и в нем у нашего context research агента получились на удивление достойные результаты, в которых qwen3.6-35b-a3b сопоставима с Opus 4.8 по точности и полноте ответов по цене в ~30 раз дешевле - все-таки хорошо приготовленный RAG с векторным поиском + узкий агент с правильными тулами дает потрясающие результаты. Интересно, что в определенный момент мы и не думали тягаться по качеству с топовыми агентами, а скорее выбрали стратегию усиления Claude Code, Codex, Cursor и других агентов контекстом через обогащение их контекста по MCP или через скиллы. Теперь же, когда оказалось, что узко-специализированный harness на on-prem моделях, заточенный строго под исследование контекста может тягаться с топовыми агентами и моделями, наши амбиции преумноежелись и мы подумали, почему бы нам на основе нашего агента не реализовать мультиагентную систему, которая будет итеративно вызывать CodeAlive-субагентов до тех пор, пока точно не докопается до истины? Наш бенчмарк показывает, что такая система будет работать точнее, чем популярные кодагенты, собирая действительно полную картину (что особенно важно в крупных enterprise системах), а еще и делать это сильно дешевле. Ведь с точки зрения ROI (а компании обычно именно так измеряют пользу), это означает, что CodeAlive позволит им выполнять ряд задач на небольших моделях по цене в десятки раз дешевле (или даже практически бесплатно на локальных моделях), вообще не теряя в качестве, а где-то даже приобретая.
Сказано - сделано, агенты уже трудятся. Собственно, промпт на эту задачу получился на столько примечательным, что я решил им поделиться с вами. Поясню на всякий случай, что в данном случае кодагент разрабатывает другого агента на основе .NET фреймворка agent-framework.

Продолжение.
👍 6
3
2 51 2.2K
avatar
AI-Driven Development. Родион Мостовой
@ai_driven
22.05.2026 15:28
OS Deep Cleaner + Health Checker: новый кейс с кодагентами

С чего бы это в канале про AI кодинг я рассказываю об очистке мака и поддержании его в здоровом состоянии? Да все дело в том, что ваш покорный слуга в последнее время весьма активно начал работать в 4-5 параллельных сессий (почти как Борис Черный), а также еще и использовать субагентов. С чем я столкнулся работая в таком режиме? (помимо ментального перегруза) - да банально с тем, что ПК стал перегружаться - ЦП на 100%+, RAM в минусе и т.д., а в некоторые моменты мак и попросту аварийно вырубался с фатальной ошибкой.
Так вот, после очередного такого фейла всей системы после перезагрузки я отправил Opus разбираться в реальных причинах такого падения и в том и как его избежать в дальнейшем. Здесь важно отметить, что перед запуском расследования я попросил клода провести исследование в интернете о том, как бы профессиональный инженер из Apple проводил такое расследование - выяснить его подходы и методологию.
Исследование выявило несколько проблем, но ключевая в нехватке места на диске для файла подкачки. И вот тут начинается самое интересное. Ранее для периодической чистки диска я использовал Mole - у него несколько режимов работы, но основной просто сканирует кеши инструментов разработки (npm, brew, cargo, gradle, pip и прочее), плюс чистит системные логи и temp-файлы старше недели - это команда mo clean. И есть ещё mo purge, который сканирует уже поумнее - находит dev-проекты по маркер-файлам (package.json, Cargo.toml, *.csproj и т. д.) и предлагает снести node_modules, target, bin/obj и прочее регенерируемое. И изначально я завернул эти команды в скилл, которым периодически проходился по системе. Но в реальности этого, конечно, мало - в системе в самых неожиданных местах появляются папки на десятки гигабайт, которые тихонько лежат на диске до тех, пока кто-нибудь не начнет искать большие файлы/папки каким-нибудь сканом. Почему бы такой скан тоже не завернуть в скилл? А почему бы еще не научить скилл определять разные другие пути в которых может лежать мусор? И вообще, пусть скилл себя ведет как опытный сисадмин - предлагая разных стоящих кандидатов к удалению. И зацените еще в какую красивую HTML-ку агент заворачивает отчет для выбора списка на удаление (на скрине) - есессно, списочек итоговый вы сами определяете (с оптимальными дефолтами, ведь UX наше всё).

Предупреждаем беду
Ок, уже получилось довольно круто. Но что если мы со всеми этими бесконечными сессиями забыли о том, что нам периодически нужно запускать чистку - в этом случае в какой-то момент опять может случиться маковский BSOD. Тогда почему бы нам не добавить проактивный режим - а именно, вотчер, наблюдающий за системой и сообщающий нам о надвигающихся проблемах по тригеру.
Сказано - сделано: LaunchAgent раз в 5 минут проверяет: диск меньше 10%, memory pressure Critical вместе со swap больше 8 ГБ, и появление новых JetsamEvent файлов с тегом vm-compressor-space-shortage (это как раз про мой кейс). При триггере - macOS уведомление через alerter.
Отмечу, что у скилла есть неплохой список чувствительных мест, которые трогать не стоит, поэтому он достаточно уверенно сам подсвечивает исключения.

Вообще, в итоге получилась на удивление идеальная чистилка, которая еще и понятным языком объясняет значения каждого кандидата. Чистилка на голову выше всего софта для очистки, что я видел раньше. Хоть в продукт заворачивай :) У себя я совершенно безобидно вычистил около 150 гбайт.

Ссылка на скилл: https://github.com/CodeAlive-AI/ai-driven-development/tree/main/skills/maintaining-macos-health (звезды сюда, если оказалось полезно).

P.S. PR с адаптацией под Windows приветствуется.

@ai_driven | AI-Driven Development. Родион Мостовой.
👍 32
18
5 137 3K

AI-Driven Development. Родион Мостовой

5.1K
Увлекательно рассказываю про AI в разработке, про построение продуктов с LLM под капотом и иногда про .NET.
Связь: @rodion_m_tg
Чат: @ai_driven_chat
Открыть в Telegram