сбежавшая нейросеть
@ai_exee
Встречаем новый эпизод сериала “Дядюшка Боб и ИИ-агенты”!
Но сначала – краткое содержание предыдущих серий: Роберт “дядюшка Боб” Мартин — инженер-ветеран, соавтор Agile-манифеста и автор книги Clean Code. Ее суть: ваш код будут перечитывать десятки раз — пишите его нормально.
А этим летом “дядюшка Боб” потряс сообщество признанием: он больше не вычитывает ИИ-код построчно – человеческая медлительность съедает ускорение от нейронок.
Вместо этого он выстроил рой из шести агентов. Я разбирал в лонгриде, как они работают: агенты делят постановку задачи, написание кода и проверки. Боб же согласовывает задачу и принимает результат.
А теперь Боб пишет: пока он полировал систему, необходимость в столь жестком управлении, по его оценке, отпала в большинстве случаев. Значительную задачу можно поручить одному агенту с несколькими указаниями и вернуться через 40 минут. Обычно хватает пары доработок.
Что же пришло на место “роя”. Во-первых, Мартин полюбил спорить с Grok и Codex по поводу своих новых проектов. И признает, что иногда принимает их аргументы.
Во-вторых, фирменная “полоса препятствий” никуда не делась: написанный с помощью ИИ код Мартин все так же обкладывает серией тестов.
В-третьих – и это добавка от меня, в посте этого нет – под результатом работы все равно стоит “подпись” Мартина. И это главная человеческая роль: даже качественный ИИ-результат может оказаться… плохим. Саймон Уиллисон как-то рассказывал о своем опыте создания игры с помощью Claude Fable 5. Модель очень старалась, предусмотрела кучу мелочей и сделала игру, в которой с технической стороны не было серьезный проблем, но которая… была просто скучной.
Когда я начинал работать с ИИ, придумал “правило шести месяцев”: если человек говорит, что нейронка с чем-то не справилась, спроси, давно ли он пробовал. Прошло полгода – стоит повторить.
Потом правило сократилось до трех месяцев. Теперь меняется его суть: если полгода назад вы научились что-то делать с ИИ, проверьте, не устарели ли приёмы. Возможно, новые модели делают это проще и лучше.
Пока писал этот пост, придумал и пример. Я до сих пор по привычке советую коллегам и здесь в блоге простую вещь – если диалог с моделью затянулся, то сделайте саммари и начните новый. Если модель выдала важный результат, то запустите новый чат – и проверьте его там, чтобы ИИ не был предвзят из-за того, что проверяет свою собственную модель.
Однако сам я из лени все реже делаю так и все чаще – прошу модель перепроверить себя в том же чате. И не вижу случаев, когда эта проверка была бы поверхностной.
Другой пример – context rot. Для моделей Claude долгое время было принято считать, что при долгом диалоге они тупеют из-за загрязнения контекста противоречащими вещами. Даже стала популярной формула: при 1M контекста целиком его можно использовать только для монолитных текстов (например, большая книга) или кодовых баз. В остальных случаях стоит останавливаться на 40-50% контекста, а затем думать, как его ужать – иначе модель начнет сильно тупить.
Но сегодня я весь день работал вместе с Claude Fable 5.1 над сложным лонгридом, постоянно гоняя модель по тексту – здесь проверить, здесь переписать, здесь выполнить поиск и уточнить.
Сейчас набрал /context и присвистнул – 670K токенов, значительно выше рекомендованного порога. И модель вообще не тупит – она отлично ориентируется в тексте, помнит правки, которые мы делали в самом начале.
От рекомендаций пока не отказываюсь, но понимаю, что в ближайшие дни надо будет прогнать серию более глубоких текстов, а также посмотреть, что пишут коллеги.
Ну а потом “дядюшка Боб” выдаст очередную истину и опять что-то придется переделывать с нуля.
—
Кстати, по следам нового заявления Мартина я с помощью GPT-6 обновил лонгрид о том, как он программирует. Там по-прежнему много полезного: описание тестов из «полосы препятствий» и рассказ о том, как применять подходы Мартина в других интеллектуальных задачах.
Да и от самой связки агентов я бы пока не отказывался – в некоторых задачах она остается полезной в том числе по словам самого Мартина.
— Читаем здесь.
Но сначала – краткое содержание предыдущих серий: Роберт “дядюшка Боб” Мартин — инженер-ветеран, соавтор Agile-манифеста и автор книги Clean Code. Ее суть: ваш код будут перечитывать десятки раз — пишите его нормально.
А этим летом “дядюшка Боб” потряс сообщество признанием: он больше не вычитывает ИИ-код построчно – человеческая медлительность съедает ускорение от нейронок.
Вместо этого он выстроил рой из шести агентов. Я разбирал в лонгриде, как они работают: агенты делят постановку задачи, написание кода и проверки. Боб же согласовывает задачу и принимает результат.
А теперь Боб пишет: пока он полировал систему, необходимость в столь жестком управлении, по его оценке, отпала в большинстве случаев. Значительную задачу можно поручить одному агенту с несколькими указаниями и вернуться через 40 минут. Обычно хватает пары доработок.
Что же пришло на место “роя”. Во-первых, Мартин полюбил спорить с Grok и Codex по поводу своих новых проектов. И признает, что иногда принимает их аргументы.
Во-вторых, фирменная “полоса препятствий” никуда не делась: написанный с помощью ИИ код Мартин все так же обкладывает серией тестов.
В-третьих – и это добавка от меня, в посте этого нет – под результатом работы все равно стоит “подпись” Мартина. И это главная человеческая роль: даже качественный ИИ-результат может оказаться… плохим. Саймон Уиллисон как-то рассказывал о своем опыте создания игры с помощью Claude Fable 5. Модель очень старалась, предусмотрела кучу мелочей и сделала игру, в которой с технической стороны не было серьезный проблем, но которая… была просто скучной.
Когда я начинал работать с ИИ, придумал “правило шести месяцев”: если человек говорит, что нейронка с чем-то не справилась, спроси, давно ли он пробовал. Прошло полгода – стоит повторить.
Потом правило сократилось до трех месяцев. Теперь меняется его суть: если полгода назад вы научились что-то делать с ИИ, проверьте, не устарели ли приёмы. Возможно, новые модели делают это проще и лучше.
Пока писал этот пост, придумал и пример. Я до сих пор по привычке советую коллегам и здесь в блоге простую вещь – если диалог с моделью затянулся, то сделайте саммари и начните новый. Если модель выдала важный результат, то запустите новый чат – и проверьте его там, чтобы ИИ не был предвзят из-за того, что проверяет свою собственную модель.
Однако сам я из лени все реже делаю так и все чаще – прошу модель перепроверить себя в том же чате. И не вижу случаев, когда эта проверка была бы поверхностной.
Другой пример – context rot. Для моделей Claude долгое время было принято считать, что при долгом диалоге они тупеют из-за загрязнения контекста противоречащими вещами. Даже стала популярной формула: при 1M контекста целиком его можно использовать только для монолитных текстов (например, большая книга) или кодовых баз. В остальных случаях стоит останавливаться на 40-50% контекста, а затем думать, как его ужать – иначе модель начнет сильно тупить.
Но сегодня я весь день работал вместе с Claude Fable 5.1 над сложным лонгридом, постоянно гоняя модель по тексту – здесь проверить, здесь переписать, здесь выполнить поиск и уточнить.
Сейчас набрал /context и присвистнул – 670K токенов, значительно выше рекомендованного порога. И модель вообще не тупит – она отлично ориентируется в тексте, помнит правки, которые мы делали в самом начале.
От рекомендаций пока не отказываюсь, но понимаю, что в ближайшие дни надо будет прогнать серию более глубоких текстов, а также посмотреть, что пишут коллеги.
Ну а потом “дядюшка Боб” выдаст очередную истину и опять что-то придется переделывать с нуля.
—
Кстати, по следам нового заявления Мартина я с помощью GPT-6 обновил лонгрид о том, как он программирует. Там по-прежнему много полезного: описание тестов из «полосы препятствий» и рассказ о том, как применять подходы Мартина в других интеллектуальных задачах.
Да и от самой связки агентов я бы пока не отказывался – в некоторых задачах она остается полезной в том числе по словам самого Мартина.
— Читаем здесь.
❤ 24
👍 16
🔥 11
44 3.9K
Обсуждение 0
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram