avatar
AI да парень! / Sergei Notevskii
@sergeinotevskii
15.12.2025 08:37
AI да парень! / Sergei Notevskii Фото: Длинный пост про длинные контексты. Год назад нас дружно убеждали: "дайте модели больше контекста! пихайте все все что есть! больше контекста! еще больше!". Да и модели вовремя подыграли: в релиз-нотах теперь везде красивые цифры по длине контекста - 1M, 2M, 10М токенов уже не вызывает ажиотажа. Результат я сейчас вижу такой: люди берут модель, пихают в неё гигантский кусок текста «на все бабки всю память», получают на выходе шлак, разочаровываются и делают вывод: "модель/ии хрень". Проблема в другом. 1. Номинальный контекст vs эффективный То, что модель поддерживает 1M токенов, вообще не означает, что она: - одинаково хорошо работает на 4k, 32k и 512k, - одинаково надёжно оперирует фактами из середины этой "простыни контекста". Есть куча экспериментов на 10+ моделях, где берут классическую задачу «иголка в стоге сена»(на самом деле уже обычно 2+ иголки), увеличивают длину контекста и смотрят, что происходит. Картинка повторяется: - качество деградирует нелинейно и довольно рано — ещё на длинах порядка 4–32k, - чем сложнее связь между вопросом и ответом (семантическая, а не по прямым словам), тем быстрее всё разваливается, разные модели ведут себя по-разному. Про это же хорошо видно в разных бенчмарках вроде BABILong и работ вроде NoLiMa и компании: не только важен предел контекста, но и график деградации качества по мере роста длины. А вот арена где хорошо видно как деградирует качество ответов для популярных моделей. На скрине к посту оно же - вверху новая топовая Gemini 3 Pro, посерединке gpt-4.1, а внизу не такой уж и плохой Qwen3-32b. 2. Context rot: когда контекст начинает «портиться» Есть ещё один неприятный эффект: по мере того как мы: - добавляем в контекст всё новые данные, - таскаете за собой историю диалога, подсказки из RAG, «временную память» агентов Качество ответа постепенно плывёт. Модель начинает: путать свежие и устаревшие факты, реагировать на случайные куски, забывать, что было в начале. Это сильно заметно когда по контексту распространены различные инструкции. Вывод простой: длина и “загрязнённость” контекста бьют по качеству сильнее, чем мы привыкли думать. Кстати, многие замечали, как «долгая память» в чатах иногда делает модель тупее и рассеяннее со временем. Это то же самое явление, просто в "бытовой" форме. 3. «Больше контекста» ≠ «лучше контекст» Есть старый принцип у аудиоинженеров: garbage in - garbage out. С контекстом так же, только хуже: - каждый лишний токен снижает отношение сигнал/шум, - модель хуже различает, что реально важно в задаче, - и даже при идеальной архитектуре вероятность промаха растёт просто потому, что «пространство вариантов» становится огромным. Ключевая мысль тут: контекст - это не женская сумочка (ну вы поняли, в которую все влезет), а дорогой и ограниченный ресурс. Не потому что токены стоят денег (хотя и это тоже), а потому что каждый лишний токен бьёт по качеству понимания задачи. 4. Что с этим делать на практике Несколько практических выводов, которые я использую сам: 1. Не верьте цифре в документации как абсолюту. Смотрите не только на “до скольки модель дотягивает”, а на то, как быстро падает качество уже на 32k. К сожалению такие цифры достать тем сложнее чем новее и менее протестирована модель. 2. Тестируйте структуру контекста. Модели чувствительны к тому, что вы кладёте в начало и конец. Критически важное - либо в самом начале, либо ближе к хвосту. 3. Режьте и сжимайте. RAG, внешняя память, ножницы, саммаризация - это не “костыль”, это нормальный путь. Задача - оставить в окне только то, что реально нужно для данного запроса. 4. Разделяйте задачи. Вместо одного монструозного промпта на 200k токенов лучше 3–5 специализированных шагов: каждый запрос делает одну вещь, но хорошо. И главный тезис на сегодня: «запихнуть всё в один огромный промпт» - это дорогой способ ухудшить качество.
Поста (даже такого длинного) мне не хватило, развил тему до статьи на Хабр.
Читать тут.

И хорошего дня)
Хабр
Синдром бесконечного окна: почему 1 миллион токенов в LLM не решает ваши проблемы (пока)
Привет, Хабр! Меня зовут Сергей Нотевский, я AI Platform Lead в Битрикс24. Год назад индустрия жила лозунгом «Scale is all you need», перекладывая его на размер контекстного окна. 32k казались...
👍 13
🔥 8
❤‍🔥 3
😍 3
1
🤩 1
💋 1
👾 1
8 1.2K

Обсуждение 0

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

AI да парень! / Sergei Notevskii

4.8K
Про AI с ноткой иронии

Контакты:
ЛС - сообщения чата
https://instagram*.com/sergei_notevskii
https://ru.linkedin.com/in/sergeynotevskiy
* Принадлежит организации Meta, которая признана экстремистской и запрещена на территории РФ
Открыть в Telegram