AI да парень! / Sergei Notevskii
@sergeinotevskii
AI да парень! / Sergei Notevskii
Фото:
Длинный пост про длинные контексты.
Год назад нас дружно убеждали: "дайте модели больше контекста! пихайте все все что есть! больше контекста! еще больше!".
Да и модели вовремя подыграли: в релиз-нотах теперь везде красивые цифры по длине контекста - 1M, 2M, 10М токенов уже не вызывает ажиотажа.
Результат я сейчас вижу такой:
люди берут модель, пихают в неё гигантский кусок текста «на все бабки всю память», получают на выходе шлак, разочаровываются и делают вывод: "модель/ии хрень".
Проблема в другом.
1. Номинальный контекст vs эффективный
То, что модель поддерживает 1M токенов, вообще не означает, что она:
- одинаково хорошо работает на 4k, 32k и 512k,
- одинаково надёжно оперирует фактами из середины этой "простыни контекста".
Есть куча экспериментов на 10+ моделях, где берут классическую задачу «иголка в стоге сена»(на самом деле уже обычно 2+ иголки), увеличивают длину контекста и смотрят, что происходит.
Картинка повторяется:
- качество деградирует нелинейно и довольно рано — ещё на длинах порядка 4–32k,
- чем сложнее связь между вопросом и ответом (семантическая, а не по прямым словам), тем быстрее всё разваливается,
разные модели ведут себя по-разному.
Про это же хорошо видно в разных бенчмарках вроде BABILong и работ вроде NoLiMa и компании: не только важен предел контекста, но и график деградации качества по мере роста длины.
А вот арена где хорошо видно как деградирует качество ответов для популярных моделей.
На скрине к посту оно же - вверху новая топовая Gemini 3 Pro, посерединке gpt-4.1, а внизу не такой уж и плохой Qwen3-32b.
2. Context rot: когда контекст начинает «портиться»
Есть ещё один неприятный эффект: по мере того как мы:
- добавляем в контекст всё новые данные,
- таскаете за собой историю диалога, подсказки из RAG, «временную память» агентов
Качество ответа постепенно плывёт.
Модель начинает: путать свежие и устаревшие факты, реагировать на случайные куски, забывать, что было в начале.
Это сильно заметно когда по контексту распространены различные инструкции.
Вывод простой: длина и “загрязнённость” контекста бьют по качеству сильнее, чем мы привыкли думать.
Кстати, многие замечали, как «долгая память» в чатах иногда делает модель тупее и рассеяннее со временем. Это то же самое явление, просто в "бытовой" форме.
3. «Больше контекста» ≠ «лучше контекст»
Есть старый принцип у аудиоинженеров: garbage in - garbage out.
С контекстом так же, только хуже:
- каждый лишний токен снижает отношение сигнал/шум,
- модель хуже различает, что реально важно в задаче,
- и даже при идеальной архитектуре вероятность промаха растёт просто потому, что «пространство вариантов» становится огромным.
Ключевая мысль тут:
контекст - это не женская сумочка (ну вы поняли, в которую все влезет), а дорогой и ограниченный ресурс.
Не потому что токены стоят денег (хотя и это тоже), а потому что каждый лишний токен бьёт по качеству понимания задачи.
4. Что с этим делать на практике
Несколько практических выводов, которые я использую сам:
1. Не верьте цифре в документации как абсолюту.
Смотрите не только на “до скольки модель дотягивает”, а на то, как быстро падает качество уже на 32k.
К сожалению такие цифры достать тем сложнее чем новее и менее протестирована модель.
2. Тестируйте структуру контекста.
Модели чувствительны к тому, что вы кладёте в начало и конец. Критически важное - либо в самом начале, либо ближе к хвосту.
3. Режьте и сжимайте.
RAG, внешняя память, ножницы, саммаризация - это не “костыль”, это нормальный путь. Задача - оставить в окне только то, что реально нужно для данного запроса.
4. Разделяйте задачи.
Вместо одного монструозного промпта на 200k токенов лучше 3–5 специализированных шагов: каждый запрос делает одну вещь, но хорошо.
И главный тезис на сегодня:
«запихнуть всё в один огромный промпт» - это дорогой способ ухудшить качество.
Хабр
Синдром бесконечного окна: почему 1 миллион токенов в LLM не решает ваши проблемы (пока)
Привет, Хабр! Меня зовут Сергей Нотевский, я AI Platform Lead в Битрикс24. Год назад индустрия жила лозунгом «Scale is all you need», перекладывая его на размер контекстного окна. 32k казались...
8 1.2K
Обсуждение 0
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram