avatar
AI да парень! / Sergei Notevskii
@sergeinotevskii
11.05.2026 15:39
Завтра подвезу сразу 2 полезных артефакта про кэширование префиксов, а пока у меня вопрос.

В сообществе вижу что многие "создатели" систем на базе AI вообще не запариваются (а иногда и не знают) о том что такое "кэшированные токены". И это интересно - потому что постоянно встречаю англоязычные статьи от "великих", о том как кэш-токены сэкономили им кучу денег, и вообще считают попадание в кэш одной из главных метрик LLM-подкапотных систем.
А еще - прямая очевидная корреляция метрики с потраченными деньгами.

Но возможно "умные" люди просто молчат)

Давайте проверим.
Telegram
AI да парень! / Sergei Notevskii
Кэш кэш кэш... Есть одна история, которая сильно влияет на экономику и скорость llm в проде и при этом имеет, на первый взгляд одновременно супер простое применения. Как это модно называть «быстрая победа». Я про префикс-кэш (prefix_cache). Идея одним предложением: если начало вашего запроса к модели повторяется - вы перестаёте каждый раз заново “прогревать” модель этим началом. И внезапно улучшается и latency, и cost. И я искренне удивляюсь, когда инженеры-строители ai-сервисов пренебрегают этим* Это же не 3% оптимизации ⡘⠚⡒⠖⠙ ⢤⠨⠱⡆⡢⠑⢡ ⠍⡅ ⠖⠬⣠ ⣐⡢⣈⢡ ⡌⢈⠪⡅⣠ ⢊⡄⢁⣐⢆⠖, а жирная ручка, которая при правильной архитектуре запроса позволяет сэкономить десятки процентов костов. Попадать в кэш (cache hit rate) настолько важно, что про это пишут уважаемые дяди и компании в своих статьях: - В летней статье Manus, про опыт вынесенный с построения их агента, первое по важности о чем говорит автор - попадать в кэш. - Тиктоки рассказывают как оптимизировали своего внутреннего ai-агента и получили 40–50% экономии "за считанные строки кода". По факту все что нужно сделать это: 1. Следить за тем чтобы префикс был стабильным. Классика жанра - timestamp где-нибудь в начале. Дату указали, скидку отменили. 2. Контекст по возможности наращиваем (Append-only). 3. В случае с локальным хостингом чуть сложнее - нужно самим регулировать куда вести запросы так чтобы они лучше попадали в кэш (тут помогут всякие ray serve, или хотя бы разделение пулов с инстансами vllm). 4. В случае с maas - соблюдать условия кэша (напр. OpenAI кэширует автоматом одинаковый префикс больше 1к токенов в запросах чаще 5 минут), либо помечать блоки кэша насильно (Claude и один из вариантов кэшей Gemini). *Ладно, еще удивляют 2 другие вещи по кэшу: - Вендоры которые не предоставляют возможность использовать префикс кэш (у OpenAI, Anthropic и Гугла он есть) - Люди которые считают стоимость модели по стоимости токенов без учета скидки за кэш у вендора
😁 6
👍 5
💯 4
5 17 2.4K

Обсуждение 5

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

AI да парень! / Sergei Notevskii

4.8K
Про AI с ноткой иронии

Контакты:
ЛС - сообщения чата
https://instagram*.com/sergei_notevskii
https://ru.linkedin.com/in/sergeynotevskiy
* Принадлежит организации Meta, которая признана экстремистской и запрещена на территории РФ
Открыть в Telegram