Как тратить на LLM не 20-30% выручки, а 5-10%?
– учитесь писать харнессы
Попросил диприсёрч проанализировать слитые исходники Claude Code (OpenCode), опенсорсные OpenClaw, Hermes и других ребят – и собрал супер-мега-полезный playbook по упаковке контекста в своём агенте в виде скилла для Клода
TL;DR: это поможет вам максимизировать cache hit % и снизить себестоимость своего AI-продукта в 3-5 раз
Мини-ликбез для тех, чей CTO работает по подписке:
1) 99% LLM (включая ChatGPT, Claude, Gemini) работают на одной архитектуре - трансформеры. По умолчанию, трансформер на каждый ваш запрос пересчитывает с нуля весь промпт - системную инструкцию, всю историю разговора, ваш новый вопрос. Если в инструкции 10 000 токенов, а вы дописали 50 - она честно прогоняет вычисления по всем 10 050
2) Провайдеры поняли, придумали
кеширование промпта. Если начало вашего нового запроса точно совпадает с началом предыдущего - модель не пересчитывает его заново, а берёт готовый результат из памяти.
Те токены, которые "попали в кеш", стоят в 10 раз дешевле. Пример из документации OpenAI:
https://developers.openai.com/api/docs/guides/prompt-caching
3)
Cache hit rate – это % токенов вашего запроса, которые удалось переиспользовать из кеша. 0% – ничего не сэкономили, платите полную цену. 90% –
платите ~10% от обычного. Это и есть та переменная, которая отделяет AI-продукт со здоровой экономикой от продукта, который сжигает деньги / перепродаёт токены с минимальной наценкой
4)
Правило большого пальца, чтобы попадать в кеш: то, что не меняется (статическая часть) – в начало запроса, то, что меняется/дополняется каждый раз (динамическая часть) – в самый конец. Звучит банально, но 90% команд кладут в начало системной инструкции текущую дату / ID сессии / метку из аналитики / цель (либо злоупотребляют вставками/плейсхолдерами внутри промпта) – и получают 0% попадания в кеш. Каждый запрос для модели выглядит «новым», даже если отличается на 10-20 токенов где-то вначале
5) Норма для хорошо спроектированного AI-агента –
80–90% cache hit rate. Claude Code (агент от Anthropic, на котором сидят разработчики) держит
92% в проде, и команда объявляет инцидент, если показатель проседает
Внутри скилла в папке references/ покрыты все основные провайдеры: Anthropic, OpenAI, Gemini, self-hosted, OSS-agents, а также бенчмарки по индустрии
Обсуждение 9
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram