avatar
BOGDANISSSIMO
@bogdanisssimo
15.05.2026 12:17
BOGDANISSSIMO Мне тут Клод наоптимизировал CI/CD во всех репозиториях, получил ускорение порядка x7-10 в разных проектах (с 5-8 минут до 40-50 сек) Не то, что бы там супер-много гениальных вещей, но думаю будет полезно другим. Оформил сразу скиллом для удобства
Как тратить на LLM не 20-30% выручки, а 5-10%?

– учитесь писать харнессы

Попросил диприсёрч проанализировать слитые исходники Claude Code (OpenCode), опенсорсные OpenClaw, Hermes и других ребят – и собрал супер-мега-полезный playbook по упаковке контекста в своём агенте в виде скилла для Клода

TL;DR: это поможет вам максимизировать cache hit % и снизить себестоимость своего AI-продукта в 3-5 раз

Мини-ликбез для тех, чей CTO работает по подписке:

1) 99% LLM (включая ChatGPT, Claude, Gemini) работают на одной архитектуре - трансформеры. По умолчанию, трансформер на каждый ваш запрос пересчитывает с нуля весь промпт - системную инструкцию, всю историю разговора, ваш новый вопрос. Если в инструкции 10 000 токенов, а вы дописали 50 - она честно прогоняет вычисления по всем 10 050

2) Провайдеры поняли, придумали кеширование промпта. Если начало вашего нового запроса точно совпадает с началом предыдущего - модель не пересчитывает его заново, а берёт готовый результат из памяти. Те токены, которые "попали в кеш", стоят в 10 раз дешевле. Пример из документации OpenAI: https://developers.openai.com/api/docs/guides/prompt-caching

3) Cache hit rate – это % токенов вашего запроса, которые удалось переиспользовать из кеша. 0% – ничего не сэкономили, платите полную цену. 90% – платите ~10% от обычного. Это и есть та переменная, которая отделяет AI-продукт со здоровой экономикой от продукта, который сжигает деньги / перепродаёт токены с минимальной наценкой

4) Правило большого пальца, чтобы попадать в кеш: то, что не меняется (статическая часть) – в начало запроса, то, что меняется/дополняется каждый раз (динамическая часть) – в самый конец. Звучит банально, но 90% команд кладут в начало системной инструкции текущую дату / ID сессии / метку из аналитики / цель (либо злоупотребляют вставками/плейсхолдерами внутри промпта) – и получают 0% попадания в кеш. Каждый запрос для модели выглядит «новым», даже если отличается на 10-20 токенов где-то вначале

5) Норма для хорошо спроектированного AI-агента – 80–90% cache hit rate. Claude Code (агент от Anthropic, на котором сидят разработчики) держит 92% в проде, и команда объявляет инцидент, если показатель проседает

Внутри скилла в папке references/ покрыты все основные провайдеры: Anthropic, OpenAI, Gemini, self-hosted, OSS-agents, а также бенчмарки по индустрии
prompt-caching-playbook.skill
25.38 КБ
🔥 38
7
👍 2
🦄 1
9 360 4.3K

Обсуждение 9

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

BOGDANISSSIMO

7K
Я фаундер https://vibe.dating: ИИ, который помогает переписываться с девушками (120,000+ скачиваний)

Следующая цель: $100K в месяц

Для консультаций @uberkinder
Открыть в Telegram