avatar
Refat Talks: Tech & AI
@nobilix
13.05.2026 17:06
Refat Talks: Tech & AI Фото: Кэш в LLM API. Один параметр, который может изменить всю экономику inference. На скрине сводка из эксперимента в одном из последних проектов, где используется Anthropic API, в котором кстати кэш не включен по дефолту. Собирался написать пост об этом, но наткнулся на разбор, который сделал это лучше. Сергей Нотевский написал подробную статью про экономику кэширования у разных провайдеров. В статье, помимо прочего: • почему два одинаковых запроса могут отличаться в цене в 3 раза • какие паттерны в промптинге незаметно убивают кэш • чем отличаются контракты кэширования у OpenAI, Anthropic и Gemini и почему миграция между ними роняет hit rate вдвое • как команда Manus снизила стоимость инференса в 10 раз тремя простыми практиками • почему Gemini Flash-Lite с кэшем оказывается дешевле DeepSeek в ~2.7 раза У Сергея вообще отличный канал, рекомендую подписаться @sergeinotevskii, там много практических постов, особенно на тему локальных LLM и есть другие разборы, например про проблемы большого контекстного окна. Так что воспользуюсь моментом и рекомендую канал Сергея)
К посту про кэш в LLM API подъехала новая порция полезностей, не пройти мимо.

Сергей выложил пачку статей на тему кэша в AI приложениях, я же хочу подсветить sernote/audit-prompt-caching - в этом репо Skill, который вы запускаете в своем проекте и агент проходится по реальному коду: проверяет шаблоны промптов, сборку tools и схемы, логику истории, конфиги роутинга, специфичные для провайдеров особенности (OpenAI / Anthropic / OpenRouter / vLLM). Включая пачку полезных скриптов, например статический анализатор истории LLM вызовов - что сделать чтобы улучшить попадание в кэш (= сделать AI приложение дешевле и быстрее).

Установка: npx skills add https://github.com/sernote/audit-prompt-caching --skill audit-prompt-caching

Даже просто прочитать references в репо - там краткие выжимки по каждому провайдеру со ссылками на актуальную доку. Полезность, короче.
Telegram
Refat Talks: Tech & AI
Кэш в LLM API. Один параметр, который может изменить всю экономику inference. На скрине сводка из эксперимента в одном из последних проектов, где используется Anthropic API, в котором кстати кэш не включен по дефолту. Собирался написать пост об этом, но наткнулся на разбор, который сделал это лучше. Сергей Нотевский написал подробную статью про экономику кэширования у разных провайдеров. В статье, помимо прочего: • почему два одинаковых запроса могут отличаться в цене в 3 раза • какие паттерны в промптинге незаметно убивают кэш • чем отличаются контракты кэширования у OpenAI, Anthropic и Gemini и почему миграция между ними роняет hit rate вдвое • как команда Manus снизила стоимость инференса в 10 раз тремя простыми практиками • почему Gemini Flash-Lite с кэшем оказывается дешевле DeepSeek в ~2.7 раза У Сергея вообще отличный канал, рекомендую подписаться @sergeinotevskii, там много практических постов, особенно на тему локальных LLM и есть другие разборы, например про проблемы большого контекстного окна. Так что воспользуюсь моментом и рекомендую канал Сергея)
21
🔥 13
👍 8
🎉 2
1 240 6.1K

Обсуждение 1

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

Refat Talks: Tech & AI

11.4K
Заметки про технологии, GenAI и глобал стартапы, прагматично и без лишнего хайпа. Эксперт по разработке и внедрению enterprise-grade AI автоматизаций, строю AI-first компании. Co-founder devstark.com и spreadsimple.com
лс @refatametov
Открыть в Telegram