avatar
Валера Ковальский
Переслано от Илья Филиппов
09.07.2026 12:16
Сколько на самом деле стоит 1M токенов на своём железе

Сделал калькулятор того, как стоимость своего GPU переходит в себестоимость токенов.
Оказалось, что достаточно нетривиальная задача, тк челленджит все знания об LLM: как работают слои, чем MoE отличается от dense, как устроен KV cache. В общем обновил по пути все свои знания GenAI. Понятно, что куча допущений внутри, а параметры собирал Fable, надо тестировать на реальных серверах, но это может быть отправной точкой.

Что по выводам?

Строить или покупать — это вопрос утилизации, не технологии. Сможет ли сервис создать высоукую утилизацию сервера и есть ключевой вопрос.
MoE — скидка на скорость, но не на память. Кол-во активных параметров 3 млрд из 35: карта пишет быстро, но веса лежат целиком. Отсюда контринтуитивный результат: большие MoE модели на дешёвых картах — экономически лучшая пара, пока хватает VRAM.
ROI-ловушка. 390% годовых и выше работает при УЖЕ НАЙДЕННОМ спросе; поиск клиентов, SLA, биллинг в модели не учтены. Поэтому супер важно обеспечить потребление, а не накупить дорогих игрушек.

Скачивайте, подставляйте свои данные и посмотрите себестоимость. Найдете ошибки - дайте знать)

Илья Филиппов
2026_07_09_калькулятор_LLM_инференса_filippov_GenAI.xlsx
25.23 КБ
🔥 36
👍 12
👀 6
4
24 199 6.1K

Обсуждение 24

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

Валера Ковальский

15.7K
Head of AI red_mad_robot
AI-advisor Bitrix24

From IT Admin to Head of AI in 6 years
Автор https://neuraldeep.ru/
Raised $2M+ for human-centric AI startups
github.com/vakovalskii | chat @neuraldeepchat
Открыть в Telegram