avatar
Илья Филиппов
@filippov_GenAI
09.07.2026 12:15
Сколько на самом деле стоит 1M токенов на своём железе

Сделал калькулятор того, как стоимость своего GPU переходит в себестоимость токенов.
Оказалось, что достаточно нетривиальная задача, тк челленджит все знания об LLM: как работают слои, чем MoE отличается от dense, как устроен KV cache. В общем обновил по пути все свои знания GenAI. Понятно, что куча допущений внутри, а параметры собирал Fable, надо тестировать на реальных серверах, но это может быть отправной точкой.

Что по выводам?

Строить или покупать — это вопрос утилизации, не технологии. Сможет ли сервис создать высоукую утилизацию сервера и есть ключевой вопрос.
MoE — скидка на скорость, но не на память. Кол-во активных параметров 3 млрд из 35: карта пишет быстро, но веса лежат целиком. Отсюда контринтуитивный результат: большие MoE модели на дешёвых картах — экономически лучшая пара, пока хватает VRAM.
ROI-ловушка. 390% годовых и выше работает при УЖЕ НАЙДЕННОМ спросе; поиск клиентов, SLA, биллинг в модели не учтены. Поэтому супер важно обеспечить потребление, а не накупить дорогих игрушек.

Скачивайте, подставляйте свои данные и посмотрите себестоимость. Найдете ошибки - дайте знать)

Илья Филиппов
2026_07_09_калькулятор_LLM_инференса_filippov_GenAI.xlsx
25.23 КБ
🔥 15
4
12 297 10.6K

Обсуждение 12

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

Илья Филиппов

413
AI как двигатель доходов: от финансовых продуктов до нетривиальных стартапов. Рассказываю про деньги, неожиданные направления и внутреннюю кухню внедрений. Илья Филиппов, CEO red_mad_robot AI.

redmadrobot.ru
Открыть в Telegram