Сколько на самом деле стоит 1M токенов на своём железе
Сделал калькулятор того, как стоимость своего GPU переходит в себестоимость токенов.
Оказалось, что достаточно нетривиальная задача, тк челленджит все знания об LLM: как работают слои, чем MoE отличается от dense, как устроен KV cache. В общем обновил по пути все свои знания GenAI. Понятно, что куча допущений внутри, а параметры собирал Fable, надо тестировать на реальных серверах, но это может быть отправной точкой.
Что по выводам?
•
Строить или покупать — это вопрос утилизации, не технологии. Сможет ли сервис создать высоукую утилизацию сервера и есть ключевой вопрос.
•
MoE — скидка на скорость, но не на память. Кол-во активных параметров 3 млрд из 35: карта пишет быстро, но веса лежат целиком. Отсюда контринтуитивный результат: большие MoE модели на дешёвых картах — экономически лучшая пара, пока хватает VRAM.
•
ROI-ловушка. 390% годовых и выше работает при УЖЕ НАЙДЕННОМ спросе; поиск клиентов, SLA, биллинг в модели не учтены. Поэтому супер важно обеспечить потребление, а не накупить дорогих игрушек.
Скачивайте, подставляйте свои данные и посмотрите себестоимость. Найдете ошибки - дайте знать)
Илья Филиппов
Обсуждение 24
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram