Baseten построил самый быстрый API для GLM-5.2 — 280+ токенов в секунду на Blackwell
Кто-то тут жаловался, что GLM-5.2 медленный на "родном" апи от
z.ai, - вам будет интересно.
⚡️ Baseten (Philip Kiely, Alex Korte, Tri Dao и команда) разогнал GLM-5.2 до 280 токенов в секунду — лучший показатель среди всех API-провайдеров модели на момент замера Artificial Analysis 22 июня.
🔧 Пять ключевых моментов:
- кастомный инференс-движок с Shared DSA для архитектуры GLM-5.2,
- собственное квантование в NVFP4 на NVIDIA Blackwell с сохранением качества на BFCL-бенчмарке,
- KV-aware-маршрутизация через NVIDIA Dynamo для переиспользования кэша между запросами,
- разделение prefill и decode с двукратным ускорением,
- MTP.
🔥 Конкуренты не дремлют: уже через неделю
Fireworks заявили
446 ток/с на пике для GLM 5.2 Fast и статус самого быстрого провайдера на OpenRouter.
#GLM #Baseten
———
@tsingular
Обсуждение 1
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram