avatar
Технозаметки Малышева
@tsingular
03.07.2026 14:46
Baseten построил самый быстрый API для GLM-5.2 — 280+ токенов в секунду на Blackwell

Кто-то тут жаловался, что GLM-5.2 медленный на "родном" апи от z.ai, - вам будет интересно.

⚡️ Baseten (Philip Kiely, Alex Korte, Tri Dao и команда) разогнал GLM-5.2 до 280 токенов в секунду — лучший показатель среди всех API-провайдеров модели на момент замера Artificial Analysis 22 июня.

🔧 Пять ключевых моментов:
- кастомный инференс-движок с Shared DSA для архитектуры GLM-5.2,
- собственное квантование в NVFP4 на NVIDIA Blackwell с сохранением качества на BFCL-бенчмарке,
- KV-aware-маршрутизация через NVIDIA Dynamo для переиспользования кэша между запросами,
- разделение prefill и decode с двукратным ускорением,
- MTP.

🔥 Конкуренты не дремлют: уже через неделю Fireworks заявили 446 ток/с на пике для GLM 5.2 Fast и статус самого быстрого провайдера на OpenRouter.

#GLM #Baseten
———
@tsingular
🔥 9
3
🏆 2
👍 1
1 12 2K

Обсуждение 1

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

Технозаметки Малышева

11.6K
Новости инноваций из мира Искусственного Интеллекта. 🤖 [РКН: 7021469833 ]

Всё об ИИ, ИТ трендах и Технологической Сингулярности.

🤖: @ai_gptfreebot [бесплатный бот]
✍️: @tsingular_bot [каталог ботов и курсов]

💸: https://pay.cloudtips.ru/p/c8960bbb
Открыть в Telegram