avatar
Innovation & Research
@abulaphia
11.08.2026 04:34
Японские учёные добились ускорения LLM до 2,6 раза без переобучения и потери качества

Исследователи из Японского передового института науки и технологий (JAIST) под руководством профессора Ле-Минь Нгуена (Le-Minh Nguyen) разработали фреймворк UniSpec, который ускоряет инференс больших языковых моделей без дополнительного обучения и без изменения выходных данных. Метод, основанный на спекулятивном декодировании, автоматически подбирает оптимальный размер черновика для каждого аппаратного обеспечения, оценивает уверенность в n-граммах и строит эффективное дерево черновиков, что позволяет достичь ускорения до 2,6 раза по сравнению с существующими методами.

Для оценки эффективности исследователи создали мультиязычный бенчмарк Multi-SpecBench, охватывающий семь языков и семь задач генерации, что расширяет тестирование за пределы англоязычных наборов данных. Эксперименты проводились на моделях Llama-3* и Qwen-3 с использованием GPU NVIDIA A100, A40, RTX A6000 и RTX 3090. Результаты показали стабильное ускорение на всех платформах и языках, а также полную идентичность выходных данных стандартному автогрессивному декодированию.

Работа была представлена на 64-й ежегодной конференции Ассоциации вычислительной лингвистики (ACL 2026), проходившей со 2 по 7 июля 2026 года, и удостоена награды SAC Highlight Award. Исследователи опубликовали исходный код UniSpec и бенчмарк Multi-SpecBench в открытом доступе для поддержки дальнейших разработок.

По словам профессора Нгуена, фреймворк может быть интегрирован в существующие системы AI без переобучения, что снижает затраты на развертывание и повышает эффективность. В перспективе UniSpec может найти применение в виртуальных ассистентах, системах поддержки клиентов, многоязычном переводе, генерации кода и облачных сервисах. Однако текущая версия не поддерживает морфологически богатые языки, такие как арабский, и предполагает доступ к логитам модели, что ограничивает использование в закрытых системах. В будущем планируется расширить языковой охват и протестировать в динамических аппаратных средах.

*продукт компании, признанной экстремисткой и запрещённой на территории РФ


#news #AI

https://www.eurekalert.org/news-releases/1138769
EurekAlert!
Training-free framework accelerates large language models without retraining
Large language models power today's AI applications, but generating responses quickly and efficiently remains a significant challenge. In a new study, researchers from Japan developed UniSpec, a training-free framework that speeds up LLM inference without retraining or altering model outputs. The team also introduced Multi-SpecBench, the first multilingual benchmark of its kind, demonstrating up to 2.6× faster inference across multiple LLM architectures, GPU platforms, and seven languages while producing outputs identical to standard autoregressive decoding.
4
15 692

Обсуждение 0

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

Innovation & Research

5K
“Push-the-envelope” Channel
Открыть в Telegram