avatar
Data Secrets
@data_secrets
26.08.2026 15:02
Data Secrets Фото: Архитектура Qwen-4 уже почти здесь Model Scope запустили отсчет до выхода Qwen3.8-Flash-Next. Ее релизнут ровно через сутки, и это будет первая модель, построенная на архитектуре следующего поколения, на которой будет также основан Qwen-4. Пока деталей нет, пишут только, что изменения затронут внимание, residual-связи, эмбеддинг-слои и оптимизацию. https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next/summary
Вышел Qwen-3.8 Flash-Next

Это MoE 125B + 51B N-gram таблица (но активных всего 6B), которая бьет Opus 4.6 Max на 8 из 9 бенчмарков!

Также превосходит Qwen3.8-27B и DeepSeek-V4-Flash. При этом обучение стоило в 9 раз дешевле, чем Qwen3.7-Plus.

Немного про архитектуру. Ключевых новшества всего четыре:

1. Те самые N-gram эмбеддинги aka дешевая память. Это таблица, которая индексируется не по одному токену, а по коротким последовательностям. Модель как бы запоминает типичные локальные комбинации токенов напрямую в виде векторов, а не выучивает их заново на каждом шаге. Потом происходит обычный lookup вместо матричного умножения, поэтому такие эмбеддинги почти не добавляют вычислений на токен, зато сильно увеличивают общую емкость модели.

2. Gated DeltaNet + Qwen Sparse Attention для скорости на длинных контекстах. Модель не запоминает весь контекст целиком, а выбирает небольшие релевантные блоки и работает только с ними. Gated DeltaNet – линейный механизм внимания с гейтами, которые как раз управляют тем, что модель запоминает, а что забывает. Результат: на 1М контекста prefill стал в 7.6 раз быстрее, а decode – в 4.9 раз.

3. Gated Residual connections. Обычные residual-связи просто прокидывают информацию между слоями, а здесь добавлены гейты, которые решают, сколько именно информации пропустить дальше.

4. Оптимизатор Muon вместо классического Adam. Как раз один из факторов, давших 9-кратную экономию на обучении.

В итоге обучение дешевле, параметров больше, а вычислений на токен меньше. Очередное достижение китайского опенсорса.

Модель | Репорт | Блог
131
🔥 75
👍 17
😍 5
🤩 4
😎 3
😁 1
👌 1
🤝 1
12 285 14.8K

Обсуждение 12

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

Data Secrets

92.5K
Главный по машинному обучению

Сотрудничество: @veron_28

РКН: clck.ru/3FY3GN
Открыть в Telegram