Alibaba показала, каким может стать Qwen4

2026-09-01 12:16:25 Время чтения 4 мин 108

Alibaba впервые показала архитектуру, которая должна лечь в основу следующего поколения Qwen. Компания открыла веса Qwen3.8-Flash-Next - мультимодальной модели, которую называет ранним превью будущего Qwen4. По задумке разработчиков, следующая серия должна расти не столько за счёт огромного числа вычислений, сколько благодаря более эффективной архитектуре.

Основная модель содержит 125 млрд параметров, ещё 51 млрд приходится на отдельный N-gram Embedding. При этом на обработку каждого токена активируется всего около 6 млрд параметров. Модель поддерживает контекст в 262 тыс. токенов, а с помощью YaRN его можно расширить до 1 млн токенов.

N-gram Embedding - одна из главных идей новой архитектуры. Отдельная таблица хранит представления часто встречающихся последовательностей токенов и позволяет добавлять модели ёмкость без сопоставимого роста вычислений. Эти данные можно размещать в оперативной памяти вне GPU и подгружать параллельно с вычислениями. В результате дополнительные 51 млрд параметров не увеличивают обычные матричные вычисления для каждого токена.

Alibaba также изменила механизм работы с длинным контекстом. Qwen3.8-Flash-Next сочетает Gated DeltaNet с собственной Qwen Sparse Attention: модель не обрабатывает весь предыдущий контекст одинаково, а сначала с помощью лёгкого индексатора выбирает наиболее важные участки. Это должно снижать стоимость работы с длинными последовательностями.

Экономия заметна уже при обучении. По данным Alibaba, Qwen3.8-Flash-Next потребовала примерно в девять раз меньше вычислений для обучения, чем Qwen3.7-Plus, при этом на ряде тестов превзошла предшественницу. Например, в SWE-bench Pro новая модель получила 62,5% против 55,8%, а в LiveCodeBench v6 - 91,9% против 89,6%. На GPQA Diamond результаты составили 91,7% против 90,3%.

При этом Alibaba старается сделать модель дешёвой и для конечного использования. Production-версия Qwen3.8-Flash с контекстом до 1 млн токенов стоит $0,16 за миллион входных токенов и $0,47 за миллион выходных. Для сравнения, Qwen3.7-Plus стоит $0,32 и $1,28 соответственно - то есть новая модель почти вдвое дешевле на входе и примерно в 2,7 раза на выходе.

При этом Qwen3.8-Flash-Next уже не выглядит просто экспериментальной облегчённой моделью. В тестах Alibaba она показала лучшие результаты, чем Qwen3.7-Plus, в 8 из 14 представленных бенчмарков, включая MMLU-Pro, SuperGPQA, BBH, GSM8K, EvalPlus и SWEBench-Pretrain.

Alibaba фактически проверяет другой путь развития ИИ: вместо постоянного увеличения числа активных параметров компания пытается разделить ёмкость модели и стоимость вычислений. Если подход с N-gram-памятью, разреженным вниманием и малым числом активных параметров перейдёт в Qwen4, это позволит создавать более крупные модели без такого же роста затрат на обучение и инференс.

Именно поэтому Qwen3.8-Flash-Next важна не только как очередная модель Alibaba. Компания фактически заранее показывает разработчикам архитектурные принципы Qwen4 и даёт им возможность протестировать их до выхода полноценного поколения.