Alibaba випускає у відкритий доступ модель Qwen3.8 на 2,4 трильйона параметрів
Alibaba опублікувала відкриті ваги Qwen3.8-2.4T-A95B із 2,4 ТБ параметрів та 95 млрд активних на токен. Завдяки гібридній архітектурі уваги та налаштовуваній глибині міркувань модель сягає 4К токенів/с на GPU NVIDIA GB300.

Вплив: Високий
Чому це важливо
Тепер ви можете запускати агенти з контекстом у 1 млн токенів на власній інфраструктурі через vLLM або SGLang.
TL;DR
- 01Qwen3.8-2.4T-A95B дає контекст 1M токенів при 95B активних параметрах.
- 02Вбудовані режими міркувань (low/high/xhigh) дозволяють змінювати затримку та якість на рівні API-запиту.
- 03Розгортання відразу підтримується у vLLM, SGLang та NVIDIA NIM.
Ключові факти
- Всього параметрів
- 2.4 Трильйона
- Активних параметрів
- 95 Мільярдів на токен
- Вікно контексту
- 1 000 000 токенів
- Максимальний вивід
- 128 000 токенів
- Пропускна здатність (GB300)
- >4 000 токенів/сек/GPU (за даними вендора)
Гібридна архітектура уваги
Qwen3.8-2.4T-A95B поєднує стандартні шари повної уваги з лінійними шарами. У лінійних шарах KV-кеш перетворюється на рекурентний стан фіксованого розміру, що зупиняє розростання пам'яті у контексті на 1M токенів.
Маршрутизація Fine-Grained MoE
З 2,4 трильйона параметрів лише 95 млрд активуються для кожного токена. Розумний роутер динамічно направляє токени до вузькоспеціалізованих експертів, зменшуючи вартість інференсу.
Інфраструктура разгортання
Розгортання доступне з першого дня через відкриті рушії:
- Дистрибутивні рецепти для
vLLMтаSGLang - Готові контейнери NVIDIA NIM у каталозі NGC
- Донавчання через
NVIDIA NeMo AutoModelнапряму з Hugging Face
Спробуй за 2 хвилини
docker run --gpus all -p 8000:8000 nvcr.io/nim/alibaba/qwen3.8-2.4t-a95b:latestbash
✓ Коли використовувати
- Використовуйте для складних агентів кодингу з великими вікнами контексту.
- Підходить для розгортання на власних корпоративних GPU-кластерах.
✕ Коли НЕ варто
- Не використовуйте на поодиноких споживчих відеокартах без мульти-нодового кластера.
- Не підходить для простих завдань із жорсткими вимогами до затримки на крайових пристроях.
Що зробити сьогодні
- Завантажте ваги з Hugging Face або ModelScope для власних кластерів.
- Налаштуйте інференс через vLLM або SGLang у точності FP8.
- Протестуйте прапори режимів reasoning (low/xhigh) у вашому агентному пайплайні.
Джерела