Перейти до вмісту
ГоловнаНовиниКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Моделі й дослідження/
  4. Alibaba випускає у відкритий доступ модель Qwen3.8 на 2,4 трильйона параметрів
Моделі й дослідження

Alibaba випускає у відкритий доступ модель Qwen3.8 на 2,4 трильйона параметрів

Alibaba опублікувала відкриті ваги Qwen3.8-2.4T-A95B із 2,4 ТБ параметрів та 95 млрд активних на токен. Завдяки гібридній архітектурі уваги та налаштовуваній глибині міркувань модель сягає 4К токенів/с на GPU NVIDIA GB300.

13 серпня 2026 р.· 3 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 13 серпня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Alibaba випускає у відкритий доступ модель Qwen3.8 на 2,4 трильйона параметрів

Вплив: Високий

Чому це важливо

Тепер ви можете запускати агенти з контекстом у 1 млн токенів на власній інфраструктурі через vLLM або SGLang.

TL;DR

  • 01Qwen3.8-2.4T-A95B дає контекст 1M токенів при 95B активних параметрах.
  • 02Вбудовані режими міркувань (low/high/xhigh) дозволяють змінювати затримку та якість на рівні API-запиту.
  • 03Розгортання відразу підтримується у vLLM, SGLang та NVIDIA NIM.

Ключові факти

Всього параметрів2.4 Трильйона
Активних параметрів95 Мільярдів на токен
Всього параметрів
2.4 Трильйона
Активних параметрів
95 Мільярдів на токен
Вікно контексту
1 000 000 токенів
Максимальний вивід
128 000 токенів
Пропускна здатність (GB300)
>4 000 токенів/сек/GPU (за даними вендора)

Гібридна архітектура уваги

Qwen3.8-2.4T-A95B поєднує стандартні шари повної уваги з лінійними шарами. У лінійних шарах KV-кеш перетворюється на рекурентний стан фіксованого розміру, що зупиняє розростання пам'яті у контексті на 1M токенів.

Маршрутизація Fine-Grained MoE

З 2,4 трильйона параметрів лише 95 млрд активуються для кожного токена. Розумний роутер динамічно направляє токени до вузькоспеціалізованих експертів, зменшуючи вартість інференсу.

Інфраструктура разгортання

Розгортання доступне з першого дня через відкриті рушії:

  • Дистрибутивні рецепти для vLLM та SGLang
  • Готові контейнери NVIDIA NIM у каталозі NGC
  • Донавчання через NVIDIA NeMo AutoModel напряму з Hugging Face

Спробуй за 2 хвилини

docker run --gpus all -p 8000:8000 nvcr.io/nim/alibaba/qwen3.8-2.4t-a95b:latest

bash

✓ Коли використовувати

  • Використовуйте для складних агентів кодингу з великими вікнами контексту.
  • Підходить для розгортання на власних корпоративних GPU-кластерах.

✕ Коли НЕ варто

  • Не використовуйте на поодиноких споживчих відеокартах без мульти-нодового кластера.
  • Не підходить для простих завдань із жорсткими вимогами до затримки на крайових пристроях.

Що зробити сьогодні

  • →Завантажте ваги з Hugging Face або ModelScope для власних кластерів.
  • →Налаштуйте інференс через vLLM або SGLang у точності FP8.
  • →Протестуйте прапори режимів reasoning (low/xhigh) у вашому агентному пайплайні.
#Qwen3.8#vLLM#SGLang#NVIDIA NIM#NeMo AutoModel

Джерела

  • NVIDIA Technical Blog: Serve Qwen3.8-2.4T-A95B on NVIDIA GB300 NVL72
ПоділитисяПоділитися в XПоділитися в LinkedIn
Наступна новина →Архітектура Grok Bot: хмарні віртуальні машини, обгортка Sand та інтеграція з Cursor

Схожі матеріали

  • Моделі й дослідженняЗастарілі моделі Claude уразливі до багатокрокових промпт-ін'єкцій на сторонніх API
  • Моделі й дослідженняТаємнича модель Ox Alpha з'явилася на OpenRouter, випереджаючи Fable 5 та GPT-5.6 Sol
  • Моделі й дослідженняВідкрита модель Ornith-1.5 на 397B MoE випущена під ліцензією MIT
  • Моделі й дослідженняCanonical підтримує нейросимвольне ШІ-дослідження для автоматизації перекладу C на Rust

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.