Inclusionai випустила відкриту MoE-модель Ling-3.0-flash на 124 мільярди параметрів
Inclusionai представила відкриту MoE-модель Ling-3.0-flash на 124 млрд параметрів з активацією лише 5,1 млрд на токен. Зі швидкістю 406,5 токенів на секунду та ціною $0,03 за мільйон токенів вона забезпечує доступну кодогенерацію.

Вплив: Середній
Чому це важливо
Завантажуйте ваги безкоштовно для запуску в Ollama чи vLLM, або використовуйте API за ціною, нижчою за 91% аналогів.
TL;DR
- 01Ling-3.0-flash активує лише 5,1 млрд зі 124 млрд параметрів на токен, видаючи 406,5 токенів/с.
- 02Демонструє 85,5% на GPQA та 55,4% на Terminal-Bench за ціною $0,03/млн токенів або безкоштовно локально.
- 03Підтримує запуск через локальні середовища Ollama, vLLM та llama.cpp.
Ключові факти
- Загальні параметри
- 124 млрд (MoE)
- Активовані параметри
- 5,1 млрд на токен
- Усереднена ціна токенів
- $0,03 за 1 млн токенів (3:1)
- Тарифи на API
- $0,02 вхід / $0,06 вихід за 1 млн токенів
- Швидкість генерації
- 406,5 токенів/с (медіана TTFT 1,84 с)
- Ключові бенчмарки
- GPQA 85,5%, Terminal-Bench 55,4%, SciCode 41,1%
Архітектура розрідженої MoE та швидкість генерації
Ling-3.0-flash використовує архітектуру Mixture-of-Experts (MoE) на 124 млрд параметрів, з яких для обробки кожного токена активується приблизно 5,1 млрд. За незалежними замірами Artificial Analysis, модель генерує 406,5 токенів на секунду із медіанною затримкою до першого токена 1,84 с.
Результати бенчмарків та генерація коду
В індексі інтелекту Artificial Analysis модель отримала 37,8 бала, перевершивши 68% протестованих систем. Результати у профільних тестах становлять 85,5% на GPQA, 55,4% на Terminal-Bench, 41,1% на SciCode, 67% на Long Context Reasoning, 27,2% на τ-Bench Banking та 23,7% на Humanity's Last Exam.
Варіанти розгортання та вартість API
Ваги моделі є повністю відкритими для локального запуску через ollama, vllm або llama.cpp без оплати за токени. Хмарний API пропонується за ціною $0,02 за 1 млн вхідних і $0,06 за 1 млн вихідних токенів ($0,03 за 1 млн токенів у співвідношенні 3:1), що дешевше за 91% доступних відкритих моделей.
Спробуй за 2 хвилини
ollama run ling-3.0-flashbash
✓ Коли використовувати
- Високонавантажена кодогенерація, термінальні агентні цикли та автогенерація тестів.
- Локальний хостинг, коли обмеження пам'яті сервера не дозволяють запускати щільні моделі.
Що зробити сьогодні
- Завантажте ваги Ling-3.0-flash в Ollama або vLLM для тестування локальної швидкості кодогенерації.
- Налаштуйте маршрутизацію масових агентних завдань до API для оптимізації витрат на токени.
Джерела