Перейти до вмісту
ГоловнаНовиниДайджестиКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Моделі й дослідження/
  4. Inclusionai випустила відкриту MoE-модель Ling-3.0-flash на 124 мільярди параметрів
Моделі й дослідження

Inclusionai випустила відкриту MoE-модель Ling-3.0-flash на 124 мільярди параметрів

Inclusionai представила відкриту MoE-модель Ling-3.0-flash на 124 млрд параметрів з активацією лише 5,1 млрд на токен. Зі швидкістю 406,5 токенів на секунду та ціною $0,03 за мільйон токенів вона забезпечує доступну кодогенерацію.

5 вересня 2026 р.· 4 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 5 вересня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Inclusionai випустила відкриту MoE-модель Ling-3.0-flash на 124 мільярди параметрів

Вплив: Середній

Чому це важливо

Завантажуйте ваги безкоштовно для запуску в Ollama чи vLLM, або використовуйте API за ціною, нижчою за 91% аналогів.

TL;DR

  • 01Ling-3.0-flash активує лише 5,1 млрд зі 124 млрд параметрів на токен, видаючи 406,5 токенів/с.
  • 02Демонструє 85,5% на GPQA та 55,4% на Terminal-Bench за ціною $0,03/млн токенів або безкоштовно локально.
  • 03Підтримує запуск через локальні середовища Ollama, vLLM та llama.cpp.

Ключові факти

Загальні параметри
124 млрд (MoE)
Активовані параметри
5,1 млрд на токен
Усереднена ціна токенів
$0,03 за 1 млн токенів (3:1)
Тарифи на API
$0,02 вхід / $0,06 вихід за 1 млн токенів
Швидкість генерації
406,5 токенів/с (медіана TTFT 1,84 с)
Ключові бенчмарки
GPQA 85,5%, Terminal-Bench 55,4%, SciCode 41,1%

Архітектура розрідженої MoE та швидкість генерації

Ling-3.0-flash використовує архітектуру Mixture-of-Experts (MoE) на 124 млрд параметрів, з яких для обробки кожного токена активується приблизно 5,1 млрд. За незалежними замірами Artificial Analysis, модель генерує 406,5 токенів на секунду із медіанною затримкою до першого токена 1,84 с.

Результати бенчмарків та генерація коду

В індексі інтелекту Artificial Analysis модель отримала 37,8 бала, перевершивши 68% протестованих систем. Результати у профільних тестах становлять 85,5% на GPQA, 55,4% на Terminal-Bench, 41,1% на SciCode, 67% на Long Context Reasoning, 27,2% на τ-Bench Banking та 23,7% на Humanity's Last Exam.

Варіанти розгортання та вартість API

Ваги моделі є повністю відкритими для локального запуску через ollama, vllm або llama.cpp без оплати за токени. Хмарний API пропонується за ціною $0,02 за 1 млн вхідних і $0,06 за 1 млн вихідних токенів ($0,03 за 1 млн токенів у співвідношенні 3:1), що дешевше за 91% доступних відкритих моделей.

Спробуй за 2 хвилини

ollama run ling-3.0-flash

bash

✓ Коли використовувати

  • Високонавантажена кодогенерація, термінальні агентні цикли та автогенерація тестів.
  • Локальний хостинг, коли обмеження пам'яті сервера не дозволяють запускати щільні моделі.

Що зробити сьогодні

  • →Завантажте ваги Ling-3.0-flash в Ollama або vLLM для тестування локальної швидкості кодогенерації.
  • →Налаштуйте маршрутизацію масових агентних завдань до API для оптимізації витрат на токени.
#Ollama#vLLM#llama.cpp

Джерела

  • Ling-3.0-flash Model Overview & Benchmarks
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаAnthropic формалізувала Велику теорему Ферма за допомогою Lean та агентів Claude CodeНаступна новина →Міграція локальних LLM-навантажень з Ollama на vLLM

Схожі матеріали

  • Моделі й дослідженняМультимодальні енкодери NeoMME забезпечують візуальний пошук документів зі швидкістю 51 сторінка на секунду
  • Моделі й дослідженняAnthropic випустила Claude Fable 5.1 зі зниженою ціною читання кешу промптів
  • Моделі й дослідженняAllenAI презентує BenchMIRT для аудиту та скорочення бенчмарків LLM
  • Моделі й дослідженняGoogle випустила TimesFM-3 для zero-shot мультиваріантного прогнозування часових рядів

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.