Перейти до вмісту
ГоловнаНовиниКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Локальні LLM/
  4. Thinking Machines випускає відкриту мультимодальну модель Inkling Small з 12B активних параметрів
Локальні LLM

Thinking Machines випускає відкриту мультимодальну модель Inkling Small з 12B активних параметрів

Лабораторія Thinking Machines випустила Inkling Small — відкриту мультимодальну модель із архітектурою Mixture-of-Experts, яка використовує 12B активних параметрів із 276B загальних. Вона отримала 40.2 бали в індексі Artificial Analysis та пропонує безкоштовний хостинг або доступний API за $0.50 за 1M вхідних та $1.20 за 1M вихідних токенів.

10 серпня 2026 р.· 4 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 10 серпня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Thinking Machines випускає відкриту мультимодальну модель Inkling Small з 12B активних параметрів

Вплив: Середній

Чому це важливо

Розробники можуть розгорнути потужну мультимодальну MoE-модель локально через vLLM або Ollama, щоб повністю обнулити витрати на API під час генерації коду.

TL;DR

  • 01Inkling Small пропонує 12B активних параметрів із 276B загальних у форматі MoE з відкритими вагами.
  • 02Локальний хостинг через vLLM або Ollama повністю ліквідує операційні витрати на токени.
  • 03Ціна hosted API становить $0.50 за вхідні та $1.20 за вихідні токени per 1M.

Ключові факти

Активні параметри12B
Загальні параметри276B
Активні параметри
12B
Загальні параметри
276B
Ціна input (API)
$0.50 / 1M токенів
Ціна output (API)
$1.20 / 1M токенів
Швидкість генерації
124 токенів/сек
Результат GPQA
89.5%

Архітектура Mixture-of-Experts з відкритими вагами

Inkling Small від Thinking Machines Lab використовує архітектуру Mixture-of-Experts з 12 мільярдами активних параметрів із 276 мільярдів загальних. Випуск відкритих ваг дозволяє здійснювати хостинг на власному обладнанні без витрат на API.

Бенчмарки продуктивності та швидкість інференсу

Згідно з незалежними тестами Artificial Analysis, модель отримала 40.2 бали в індексі інтелекту. Модель продемонструвала 89.5% у GPQA, 31.6% у Humanity's Last Exam, 63% у Long Context Reasoning, 48.7% у SciCode, 15.5% у τ-Bench Banking та 55.1% у Terminal-Bench. Hosted-інференс забезпечує близько 124 токенів на секунду з затримкою до першого токена 1.44 секунди.

Структура цін

Для розробників, які вибирають хмарні API, вартість становить $0.50 за мільйон вхідних токенів та $1.20 за мільйон вихідних токенів, що дає середню вартість близько $0.68 за мільйон токенів при стандартному співвідношенні вводу та виводу.

Спробуй за 2 хвилини

ollama run inkling-small

bash

✓ Коли використовувати

  • Самостійний хостинг агентів генерації коду на локальних GPU-кластерах без плати за токени.
  • Заміна дорогих пропрієтарних API-моделей для мультимодальних завдань із високим навантаженням.
  • Запуск агентів термінальної автоматизації за типом Terminal-Bench, де потрібне швидке виконання.

✕ Коли НЕ варто

  • Розгортання на обладнанні з недостатнім обсягом VRAM для покриття MoE-моделі на 276B параметрів.
  • Складні банківські або спеціалізовані фінансові агенти, які вимагають максимальної точності (τ-Bench Banking становить лише 15.5%).

Що зробити сьогодні

  • →Протестуйте локальне розгортання через Ollama або vLLM на вашій GPU-інфраструктурі.
  • →Порівняйте швидкість виконання з поточними моделями генерації коду на завданнях Terminal-Bench.
#Ollama#vLLM#llama.cpp

Джерела

  • Inkling Small — Pricing, Context Window & Open-Source Alternatives
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаcursor-cp-cli: Підключення Telegram до локальних сесій Cursor CLIНаступна новина →Тестування GPT-5.6 Sol та Fable у переписанні бібліотек на Rust

Схожі матеріали

  • Локальні LLMDaimon: локальний проксі маскує конфіденційні дані перед відправкою до сторонніх LLM
  • Локальні LLMLiquid AI випускає моделі LFM2.5 Q4_0 GGUF за допомогою Quantization-Aware Distillation
  • Локальні LLMКласифікація локальних поштових скриньок за допомогою Ollama та Open Interpreter
  • Локальні LLMQwen 3.8 27B зрівнялася за результатами з GPT-5.6 Luna в індексі Artificial Analysis

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.