Thinking Machines випускає відкриту мультимодальну модель Inkling Small з 12B активних параметрів
Лабораторія Thinking Machines випустила Inkling Small — відкриту мультимодальну модель із архітектурою Mixture-of-Experts, яка використовує 12B активних параметрів із 276B загальних. Вона отримала 40.2 бали в індексі Artificial Analysis та пропонує безкоштовний хостинг або доступний API за $0.50 за 1M вхідних та $1.20 за 1M вихідних токенів.

Вплив: Середній
Чому це важливо
Розробники можуть розгорнути потужну мультимодальну MoE-модель локально через vLLM або Ollama, щоб повністю обнулити витрати на API під час генерації коду.
TL;DR
- 01Inkling Small пропонує 12B активних параметрів із 276B загальних у форматі MoE з відкритими вагами.
- 02Локальний хостинг через vLLM або Ollama повністю ліквідує операційні витрати на токени.
- 03Ціна hosted API становить $0.50 за вхідні та $1.20 за вихідні токени per 1M.
Ключові факти
- Активні параметри
- 12B
- Загальні параметри
- 276B
- Ціна input (API)
- $0.50 / 1M токенів
- Ціна output (API)
- $1.20 / 1M токенів
- Швидкість генерації
- 124 токенів/сек
- Результат GPQA
- 89.5%
Архітектура Mixture-of-Experts з відкритими вагами
Inkling Small від Thinking Machines Lab використовує архітектуру Mixture-of-Experts з 12 мільярдами активних параметрів із 276 мільярдів загальних. Випуск відкритих ваг дозволяє здійснювати хостинг на власному обладнанні без витрат на API.
Бенчмарки продуктивності та швидкість інференсу
Згідно з незалежними тестами Artificial Analysis, модель отримала 40.2 бали в індексі інтелекту. Модель продемонструвала 89.5% у GPQA, 31.6% у Humanity's Last Exam, 63% у Long Context Reasoning, 48.7% у SciCode, 15.5% у τ-Bench Banking та 55.1% у Terminal-Bench. Hosted-інференс забезпечує близько 124 токенів на секунду з затримкою до першого токена 1.44 секунди.
Структура цін
Для розробників, які вибирають хмарні API, вартість становить $0.50 за мільйон вхідних токенів та $1.20 за мільйон вихідних токенів, що дає середню вартість близько $0.68 за мільйон токенів при стандартному співвідношенні вводу та виводу.
Спробуй за 2 хвилини
ollama run inkling-smallbash
✓ Коли використовувати
- Самостійний хостинг агентів генерації коду на локальних GPU-кластерах без плати за токени.
- Заміна дорогих пропрієтарних API-моделей для мультимодальних завдань із високим навантаженням.
- Запуск агентів термінальної автоматизації за типом Terminal-Bench, де потрібне швидке виконання.
✕ Коли НЕ варто
- Розгортання на обладнанні з недостатнім обсягом VRAM для покриття MoE-моделі на 276B параметрів.
- Складні банківські або спеціалізовані фінансові агенти, які вимагають максимальної точності (τ-Bench Banking становить лише 15.5%).
Що зробити сьогодні
- Протестуйте локальне розгортання через Ollama або vLLM на вашій GPU-інфраструктурі.
- Порівняйте швидкість виконання з поточними моделями генерації коду на завданнях Terminal-Bench.
Джерела