Детальний аналіз: порівняння відкритих моделей суміші експертів трильйонного масштабу
Детальний порівняльний аналіз трьох провідних моделей суміші експертів з відкритими вагами: Kimi K3, DeepSeek V4 Pro та GLM-5.2. Досліджено бенчмарки, ліцензійні відмінності та витрати на інфраструктуру.
Вплив: Високий
Чому це важливо
Розробники можуть обрати оптимальну модель з відкритими вагами на основі вартості запитів, швидкості роботи та вимог до хостингу.
TL;DR
- 01DeepSeek V4 Pro є очевидним лідером за вартістю із показником $0.18 за мільйон змішаних токенів.
- 02Kimi K3 пропонує найкращу логіку міркувань (3 місце у загальному заліку), але працює лише через API до виходу ваг 27 липня 2026 року.
- 03GLM-5.2 забезпечує найвищу швидкість роботи (168 токенів/с) і може бути розгорнута локально на 8x H200.
Ключові факти
- Кількість параметрів Kimi K3
- 2.8T
- Змішана вартість DeepSeek V4 Pro
- $0.18 за млн токенів
- Швидкість генерації GLM-5.2
- 168 токенів/с
- Розмір контекстного вікна
- 1M токенів
- Дата публікації ваг Kimi K3
- 27 липня 2026
Продуктивність та архітектура
Усі три моделі базуються на архітектурі розріджених сумішей експертів (MoE) та підтримують контекстні вікна розміром 1M токенів:
- Kimi K3: 2.8T параметрів (активує 16/896 експертів). Підтримує текст, зображення та відео.
- DeepSeek V4 Pro: 1.6T параметрів (49B активних, 384 маршрутизовані експерти).
- GLM-5.2: 744B параметрів (~40B активних).
У рейтингу Artificial Analysis Intelligence Index модель Kimi K3 отримала 57 балів (3 місце у світі, на рівні Claude 4.8 Opus), GLM-5.2 — 51 бал, а DeepSeek V4 Pro — 44 бали (показник зростає у режимі Max reasoning).
Вартість API та економічна ефективність
DeepSeek V4 Pro є безумовним лідером з економічної точки зору. Змішана вартість (співвідношення кешу, вхідних та вихідних токенів як 7:2:1) за оцінкою Artificial Analysis становить $0.18 за 1 млн токенів для DeepSeek V4 Pro, порівняно з $0.90 для GLM-5.2 та $2.31 для Kimi K3. За стандартними тарифами один долар купує приблизно 1.15 млн вихідних токенів DeepSeek V4 Pro, але лише 67 тисяч у Kimi K3.
Компроміси швидкості та локального хостингу
GLM-5.2 є лідером за швидкістю роботи, видаючи близько 168 токенів на секунду, тоді як Kimi K3 та DeepSeek V4 Pro показують близько 62 токенів/с.
Для локального запуску:
- GLM-5.2: Потребує понад 1 ТБ відеопам\'яті (VRAM), що реалізується на кластері з 8x H200 у режимі FP8.
- DeepSeek V4 Pro: Потребує значно більших кластерів через розмір у 1.6T параметрів.
- Kimi K3: Вимагає не менше 64 прискорювачів, що робить самостійний хостинг нереалістичним для більшості команд.
✓ Коли використовувати
- При оцінці моделей з відкритим кодом для високопродуктивних додатків з великим контекстом.
- При плануванні бюджетів на власну хостинг-інфраструктуру для масштабних корпоративних проектів.
✕ Коли НЕ варто
- Якщо вам потрібні легковагові моделі з низькою затримкою для запуску безпосередньо на споживчих відеокартах.
Що зробити сьогодні
- Протестуйте DeepSeek V4 Pro у повторюваних агентних конвеєрах для зниження витрат.
- Слідкуйте за Hugging Face 27 липня 2026 року, щоб завантажити відкриті ваги Kimi K3.
Що каже спільнота
“"race to the bottom" is the negative framing of "competitive market prices". So a company or union might say "this is a race to the bottom" when someone new enters their market...”
“I'm starting to think It might be a good idea to stay with American models, by virtue of them feeling so threatened they give out more and more free perks.”
Джерела