GLM-5.3-Flash скорочує витрати на інференс агентів до 50 разів
Zhipu AI підтвердила, що анонімна модель Ox Alpha на OpenRouter — це GLM-5.3-Flash. Вона забезпечує продуктивність рівня флагманів за ціною $0.15 за 1M вхідних і $0.50 за 1M вихідних токенів під ліцензією MIT.

Вплив: Високий
Чому це важливо
Ви можете замінити дорогі флагманські моделі у тривалих циклах агентів, зменшивши витрати на токени під час обробки репозиторіїв на понад 90%.
TL;DR
- 01GLM-5.3-Flash доступна під ліцензією MIT із контекстним вікном 1M токенів та 18 млрд активних параметрів.
- 02Вартість $0.15/1M вхідних і $0.50/1M вихідних токенів до 50 разів нижча за провідні закриті моделі.
- 03Показники в Terminal-Bench 2.0 та DeepSWE майже не поступаються комерційним флагманам.
Ключові факти
- Загальні / активні параметри
- 320 млрд заг. / 18 млрд активних
- Контекстне вікно
- 1 000 000 токенів
- Ціна вхід / вихід
- $0.15 / $0.50 за 1M токенів
- Ліцензія
- MIT
- Розрив на Terminal-Bench 2.0
- -0.7 проти Claude Opus 4.8
Відкрита архітектура та масовий інференс
Модель GLM-5.3-Flash від Zhipu AI побудована на архітектурі Mixture-of-Experts із 320 млрд загальних параметрів та 18 млрд активних параметрів на токен. Вона випущена під ліцензією MIT, підтримує контекстне вікно в 1M токенів і модальності тексту, зображень та відео. Під час анонімного тестування під назвою Ox Alpha на OpenRouter модель обробила близько 23 трильйонів токенів за неповні шість днів.
Економіка для агентних пайплайнів
Базова вартість API становить $0.15 за 1M вхідних токенів і $0.50 за 1M вихідних токенів. Порівняно з GPT-5.6 Terra це приблизно в 13 разів дешевше на вході та у 24 рази на виході. У порівнянні з Claude Opus 5 різниця сягає приблизно 33× для вхідних і 50× для вихідних токенів. Для агентних пайплайнів, що виконують сотні ітерацій читання коду, тестів та виправлення помилок, така різниця кардинально зменшує бюджет.
Порівняння бенчмарків
Результати оцінки демонструють мінімальний розрив із флагманськими системами:
- Terminal-Bench 2.0: відставання від Claude Opus 4.8 становить 0.7 бала, а від GPT-5.6 Terra — 1.5 бала.
- DeepSWE: результат у задачах програмної інженерії впритул наближений до флагманів.
- AutomationBench та GDPVal-AA v2: випереджає як Claude Opus 4.8, так і GPT-5.6 Terra.
Спробуй за 2 хвилини
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "zhipu/glm-5.3-flash",
"messages": [{"role": "user", "content": "Refactor this agent loop."}]
}'bash
✓ Коли використовувати
- Високонавантажені кодинг-агенти, які виконують сотні викликів для рефакторингу та запуску тестів.
- Пайплайни з довгим контекстом та мультимодальною обробкою, де потрібна відкрита ліцензія MIT.
✕ Коли НЕ варто
- Для локального запуску на звичайних споживчих ноутбуках без значного обсягу пам'яті.
- Коли завдання критично залежать від специфічних закритих екосистемних фіч пропрієтарних API.
Що зробити сьогодні
- Перенаправте фонові циклічні завдання агентів на GLM-5.3-Flash через OpenRouter або власні хмарні ендпоінти.
- Протестуйте набір агентних тестів вашого проєкту на GLM-5.3-Flash для оцінки відсотка успішного виконання завдань.
Джерела