NVIDIA Build відкриває безкоштовний API до Kimi K3 та DeepSeek з вікном 1M токенів
Платформа NVIDIA Build надає безкоштовний необмежений доступ до API відкритих моделей Kimi K3, DeepSeek V4.1 Flash та GLM 5.3 із контекстом на 1M токенів. Ліміт квот знято на користь обмеження у 40 запитів на хвилину, проте потрібна SMS-верифікація. Розробники можуть одразу підключити цей сумісний з OpenAI ендпоінт до Cursor або агентів.

Вплив: Середній
Чому це важливо
Ви можете перенаправити прототипування та агентне кодування на відкриті моделі з вікном 1M токенів без витрат на токени, просто змінивши базовий URL.
TL;DR
- 01NVIDIA Build надає необмежену щоденну кількість викликів API до Kimi K3, DeepSeek V4.1 Flash та GLM 5.3 із лімітом ~40 RPM.
- 02Усі чотири відкриті моделі підтримують контекстні вікна на 1 048 576 токенів через OpenAI-сумісний інтерфейс.
- 03Для активації потрібна SMS-верифікація, а Kimi K3 вимагає збереження поля reasoning_content у багатокрокових сесіях.
Ключові факти
- Контекстне вікно
- 1 048 576 токенів
- Ліміт запитів
- ~40 запитів на хвилину (~57 600/день)
- Вартість API
- Безкоштовно (без кредитної картки)
- Верифікація
- Потрібне підтвердження через SMS
Необмежений доступ з обмеженням 40 запитів на хвилину
NVIDIA Build оновила умови для розробників, прибравши колишній ліміт у 1000 кредитів на користь необмеженої кількості щоденних запитів через ендпоінт integrate.api.nvidia.com/v1. Доступ обмежено лише пропускною здатністю приблизно у 40 запитів на хвилину (RPM) на один ключ. Для локальних агентних циклів, бенчмаркінгу та прототипування 40 RPM забезпечують до 57 600 викликів на добу без витрат на хмарну інфраструктуру.
Флагманські MoE-моделі з вікном 1M токенів
Безкоштовний рівень відкриває доступ до чотирьох відкритих моделей: Kimi K3, DeepSeek V4.1 Flash, GLM 5.3 та GLM 5.3 Flash. Усі вони базуються на архітектурі Mixture-of-Experts і підтримують контекстне вікно розміром 1 048 576 токенів. Kimi K3 орієнтована на складне автономне кодування з постійно активним режимом міркування, тоді як DeepSeek V4.1 Flash та GLM 5.3 Flash оптимізовані під швидку генерацію структурованих відповідей та мультимодальні задачі.
Підводні камені верифікації та стан контексту
Для отримання ключа обов'язкова реєстрація в NVIDIA Developer Program та підтвердження за допомогою SMS від реального оператора зв'язку. Сервіси віртуальних номерів блокуються правилами платформи, а підтримка кодів окремих країн наразі обмежена. Крім того, під час інтеграції Kimi K3 в агентні середовища слід зважати на архітектурну особливість: у багатокрокових сесіях запити повинні передавати назад повну відповідь асистента разом із блоками reasoning_content та tool_calls, інакше модель втрачає ланцюжок інструкцій.
Спробуй за 2 хвилини
curl https://integrate.api.nvidia.com/v1/chat/completions -H "Authorization: Bearer $NVIDIA_API_KEY" -H "Content-Type: application/json" -d '{"model": "moonshotai/kimi-k3", "messages": [{"role": "user", "content": "Explain Swift async/await in three sentences"}]}'bash
✓ Коли використовувати
- Прототипування агентних робочих процесів із великим контекстом без витрат на токени.
- Тестування Kimi K3 або DeepSeek V4.1 Flash на власних бенчмарках і завданнях із контекстом до 1M токенів.
✕ Коли НЕ варто
- Високонавантажені продакшн-системи, які вимагають гарантованих SLA понад 40 RPM.
- Автоматизовані акаунти у регіонах із непідтримуваними телефонними кодами.
Що зробити сьогодні
- Зареєструйтеся в NVIDIA Developer Program та пройдіть SMS-верифікацію.
- Вкажіть базовий URL integrate.api.nvidia.com/v1 для власної моделі в Cursor або кодинг-агенті.
- Перевірте, що цикл вашого агента зберігає поля reasoning_content та tool_calls для Kimi K3.
Джерела