Hetzner запускає безкоштовний експериментальний API інференсу LLM
Hetzner випустила експериментальний API інференсу, сумісний з OpenAI, який працює на власній європейській інфраструктурі. Розробники можуть протестувати Qwen3.6-35B-A3B-FP8 із низькою затримкою за допомогою стандартних OpenAI SDK або OpenCode.
Вплив: Середній
Чому це важливо
Ви можете спрямувати свої агентні фреймворки та локальні кодинг-асистенти на швидкий безкоштовний європейський ендпоінт уже зараз.
TL;DR
- 01Hetzner надає безкоштовний OpenAI-сумісний ендпоінт для Qwen3.6-35B-A3B-FP8 із контекстом 262K.
- 02Швидкість генерації перевищує 220 токенів на секунду при TTFT у 153 мс.
- 03Недокументований параметр `enable_thinking` дозволяє вмикати ланцюжок міркувань.
Ключові факти
- Доступна модель
- Qwen/Qwen3.6-35B-A3B-FP8
- Контекстне вікно
- 262 000 токенів
- Медіанний TTFT
- 153 мс
- Швидкість генерації
- 224 токени/сек
- Ціна
- Безкоштовно під час тесту
Налаштування експериментального ендпоінту
Hetzner надає базовий URL https://inference.hetzner.com/api/v1, сумісний із кодом OpenAI. Для початку роботи необхідно створити токен у панелі Hetzner Experiments та вказати нову адресу в клієнтській бібліотеці.
Характеристики моделі та продуктивність
Модель Qwen/Qwen3.6-35B-A3B-FP8 займає близько 38 ГБ відеопам'яті. Перші виміри показують:
- Затримка до першого токена (TTFT): 153 мс на відкритому з'єднанні.
- Швидкість генерації: 224 токени/сек при ліміті генерації в 512 токенів.
- Прапор роздумів: Передача
enable_thinking: trueактивує генерацію проміжних ланцюжків міркувань.
Спробуй за 2 хвилини
from openai import OpenAI
client = OpenAI(
base_url="https://inference.hetzner.com/api/v1",
api_key="YOUR_HETZNER_EXPERIMENTS_TOKEN"
)
response = client.chat.completions.create(
model="Qwen/Qwen3.6-35B-A3B-FP8",
messages=[{"role": "user", "content": "Explain LLM prompt caching in one clear sentence."}]
)
print(response.choices[0].message.content)python
✓ Коли використовувати
- Порівняльне тестування швидкості відкритих моделей проти пропрієтарних API.
- Запуск локальних агентних циклів без витрат на токени.
✕ Коли НЕ варто
- Продакшн-системи, які вимагають суворого SLA та гарантій доступності.
- Проєкти з регуляторними вимогами щодо фіксованого розкриття інфраструктури.
Що зробити сьогодні
- Згенеруйте токен API у панелі Hetzner Experiments.
- Змініть base_url в OpenAI SDK на https://inference.hetzner.com/api/v1 для тестування агентів.
- Підключіть OpenCode до безкоштовного європейського ендпоінту.
Що каже спільнота
“Interesting, didn’t know about them! Weird model selection though, no glm or deepseek?”
Джерела