DeepSeek випускає V4.1 Flash зі зниженням вартості кешованих токенів на 60 відсотків
DeepSeek представила V4.1 Flash — модель на 552 мільярди параметрів, з яких під час обробки вхідних даних активуються лише 8 мільярдів, а на виході — 16 мільярдів. Архітектура зменшує розмір KV-кешу до 890 байтів на токен і знижує ціну кешованого контексту до $0.003 за 1 млн токенів при результаті 74.2 у DeepSWE v1.1.

Вплив: Високий
Чому це важливо
Ви можете скоротити витрати на повторюваний контекст у багатокрокових сесіях кодування на 60% без оновлення клієнтів, оскільки старі ендпоінти автоматично перенаправляються на V4.1 Flash.
TL;DR
- 01Ціна кешованого контексту впала на 60% до $0.003 за 1 млн токенів у непіковий час.
- 02Розмір KV-кешу зменшено до 890 байтів на токен завдяки FP4-квантуванню та Compressed Sparse Attention 2.
- 03Вікно контексту підтримує 1 млн вхідних токенів і до 384 тис. вихідних із вбудованою мультимодальністю.
- 04Модель випереджає Claude Opus 5 у DeepSWE v1.1 (74.2 проти 74.0), але помітно відстає у Terminal-Bench 3.0 (30.0 проти 43.3).
Ключові факти
- Загальні / активні параметри
- 552 млрд всього, 8 млрд вхідні, 16 млрд вихідні
- Вартість кешованого входу (непік)
- $0.003 за 1 млн токенів (-60%)
- Розмір KV-кешу
- 890 байтів на токен
- Ліміти вікна контексту
- 1 млн вхідних, 384 тис. вихідних токенів
- Результат у DeepSWE v1.1
- 74.2 (за даними розробника)
- Результат у Terminal-Bench 3.0
- 30.0 (за даними розробника)
Архітектура Causal Encoder-Decoder
DeepSeek V4.1 Flash відмовляється від стандартного щільного виконання на користь Causal Encoder-Decoder із 552 млрд сумарних параметрів у 20 шарах енкодера та 20 шарах декодера. Під час обробки вхідного запиту активуються лише 8 млрд параметрів, а під час генерації відповіді — 16 млрд, що кардинально знижує обчислювальне навантаження.
Стиснення KV-кешу та тарифікація
Об'єм пам'яті KV-кешу є головним обмеженням для роботи з довгим контекстом. Завдяки Compressed Sparse Attention 2 та квантуванню кешу у FP4, розмір кешу зменшено до 890 байтів на токен (чверть від V4-Flash та одна восьма від попередніх релізів).
- Кешований вхід: $0.003 за 1 млн токенів у години низького навантаження (-60%).
- Некешований вхід: зниження ціни на 33%.
- Вихідні токени: зниження ціни на 11%.
- Ліміти контексту: вікно на 1 000 000 токенів із максимальною довжиною генерації до 384 000 токенів.
Міграція та мультимодальність
Обробка зображень інтегрована в ядро моделі через архітектуру DeepSeek-ViT, що усунуло потребу в окремому варіанті deepseek-v4-flash-vision-exp. Запити на ідентифікатор deepseek-v4-flash уже направляються на версію 4.1 Flash, а трафік deepseek-v4-pro перейде 14 вересня за тарифами Flash.
Спробуй за 2 хвилини
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash",
"messages": [{"role": "user", "content": "Analyze repo AST"}],
"max_tokens": 4096
}'bash
✓ Коли використовувати
- Аналіз великих кодових баз та індексація документації з частим повторним використанням кешованого промпту.
- Автономні конвеєри генерації коду та рефакторингу, орієнтовані на показники DeepSWE.
- Мультимодальний аналіз інтерфейсів та діаграм без потреби оплачувати окремі vision-моделі.
✕ Коли НЕ варто
- Інтерактивні агентні сесії з тривалим живим налагодженням у shell-терміналі (30.0 проти 43.3 у Opus 5).
- Автономні edge-системи без доступу до хмари з обмеженим обсягом локальної відеопам'яті.
Що зробити сьогодні
- Оновіть конфігурацію викликів API для максимізації промпт-кешування у багатокрокових скриптах.
- Відмовтеся від окремих vision-exp ендпоінтів, оскільки підтримка зображень тепер увімкнена за замовчуванням.
- Протестуйте автономні сценарії в терміналі через знижений бал моделі в Terminal-Bench 3.0.
Джерела