Перейти до вмісту
ГоловнаНовиниДайджестиКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Оптимізація токенів/
  4. DeepSeek випускає V4.1 Flash зі зниженням вартості кешованих токенів на 60 відсотків
Оптимізація токенів

DeepSeek випускає V4.1 Flash зі зниженням вартості кешованих токенів на 60 відсотків

DeepSeek представила V4.1 Flash — модель на 552 мільярди параметрів, з яких під час обробки вхідних даних активуються лише 8 мільярдів, а на виході — 16 мільярдів. Архітектура зменшує розмір KV-кешу до 890 байтів на токен і знижує ціну кешованого контексту до $0.003 за 1 млн токенів при результаті 74.2 у DeepSWE v1.1.

12 вересня 2026 р.· 6 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 12 вересня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
DeepSeek випускає V4.1 Flash зі зниженням вартості кешованих токенів на 60 відсотків

Вплив: Високий

Чому це важливо

Ви можете скоротити витрати на повторюваний контекст у багатокрокових сесіях кодування на 60% без оновлення клієнтів, оскільки старі ендпоінти автоматично перенаправляються на V4.1 Flash.

TL;DR

  • 01Ціна кешованого контексту впала на 60% до $0.003 за 1 млн токенів у непіковий час.
  • 02Розмір KV-кешу зменшено до 890 байтів на токен завдяки FP4-квантуванню та Compressed Sparse Attention 2.
  • 03Вікно контексту підтримує 1 млн вхідних токенів і до 384 тис. вихідних із вбудованою мультимодальністю.
  • 04Модель випереджає Claude Opus 5 у DeepSWE v1.1 (74.2 проти 74.0), але помітно відстає у Terminal-Bench 3.0 (30.0 проти 43.3).

Ключові факти

Розмір KV-кешу890 байтів на токен
Результат у DeepSWE v1.174.2 (за даними розробника)
Результат у Terminal-Bench 3.030.0 (за даними розробника)
Загальні / активні параметри
552 млрд всього, 8 млрд вхідні, 16 млрд вихідні
Вартість кешованого входу (непік)
$0.003 за 1 млн токенів (-60%)
Розмір KV-кешу
890 байтів на токен
Ліміти вікна контексту
1 млн вхідних, 384 тис. вихідних токенів
Результат у DeepSWE v1.1
74.2 (за даними розробника)
Результат у Terminal-Bench 3.0
30.0 (за даними розробника)

Архітектура Causal Encoder-Decoder

DeepSeek V4.1 Flash відмовляється від стандартного щільного виконання на користь Causal Encoder-Decoder із 552 млрд сумарних параметрів у 20 шарах енкодера та 20 шарах декодера. Під час обробки вхідного запиту активуються лише 8 млрд параметрів, а під час генерації відповіді — 16 млрд, що кардинально знижує обчислювальне навантаження.

Стиснення KV-кешу та тарифікація

Об'єм пам'яті KV-кешу є головним обмеженням для роботи з довгим контекстом. Завдяки Compressed Sparse Attention 2 та квантуванню кешу у FP4, розмір кешу зменшено до 890 байтів на токен (чверть від V4-Flash та одна восьма від попередніх релізів).

  • Кешований вхід: $0.003 за 1 млн токенів у години низького навантаження (-60%).
  • Некешований вхід: зниження ціни на 33%.
  • Вихідні токени: зниження ціни на 11%.
  • Ліміти контексту: вікно на 1 000 000 токенів із максимальною довжиною генерації до 384 000 токенів.

Міграція та мультимодальність

Обробка зображень інтегрована в ядро моделі через архітектуру DeepSeek-ViT, що усунуло потребу в окремому варіанті deepseek-v4-flash-vision-exp. Запити на ідентифікатор deepseek-v4-flash уже направляються на версію 4.1 Flash, а трафік deepseek-v4-pro перейде 14 вересня за тарифами Flash.

Спробуй за 2 хвилини

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [{"role": "user", "content": "Analyze repo AST"}],
    "max_tokens": 4096
  }'

bash

✓ Коли використовувати

  • Аналіз великих кодових баз та індексація документації з частим повторним використанням кешованого промпту.
  • Автономні конвеєри генерації коду та рефакторингу, орієнтовані на показники DeepSWE.
  • Мультимодальний аналіз інтерфейсів та діаграм без потреби оплачувати окремі vision-моделі.

✕ Коли НЕ варто

  • Інтерактивні агентні сесії з тривалим живим налагодженням у shell-терміналі (30.0 проти 43.3 у Opus 5).
  • Автономні edge-системи без доступу до хмари з обмеженим обсягом локальної відеопам'яті.

Що зробити сьогодні

  • →Оновіть конфігурацію викликів API для максимізації промпт-кешування у багатокрокових скриптах.
  • →Відмовтеся від окремих vision-exp ендпоінтів, оскільки підтримка зображень тепер увімкнена за замовчуванням.
  • →Протестуйте автономні сценарії в терміналі через знижений бал моделі в Terminal-Bench 3.0.
#DeepSeek#DeepSeek V4.1 Flash#DeepSeek-ViT#Claude Opus 5#GPT-5.6 Sol

Джерела

  • DeepSeek V4.1 Flash: New Architecture, 8B Active, 60% Price Cut
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаАвтономні агенти OpenAI атакували репозиторій пакетів RubyGems у нерозкритій атаці

Схожі матеріали

  • Оптимізація токенівOpenAI переписала сервіс сховища на Rust силами двох інженерів і ШІ
  • Оптимізація токенівПлагін Ponytail скорочує кодову базу ШІ-агентів удвічі без втрати надійності
  • Оптимізація токенівРушій сховища OpenLake очолив MLPerf Storage v3.0 для чекпоїнтингу LLM
  • Оптимізація токенівGoogle запустив агентський аналіз відео у Gemini зі зниженням витрат токенів на 88%

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.