Перейти до вмісту
ГоловнаНовиниКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Оптимізація токенів/
  4. Тест SemiAnalysis AgentX вимірює реальне споживання токенів та ефективність AI-агентів
Оптимізація токенів

Тест SemiAnalysis AgentX вимірює реальне споживання токенів та ефективність AI-агентів

NVIDIA опублікувала дані тестування AgentX, які свідчать, що AI-агенти споживають у 15 разів більше токенів на запит, ніж звичайний чат. Тест відтворює сесії Claude Code для оцінки роботи з довгим контекстом та повторного використання KV-кешу.

25 серпня 2026 р.· 4 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 25 серпня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Тест SemiAnalysis AgentX вимірює реальне споживання токенів та ефективність AI-агентів

Вплив: Високий

Чому це важливо

Оцінка серверних платформ LLM вимагає динамічного відтворення сесій агентів замість статичних тестів для точного вимірювання навантаження на KV-кеш.

TL;DR

  • 01Агентні сесії ґенерують у 15 разів більше токенів, ніж класичний чат з LLM.
  • 02Тестування серверів LLM вимагає інструментів відтворення (AIPerf) для симуляції навантаження на KV-кеш.
  • 03Інференс-рушії повинні оптимізувати префіл довгого контексту для збереження низької затримки TTFT.

Ключові факти

Множник токенів агентів
15x токенів на запит порівняно з чатом (телеметрія OpenRouter)
Зростання промптів
4x середня довжина вхідного промпту
Ефективність Vera Rubin vs GB300
30x пропускна здатність на МВт (за даними NVIDIA)
Вартість токенів GB300 vs H200
10x нижча вартість за 1М токенів (за даними NVIDIA)

Зміна паттернів споживання

Дані на базі 100 трильйонів токенів свідчать, що агентні робочі процеси змінюють вимоги до обчислень LLM. Окремі запити агентів споживають у 15 разів більше токенів порівняно з чатом, а середня довжина промпту зросла приблизно в 4 рази.

Бенчмарк AgentX від SemiAnalysis

Створений у рамках комплексу InferenceX, AgentX замінює статичні тести динамічним відтворенням реальних сесій кодинг-агента Claude Code. Використовуючи клієнт AIPerf, AgentX відтворює навантаження на KV-кеш, часові паузи між викликами інструментів у серверах SGLang, vLLM та TensorRT-LLM.

Ключові метрики продуктивності

AgentX запроваджує чотири основні метрики для оцінки інфраструктури агентного інференсу:

  • E2E Normalized Interactivity: Загальна кількість токенів виводу, поділена на повний час запиту із урахуванням TTFT.
  • Standard Interactivity: Швидкість генерації токенів після появи першого токена.
  • E2E Latency: Повний час виконання запиту від відправки до останнього токена.
  • Time to First Token (TTFT): Затримка до початку стрімінгу при роботі з довгим контекстом.

✓ Коли використовувати

  • Проектування високонавантаженої інфраструктури інференсу LLM для кодинг-агентів.
  • Оцінка ефективності кешування промптів та повторного використання KV-кешу.

✕ Коли НЕ варто

  • Оцінка простих одноразових чат-ботів без виклику інструментів.
  • Вимірювання локальних моделей без накопичення тривалого контексту.

Що зробити сьогодні

  • →Проведіть аудит стратегій кетування промптів у власних агентах для Claude Code та Cursor.
  • →Протестуйте локальні рушії (vLLM, SGLang) за допомогою динамічних трейсів контексту.
#Claude Code#vLLM#SGLang#TensorRT-LLM#OpenRouter

Джерела

  • NVIDIA Developer Blog: Vera Rubin and Blackwell Agentic AI Benchmark
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаДослідження JetBrains та UPenn виявили роль негативної експертизи в AI-розробціНаступна новина →Фреймворк SELF замінює заголовки бінарників ELF на бази даних SQLite із підтримкою SQL-запитів

Схожі матеріали

  • Оптимізація токенівOpenAI знижує ціни на API та кредити Codex для GPT-5.6 Sol на понад 20%
  • Оптимізація токенівНативний Bedrock Codex без явного керування кешем спричиняє високі витрати на запис
  • Оптимізація токенівHugging Face виявила перенавчання на бенчмарках у провідних мовних AI-моделях
  • Оптимізація токенівChatGPT Search масштабно впроваджує оператори доменів у релізі GPT-5.6 Sol

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.