Тест SemiAnalysis AgentX вимірює реальне споживання токенів та ефективність AI-агентів
NVIDIA опублікувала дані тестування AgentX, які свідчать, що AI-агенти споживають у 15 разів більше токенів на запит, ніж звичайний чат. Тест відтворює сесії Claude Code для оцінки роботи з довгим контекстом та повторного використання KV-кешу.

Вплив: Високий
Чому це важливо
Оцінка серверних платформ LLM вимагає динамічного відтворення сесій агентів замість статичних тестів для точного вимірювання навантаження на KV-кеш.
TL;DR
- 01Агентні сесії ґенерують у 15 разів більше токенів, ніж класичний чат з LLM.
- 02Тестування серверів LLM вимагає інструментів відтворення (AIPerf) для симуляції навантаження на KV-кеш.
- 03Інференс-рушії повинні оптимізувати префіл довгого контексту для збереження низької затримки TTFT.
Ключові факти
- Множник токенів агентів
- 15x токенів на запит порівняно з чатом (телеметрія OpenRouter)
- Зростання промптів
- 4x середня довжина вхідного промпту
- Ефективність Vera Rubin vs GB300
- 30x пропускна здатність на МВт (за даними NVIDIA)
- Вартість токенів GB300 vs H200
- 10x нижча вартість за 1М токенів (за даними NVIDIA)
Зміна паттернів споживання
Дані на базі 100 трильйонів токенів свідчать, що агентні робочі процеси змінюють вимоги до обчислень LLM. Окремі запити агентів споживають у 15 разів більше токенів порівняно з чатом, а середня довжина промпту зросла приблизно в 4 рази.
Бенчмарк AgentX від SemiAnalysis
Створений у рамках комплексу InferenceX, AgentX замінює статичні тести динамічним відтворенням реальних сесій кодинг-агента Claude Code. Використовуючи клієнт AIPerf, AgentX відтворює навантаження на KV-кеш, часові паузи між викликами інструментів у серверах SGLang, vLLM та TensorRT-LLM.
Ключові метрики продуктивності
AgentX запроваджує чотири основні метрики для оцінки інфраструктури агентного інференсу:
- E2E Normalized Interactivity: Загальна кількість токенів виводу, поділена на повний час запиту із урахуванням TTFT.
- Standard Interactivity: Швидкість генерації токенів після появи першого токена.
- E2E Latency: Повний час виконання запиту від відправки до останнього токена.
- Time to First Token (TTFT): Затримка до початку стрімінгу при роботі з довгим контекстом.
✓ Коли використовувати
- Проектування високонавантаженої інфраструктури інференсу LLM для кодинг-агентів.
- Оцінка ефективності кешування промптів та повторного використання KV-кешу.
✕ Коли НЕ варто
- Оцінка простих одноразових чат-ботів без виклику інструментів.
- Вимірювання локальних моделей без накопичення тривалого контексту.
Що зробити сьогодні
- Проведіть аудит стратегій кетування промптів у власних агентах для Claude Code та Cursor.
- Протестуйте локальні рушії (vLLM, SGLang) за допомогою динамічних трейсів контексту.
Джерела