Перейти до вмісту
ГоловнаНовиниДайджестиКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Оптимізація токенів/
  4. NVIDIA зменшує накладні витрати конфіденційних обчислень у TensorRT-LLM до менш ніж п'яти відсотків
Оптимізація токенів

NVIDIA зменшує накладні витрати конфіденційних обчислень у TensorRT-LLM до менш ніж п'яти відсотків

NVIDIA представила архітектурні оптимізації в TensorRT-LLM для конфіденційних обчислень на системах DGX B200. Рішення зберігає понад 96% пропускної здатності на DeepSeek-R1 із затримкою токенів менше 5%.

23 вересня 2026 р.· 5 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 23 вересня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
NVIDIA зменшує накладні витрати конфіденційних обчислень у TensorRT-LLM до менш ніж п'яти відсотків

Вплив: Високий

Чому це важливо

Тепер можна запускати регульовані та чутливі до приватності навантаження LLM на корпоративних GPU без відчутної втрати швидкодії.

TL;DR

  • 01Конфіденційні обчислення на NVIDIA B200 зберігають 96.1–98.2% базової пропускної здатності токенів.
  • 02TensorRT-LLM уникає блокувань у буферах за рахунок заміни закріпленої пам'яті на сторінкову всередині CVM.
  • 03Автотюнінг ядер у конфіденційному режимі потребує використання таймера %globaltimer замість CUDA events.

Ключові факти

Збережена пропускна здатність
96.1–98.2% від базового рівня
Накладні витрати затримки (TPOT)
Зростання на 1.2–4.3%
Тестове обладнання
1x NVIDIA DGX B200 (8x GPU B200)
Версія ПЗ
TensorRT-LLM 1.3.0rc22

Усунення вузьких місць у захищених анклавах

Конфіденційні обчислення на вузлах NVIDIA DGX B200 ізолюють ваги моделей та промпти за допомогою апаратно зашифрованих віртуальних машин (CVM) та шифрування каналів NVLink. Проте апаратна ізоляція змінює звичні патерни роботи з пам'яттю. TensorRT-LLM впроваджує точкові оптимізації для зменшення накладних витрат:

  • Сторінкова пам'ять хоста: Оскільки захищена пам'ять CVM блокує прямий доступ GPU, передача даних з хоста на пристрій використовує зашифровані проміжні буфери. Закріплена пам'ять перестає бути асинхронною й блокує потоки, тому runtime динамічно перемикається на звичайну сторінкову пам'ять.
  • Асинхронне вивантаження токенів: Зчитування згенерованих токенів блокує основний цикл декодування. TensorRT-LLM виносить ці копіювання в окремий асинхронний потік (PR #11573).
  • Автотюнінг за апаратним таймером: Події CUDA демонструють нестабільний час виконання всередині CVM, що призводить до вибору неоптимальних ядер. Згідно з PR #11657, вимірювання тактик тепер використовує регістр %globaltimer.

Показники пропускної здатності та затримки

Під час тестів на довгих контекстах і низькому рівні паралелізму кластер з 8 GPU NVIDIA B200 під керуванням TensorRT-LLM 1.3.0rc22 продемонстрував збереження 96.1–98.2% пропускної здатності порівняно з незахищеним середовищем. Затримка на генерацію токена (TPOT) зросла лише на 1.2–4.3%.

Інженерам інфраструктури слід враховувати, що мультикаст NVLink SHARP (NVLS) недоступний у конфіденційному режимі B200, тому алгоритми NCCL мають обиратися без розрахунку на апаратний мультикаст.

Спробуй за 2 хвилини

docker pull nvcr.io/nvidia/tensorrt-llm/release:1.3.0rc22

bash

✓ Коли використовувати

  • Розгортання пропрієтарних ваг моделей або конфіденційних промптів у медичних чи фінансових хмарах.
  • Запуск DeepSeek-R1 та моделей міркування в умовах нульової довіри (zero-trust) на сторонній інфраструктурі.

✕ Коли НЕ варто

  • Для локальної розробки без вимог регуляторної ізоляції даних та мультиарендності.
  • Якщо ваша архітектура жорстко спирається на апаратний мультикаст NVLink SHARP.

Що зробити сьогодні

  • →Оновіть робочі контейнери інференсу до версії TensorRT-LLM 1.3.0rc22 або новішої під час роботи у CVM.
  • →Вимкніть використання колективних шляхів NVLink SHARP у налаштуваннях NCCL для конфіденційних середовищ.
  • →Протестуйте метрику Time Per Output Token при паралелізмі від 1 до 16, щоб зафіксувати накладні витрати шифрування.
#TensorRT-LLM#NVIDIA Blackwell#Docker#NVIDIA Container Toolkit

Джерела

  • Enabling Private High-Performance Production AI Inference with NVIDIA Confidential Computing
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаAnthropic випустила Claude Opus 5.5 зі зниженими цінами та кращим кодингомНаступна новина →Захист клієнтів Model Context Protocol: обмежена пагінація та перевірка конформності

Схожі матеріали

  • Оптимізація токенівFast Jev Compaction замінює втратні підсумки контексту в Claude Code
  • Оптимізація токенівAnthropic відкрила GPU-ядра від Claude, що прискорюють інференс у 4 рази
  • Оптимізація токенівOpenAI переписала сервіс сховища на Rust силами двох інженерів і ШІ
  • Оптимізація токенівDeepSeek випускає V4.1 Flash зі зниженням вартості кешованих токенів на 60 відсотків

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.