NVIDIA зменшує накладні витрати конфіденційних обчислень у TensorRT-LLM до менш ніж п'яти відсотків
NVIDIA представила архітектурні оптимізації в TensorRT-LLM для конфіденційних обчислень на системах DGX B200. Рішення зберігає понад 96% пропускної здатності на DeepSeek-R1 із затримкою токенів менше 5%.

Вплив: Високий
Чому це важливо
Тепер можна запускати регульовані та чутливі до приватності навантаження LLM на корпоративних GPU без відчутної втрати швидкодії.
TL;DR
- 01Конфіденційні обчислення на NVIDIA B200 зберігають 96.1–98.2% базової пропускної здатності токенів.
- 02TensorRT-LLM уникає блокувань у буферах за рахунок заміни закріпленої пам'яті на сторінкову всередині CVM.
- 03Автотюнінг ядер у конфіденційному режимі потребує використання таймера %globaltimer замість CUDA events.
Ключові факти
- Збережена пропускна здатність
- 96.1–98.2% від базового рівня
- Накладні витрати затримки (TPOT)
- Зростання на 1.2–4.3%
- Тестове обладнання
- 1x NVIDIA DGX B200 (8x GPU B200)
- Версія ПЗ
- TensorRT-LLM 1.3.0rc22
Усунення вузьких місць у захищених анклавах
Конфіденційні обчислення на вузлах NVIDIA DGX B200 ізолюють ваги моделей та промпти за допомогою апаратно зашифрованих віртуальних машин (CVM) та шифрування каналів NVLink. Проте апаратна ізоляція змінює звичні патерни роботи з пам'яттю. TensorRT-LLM впроваджує точкові оптимізації для зменшення накладних витрат:
- Сторінкова пам'ять хоста: Оскільки захищена пам'ять CVM блокує прямий доступ GPU, передача даних з хоста на пристрій використовує зашифровані проміжні буфери. Закріплена пам'ять перестає бути асинхронною й блокує потоки, тому runtime динамічно перемикається на звичайну сторінкову пам'ять.
- Асинхронне вивантаження токенів: Зчитування згенерованих токенів блокує основний цикл декодування. TensorRT-LLM виносить ці копіювання в окремий асинхронний потік (PR #11573).
- Автотюнінг за апаратним таймером: Події CUDA демонструють нестабільний час виконання всередині CVM, що призводить до вибору неоптимальних ядер. Згідно з PR #11657, вимірювання тактик тепер використовує регістр
%globaltimer.
Показники пропускної здатності та затримки
Під час тестів на довгих контекстах і низькому рівні паралелізму кластер з 8 GPU NVIDIA B200 під керуванням TensorRT-LLM 1.3.0rc22 продемонстрував збереження 96.1–98.2% пропускної здатності порівняно з незахищеним середовищем. Затримка на генерацію токена (TPOT) зросла лише на 1.2–4.3%.
Інженерам інфраструктури слід враховувати, що мультикаст NVLink SHARP (NVLS) недоступний у конфіденційному режимі B200, тому алгоритми NCCL мають обиратися без розрахунку на апаратний мультикаст.
Спробуй за 2 хвилини
docker pull nvcr.io/nvidia/tensorrt-llm/release:1.3.0rc22bash
✓ Коли використовувати
- Розгортання пропрієтарних ваг моделей або конфіденційних промптів у медичних чи фінансових хмарах.
- Запуск DeepSeek-R1 та моделей міркування в умовах нульової довіри (zero-trust) на сторонній інфраструктурі.
✕ Коли НЕ варто
- Для локальної розробки без вимог регуляторної ізоляції даних та мультиарендності.
- Якщо ваша архітектура жорстко спирається на апаратний мультикаст NVLink SHARP.
Що зробити сьогодні
- Оновіть робочі контейнери інференсу до версії TensorRT-LLM 1.3.0rc22 або новішої під час роботи у CVM.
- Вимкніть використання колективних шляхів NVLink SHARP у налаштуваннях NCCL для конфіденційних середовищ.
- Протестуйте метрику Time Per Output Token при паралелізмі від 1 до 16, щоб зафіксувати накладні витрати шифрування.
Джерела