Рушій сховища OpenLake очолив MLPerf Storage v3.0 для чекпоїнтингу LLM
OpenLake представила асинхронний рушій сховища для тренування LLM і вивантаження KV-кешу, посівши перше місце в MLPerf Storage v3.0. Він досяг 6,72 ГіБ/с на запис і 11,55 ГіБ/с на читання під час чекпоїнтингу Llama 3.1 8B.

Вплив: Середній
Чому це важливо
Скоротіть час простою GPU під час розподіленого навчання та прискорте вивантаження KV-кешу в сховище.
TL;DR
- 01OpenLake продемонстрував 6,72 ГіБ/с запису та 11,55 ГіБ/с читання у MLPerf Storage v3.0.
- 02Поєднання Rust compio, io_uring та GPUDirect Storage усуває затримки планувальника ядра під час I/O.
- 03Скорочує час паузи на чекпоїнт моделі Llama 3.1 8B до 29,42 секунди через стандартний S3 API.
Ключові факти
- Пропускна здатність запису
- 6,72 ГіБ/с (MLPerf Storage v3.0)
- Пропускна здатність читання
- 11,55 ГіБ/с
- Час запису чекпоїнта (Llama 3.1 8B)
- 29,42 с
- Час відновлення (Llama 3.1 8B)
- 9,37 с
- Мережева інфраструктура
- 400 Гбіт/с InfiniBand до S3 API
Результати бенчмарку MLPerf Storage v3.0
Рушій Infinity Core від OpenLake посів перше місце в закритому дивізіоні S3 бенчмарку MLCommons MLPerf Storage v3.0. На навантаженні чекпоїнтингу Llama 3.1 8B (8 процесів, що записують і зчитують 16 файлів протягом 10 ітерацій) OpenLake забезпечив пропускну здатність запису 6,72 ГіБ/с — це в 1,98 раза швидше за найближчого конкурента (NVIDIA AIStore, 3,40 ГіБ/с) та Nebius Object Storage (2,81 ГіБ/с).
Архітектура Thread-Per-Core та вивантаження KV-кешу
OpenLake реалізує асинхронний рушій вводу-виводу на Rust за допомогою бібліотеки compio (архітектура один потік на ядро), системних викликів io_uring, GPUDirect Storage та стиснення безпосередньо на GPU. Підключення відбувається через S3 API поверх 400 Гбіт/с InfiniBand до NVMe-шлюзів. За даними розробників, кластер на 96 вузлах забезпечує понад 1 мільйон IOPS із затримкою до 1 мс.
Скорочення простоїв кластерів GPU
При синхронному розподіленому навчанні всі прискорювачі блокуються, доки стан моделі не збережеться на надійний носій. OpenLake зменшив середній час запису чекпоїнта Llama 3.1 8B до 29,42 секунди (проти 37,24 с у Nebius), а тривалість читання при збої — до 9,37 секунди (пропускна здатність 11,55 ГіБ/с). Така продуктивність усуває непродуктивні простої GPU та прискорює ротацію KV-кешу.
Спробуй за 2 хвилини
git clone https://github.com/openlake-project/openlake.git
cd openlake && cargo build --releasebash
✓ Коли використовувати
- Використовуйте при масштабуванні розподіленого навчання або RL-пайплайнів, де збереження стану блокує GPU.
- Використовуйте для вивантаження KV-кешу довгих контекстів із пам'яті GPU на NVMe-диски через S3-інтерфейс.
✕ Коли НЕ варто
- Не використовуйте для інференсу на одній GPU, де розмір KV-кешу не перевищує обсяг відеопам'яті.
- Не підходить для інфраструктури без NVMe та швидкісної мережі (InfiniBand/RoCE), де переваги io_uring нівелюються.
Що зробити сьогодні
- Ознайомтеся з репозиторієм openlake, щоб порівняти швидкість чекпоїнтингу вашого кластера з 6,72 ГіБ/с.
- Розгляньте перехід на шлюзи з io_uring, якщо кластер GPU витрачає понад 10% часу на очікування запису стану.
Що каже спільнота
“Today we are launching OpenLake, a KV offloading solution for modern LLM workloads. OpenLake achieved 1M+ iops in 1ms on a 96 node cluster... through rust compio with on GPU compression.”
Джерела