Перейти до вмісту
ГоловнаНовиниДайджестиКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Оптимізація токенів/
  4. Рушій сховища OpenLake очолив MLPerf Storage v3.0 для чекпоїнтингу LLM
Оптимізація токенів

Рушій сховища OpenLake очолив MLPerf Storage v3.0 для чекпоїнтингу LLM

OpenLake представила асинхронний рушій сховища для тренування LLM і вивантаження KV-кешу, посівши перше місце в MLPerf Storage v3.0. Він досяг 6,72 ГіБ/с на запис і 11,55 ГіБ/с на читання під час чекпоїнтингу Llama 3.1 8B.

6 вересня 2026 р.· 5 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 6 вересня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Рушій сховища OpenLake очолив MLPerf Storage v3.0 для чекпоїнтингу LLM

Вплив: Середній

Чому це важливо

Скоротіть час простою GPU під час розподіленого навчання та прискорте вивантаження KV-кешу в сховище.

TL;DR

  • 01OpenLake продемонстрував 6,72 ГіБ/с запису та 11,55 ГіБ/с читання у MLPerf Storage v3.0.
  • 02Поєднання Rust compio, io_uring та GPUDirect Storage усуває затримки планувальника ядра під час I/O.
  • 03Скорочує час паузи на чекпоїнт моделі Llama 3.1 8B до 29,42 секунди через стандартний S3 API.

Ключові факти

11,55 ГіБ/сПропускна здатність читання
29,42 сЧас запису чекпоїнта (Llama 3.1 8B)
9,37 сЧас відновлення (Llama 3.1 8B)
Пропускна здатність запису
6,72 ГіБ/с (MLPerf Storage v3.0)
Пропускна здатність читання
11,55 ГіБ/с
Час запису чекпоїнта (Llama 3.1 8B)
29,42 с
Час відновлення (Llama 3.1 8B)
9,37 с
Мережева інфраструктура
400 Гбіт/с InfiniBand до S3 API

Результати бенчмарку MLPerf Storage v3.0

Рушій Infinity Core від OpenLake посів перше місце в закритому дивізіоні S3 бенчмарку MLCommons MLPerf Storage v3.0. На навантаженні чекпоїнтингу Llama 3.1 8B (8 процесів, що записують і зчитують 16 файлів протягом 10 ітерацій) OpenLake забезпечив пропускну здатність запису 6,72 ГіБ/с — це в 1,98 раза швидше за найближчого конкурента (NVIDIA AIStore, 3,40 ГіБ/с) та Nebius Object Storage (2,81 ГіБ/с).

Архітектура Thread-Per-Core та вивантаження KV-кешу

OpenLake реалізує асинхронний рушій вводу-виводу на Rust за допомогою бібліотеки compio (архітектура один потік на ядро), системних викликів io_uring, GPUDirect Storage та стиснення безпосередньо на GPU. Підключення відбувається через S3 API поверх 400 Гбіт/с InfiniBand до NVMe-шлюзів. За даними розробників, кластер на 96 вузлах забезпечує понад 1 мільйон IOPS із затримкою до 1 мс.

Скорочення простоїв кластерів GPU

При синхронному розподіленому навчанні всі прискорювачі блокуються, доки стан моделі не збережеться на надійний носій. OpenLake зменшив середній час запису чекпоїнта Llama 3.1 8B до 29,42 секунди (проти 37,24 с у Nebius), а тривалість читання при збої — до 9,37 секунди (пропускна здатність 11,55 ГіБ/с). Така продуктивність усуває непродуктивні простої GPU та прискорює ротацію KV-кешу.

Спробуй за 2 хвилини

git clone https://github.com/openlake-project/openlake.git
cd openlake && cargo build --release

bash

✓ Коли використовувати

  • Використовуйте при масштабуванні розподіленого навчання або RL-пайплайнів, де збереження стану блокує GPU.
  • Використовуйте для вивантаження KV-кешу довгих контекстів із пам'яті GPU на NVMe-диски через S3-інтерфейс.

✕ Коли НЕ варто

  • Не використовуйте для інференсу на одній GPU, де розмір KV-кешу не перевищує обсяг відеопам'яті.
  • Не підходить для інфраструктури без NVMe та швидкісної мережі (InfiniBand/RoCE), де переваги io_uring нівелюються.

Що зробити сьогодні

  • →Ознайомтеся з репозиторієм openlake, щоб порівняти швидкість чекпоїнтингу вашого кластера з 6,72 ГіБ/с.
  • →Розгляньте перехід на шлюзи з io_uring, якщо кластер GPU витрачає понад 10% часу на очікування запису стану.

Що каже спільнота

  • “Today we are launching OpenLake, a KV offloading solution for modern LLM workloads. OpenLake achieved 1M+ iops in 1ms on a 96 node cluster... through rust compio with on GPU compression.”

    — arnav__1 на Hacker News

#OpenLake#io_uring#Rust#NVIDIA AIStore#GPUDirect Storage

Джерела

  • OpenLake Leads MLPerf Storage v3.0
  • OpenLake on GitHub
  • Hacker News Announcement
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаAnthropic випустила згенерований ШІ-агентами доказ великої теореми Ферма в Lean 4Наступна новина →OpenMAIC 1.0 додає воркбенчі агентів та мультиагентну генерацію навчальних курсів

Схожі матеріали

  • Оптимізація токенівGoogle запустив агентський аналіз відео у Gemini зі зниженням витрат токенів на 88%
  • Оптимізація токенівТюнінг моделі на 350M параметрів для структурованого виводу через GRPO
  • Оптимізація токенівGemini впроваджує агентну обробку відео та зменшує витрати токенів на 88 відсотків
  • Оптимізація токенівHugging Face випускає 200+ ядер WebGPU для прискорення локального AI

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.