Liquid AI прискорює локальні мультимодальні моделі завдяки спекулятивному декодуванню LFM2.5-VL-DSpark
Liquid AI представила експериментальну драфт-модель DSpark для мультимодальної LFM2.5-VL-3B, додавши спекулятивне декодування у локальні та серверні середовища. Вона забезпечує до 3,13x вищу швидкість декодування на клієнтських пристроях без втрати якості.

Вплив: Високий
Чому це важливо
Прискорюйте локальний мультимодальний інференс до 2,62x від початку до кінця на Apple Silicon та серверних GPU за допомогою офіційних збірок llama.cpp, MLX та SGLang.
TL;DR
- 01Додає спекулятивне декодування для моделі LFM2.5-VL-3B із витратами пам'яті лише 8,9% (280M параметрів).
- 02Забезпечує скорочення загальної затримки в 1,56x–2,62x на Apple Silicon та до 2,27x на картах NVIDIA H100.
- 03Гарантує абсолютну точність результату без втрати якості при жадібному семплуванні.
- 04Має готову підтримку в екосистемах llama.cpp, MLX-VLM та SGLang.
Ключові факти
- Кількість параметрів драфтера
- 280 млн параметрів (8,9% цільової 3B-моделі)
- Прискорення декодування на M5 Max
- 2,30x – 3,13x (за даними авторів)
- Прискорення декодування на H100
- 20,4x – 2,66x (за даними авторів)
- Зниження затримки end-to-end на M5 Max
- 1,56x – 2,62x (за даними авторів)
- Рекомендований розмір блоку
- 8 або 9
Спекулятивна архітектура для обробки зображень
Візуальний драфтер Liquid AI базується на підході текстових моделей DSpark: він зчитує приховані стани (hidden states) цільової моделі на фіксованому наборі проміжних шарів і пропонує послідовність кандидатів. Оскільки фрагменти зображень і текст проектуються у спільний векторний простір, драфтер працює з векторами однакової розмірності незалежно від вхідної модальності. Драфт-модель складається з 4 шарів уваги, натренованих за 10 епох на датасеті мультимодального SFT.
Результати тестування на Edge та Серверах
Тестування проводилося за бенчмарком MMSpec на задачах аналізу графіків, читання тексту із зображень та мультимодальних діалогів:
- Apple M5 Max (MLX-VLM): декодування швидше у 2,30x–3,13x, скорочення загальної затримки в 1,56x–2,62x при розмірі блоку 8.
- Apple M3 Ultra (llama.cpp): прискорення декодування в 1,57x–2,14x та покращення кінцевої затримки в 1,30x–1,77x.
- NVIDIA H100 (SGLang): прискорення декодування від 20,4x до 2,66x, покращення кінцевої затримки в 1,64x–2,27x з бекендом FlashInfer.
Запуск та Інтеграція
Моделі постачаються з підтримкою першого дня у SGLang (PR #40651), llama.cpp (PR #29339) та MLX-VLM (PR #2280). Оскільки верифікація є математично точною, вихідний текст у режимі жадібного декодування (greedy decoding) повністю збігається з оригінальною моделлю 3B.
Спробуй за 2 хвилини
llama-server -m models/LFM2.5-VL-3B-F16.gguf \
--mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \
--spec-type draft-dspark --spec-draft-n-max 8 --spec-draft-n-min 0bash
✓ Коли використовувати
- Локальний запуск OCR, аналіз графіків або мультимодальний діалог на Apple Silicon через MLX або llama.cpp.
- Серверні системи високого навантаження для обробки зображень на базі NVIDIA H100 та SGLang.
✕ Коли НЕ варто
- Сценарії, де енкодинг зображення та prefill займають понад 90% часу, оскільки метод не прискорює первинну обробку.
- Системи з критичним дефіцитом оперативної пам'яті або VRAM, де неможливо виділити додаткові 280 млн параметрів.
Що зробити сьогодні
- Завантажте ваги моделі у форматах GGUF або Safetensors зі сховища LiquidAI/LFM2.5-VL-3B-DSpark на Hugging Face.
- Оновіть локальні бінарники llama.cpp або MLX-VLM до версій із підтримкою DSpark.
- Встановіть розмір блоку спекуляції на 8 або 9 у прапорцях запуску локального сервера.
Джерела