Перейти до вмісту
ГоловнаНовиниДайджестиКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Локальні LLM/
  4. Liquid AI прискорює локальні мультимодальні моделі завдяки спекулятивному декодуванню LFM2.5-VL-DSpark
Локальні LLM

Liquid AI прискорює локальні мультимодальні моделі завдяки спекулятивному декодуванню LFM2.5-VL-DSpark

Liquid AI представила експериментальну драфт-модель DSpark для мультимодальної LFM2.5-VL-3B, додавши спекулятивне декодування у локальні та серверні середовища. Вона забезпечує до 3,13x вищу швидкість декодування на клієнтських пристроях без втрати якості.

24 вересня 2026 р.· 5 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 24 вересня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Liquid AI прискорює локальні мультимодальні моделі завдяки спекулятивному декодуванню LFM2.5-VL-DSpark

Вплив: Високий

Чому це важливо

Прискорюйте локальний мультимодальний інференс до 2,62x від початку до кінця на Apple Silicon та серверних GPU за допомогою офіційних збірок llama.cpp, MLX та SGLang.

TL;DR

  • 01Додає спекулятивне декодування для моделі LFM2.5-VL-3B із витратами пам'яті лише 8,9% (280M параметрів).
  • 02Забезпечує скорочення загальної затримки в 1,56x–2,62x на Apple Silicon та до 2,27x на картах NVIDIA H100.
  • 03Гарантує абсолютну точність результату без втрати якості при жадібному семплуванні.
  • 04Має готову підтримку в екосистемах llama.cpp, MLX-VLM та SGLang.

Ключові факти

Кількість параметрів драфтера
280 млн параметрів (8,9% цільової 3B-моделі)
Прискорення декодування на M5 Max
2,30x – 3,13x (за даними авторів)
Прискорення декодування на H100
20,4x – 2,66x (за даними авторів)
Зниження затримки end-to-end на M5 Max
1,56x – 2,62x (за даними авторів)
Рекомендований розмір блоку
8 або 9

Спекулятивна архітектура для обробки зображень

Візуальний драфтер Liquid AI базується на підході текстових моделей DSpark: він зчитує приховані стани (hidden states) цільової моделі на фіксованому наборі проміжних шарів і пропонує послідовність кандидатів. Оскільки фрагменти зображень і текст проектуються у спільний векторний простір, драфтер працює з векторами однакової розмірності незалежно від вхідної модальності. Драфт-модель складається з 4 шарів уваги, натренованих за 10 епох на датасеті мультимодального SFT.

Результати тестування на Edge та Серверах

Тестування проводилося за бенчмарком MMSpec на задачах аналізу графіків, читання тексту із зображень та мультимодальних діалогів:

  • Apple M5 Max (MLX-VLM): декодування швидше у 2,30x–3,13x, скорочення загальної затримки в 1,56x–2,62x при розмірі блоку 8.
  • Apple M3 Ultra (llama.cpp): прискорення декодування в 1,57x–2,14x та покращення кінцевої затримки в 1,30x–1,77x.
  • NVIDIA H100 (SGLang): прискорення декодування від 20,4x до 2,66x, покращення кінцевої затримки в 1,64x–2,27x з бекендом FlashInfer.

Запуск та Інтеграція

Моделі постачаються з підтримкою першого дня у SGLang (PR #40651), llama.cpp (PR #29339) та MLX-VLM (PR #2280). Оскільки верифікація є математично точною, вихідний текст у режимі жадібного декодування (greedy decoding) повністю збігається з оригінальною моделлю 3B.

Спробуй за 2 хвилини

llama-server -m models/LFM2.5-VL-3B-F16.gguf \
  --mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \
  --spec-type draft-dspark --spec-draft-n-max 8 --spec-draft-n-min 0

bash

✓ Коли використовувати

  • Локальний запуск OCR, аналіз графіків або мультимодальний діалог на Apple Silicon через MLX або llama.cpp.
  • Серверні системи високого навантаження для обробки зображень на базі NVIDIA H100 та SGLang.

✕ Коли НЕ варто

  • Сценарії, де енкодинг зображення та prefill займають понад 90% часу, оскільки метод не прискорює первинну обробку.
  • Системи з критичним дефіцитом оперативної пам'яті або VRAM, де неможливо виділити додаткові 280 млн параметрів.

Що зробити сьогодні

  • →Завантажте ваги моделі у форматах GGUF або Safetensors зі сховища LiquidAI/LFM2.5-VL-3B-DSpark на Hugging Face.
  • →Оновіть локальні бінарники llama.cpp або MLX-VLM до версій із підтримкою DSpark.
  • →Встановіть розмір блоку спекуляції на 8 або 9 у прапорцях запуску локального сервера.
#llama.cpp#MLX-VLM#SGLang#LFM2.5-VL-3B#LFM2.5-VL-DSpark

Джерела

  • Liquid AI Blog: Accelerating vision-language models with LFM2.5-VL-DSpark
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаMeta відкриває конектори для агента Muse та анонсує автономність на MacНаступна новина →Відстеження оптимальних за вартістю LLM на Парето-фронтирі за бенчмарками Artificial Analysis

Схожі матеріали

  • Локальні LLMPirate Face дублює моделі Hugging Face через торенти з перевіркою контрольних сум
  • Локальні LLMBonsai 2 27B забезпечує майже безвтратне тернарне стиснення для кодинг-агентів

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.