Перейти до вмісту
ГоловнаНовиниКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Локальні LLM/
  4. Liquid AI випускає моделі LFM2.5 Q4_0 GGUF за допомогою Quantization-Aware Distillation
Локальні LLM

Liquid AI випускає моделі LFM2.5 Q4_0 GGUF за допомогою Quantization-Aware Distillation

Liquid AI випустила 4-бітні контрольні точки Q4_0 GGUF для моделей серії LFM2.5, навчені за допомогою дистиляції з урахуванням квантування. Ці моделі відновлюють до 97% точності, втраченої при звичайному квантуванні.

19 серпня 2026 р.· 5 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 19 серпня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Liquid AI випускає моделі LFM2.5 Q4_0 GGUF за допомогою Quantization-Aware Distillation

Вплив: Середній

Чому це важливо

Розробники тепер можуть запускати високоточні та легкі моделі LFM2.5 локально з мінімальним споживанням пам'яті та без втрати швидкості.

TL;DR

  • 01Дистиляція з урахуванням квантування (QAD) відновлює до 97.4% продуктивності оригінальної моделі, втраченої при 4-бітному квантуванні.
  • 02Малі моделі (230M та 350M) відповідають точності Q5_K_M при збільшенні швидкості декодування до 33%.
  • 03Ці контрольні точки GGUF оптимізовані для роботи на локальних пристроях, включаючи GPU на macOS та Arm CPU.

Ключові факти

Відновлена точність
До 97.4% від базової BF16
Підтримувані моделі
LFM2.5 (230M, 350M, 1.2B, 2.6B)
Формат
Q4_0 GGUF
Приріст швидкості (230M/350M)
від 4% до 33% порівняно з Q5_K_M

Високоточна дистиляція для локального запуску

Liquid AI представила технологію дистиляції з урахуванням квантування (QAD), щоб ліквідувати компроміс між розміром моделі, швидкістю роботи та якістю міркувань. Шляхом перенесення знань із високоточної моделі-вчителя у квантовану модель-учня, нові файли Q4_0 GGUF відновлюють 97.1%, 96.5%, 97.4% та 96.6% точності базових моделей BF16 для версій LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct та LFM2.5-2.6B відповідно.

Тести продуктивності та пропускної здатності

Оновлені версії забезпечують швидкість і обсяг пам’яті, властиві рідному формату Q4_0, при цьому відповідаючи точності важчих форматів квантування:

  • LFM2.5-230M та 350M: Відповідають якості Q5_K_M із підвищенням швидкості генерації на 4–33%.
  • LFM2.5-1.2B та 2.6B: Відповідають якості Q4_K_M із приростом швидкості на 3–14%.
  • Сумісність: Моделі відповідають рівню UD-Q4_K_XL від Unsloth для версій на 230M та 1.2B.

Цільові пристрої для розгортання

Розробники можуть запускати ці моделі локально за допомогою llama.cpp або будь-якого іншого середовища, що підтримує GGUF. Сумісність перевірено як на GPU (MacBook Pro, NucBox EVO-X2), так і на Arm CPU (Samsung Galaxy S26 Ultra, Raspberry Pi 5).

Спробуй за 2 хвилини

./llama-cli -m LFM2.5-1.2B-Instruct-QAD-Q4_0.gguf -p "Write a python function to merge two sorted arrays."

bash

✓ Коли використовувати

  • При розгортанні малих, високоефективних LLM на граничних пристроях типу Raspberry Pi 5 або смартфонах.
  • Коли потрібен обсяг пам'яті 4-бітної моделі, але необхідна точність на рівні 5-біт або оригінальної точності.
  • Для локальних агентних сценаріїв з низькою затримкою або виклику інструментів.

✕ Коли НЕ варто

  • Коли завдання вимагає величезних параметричних баз знань, які можуть надати лише моделі розміром 70B+.
  • Якщо ваше середовище виконання не підтримує стандартний формат GGUF Q4_0.

Що зробити сьогодні

  • →Завантажте нові моделі QAD Q4_0 GGUF з Hugging Face.
  • →Протестуйте пропускну здатність локального виведення на вашому обладнанні за допомогою llama.cpp.
#llama.cpp

Джерела

  • LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаGoogle Workspace вмикає доступ Gemini до корпоративних даних за замовчуванням: інструкція з вимкненняНаступна новина →OpenAI запроваджує політику Zero Data Retention для провідних моделей

Схожі матеріали

  • Локальні LLMDaimon: локальний проксі маскує конфіденційні дані перед відправкою до сторонніх LLM
  • Локальні LLMКласифікація локальних поштових скриньок за допомогою Ollama та Open Interpreter
  • Локальні LLMQwen 3.8 27B зрівнялася за результатами з GPT-5.6 Luna в індексі Artificial Analysis
  • Локальні LLMОптимізація параметрів мислення моделі Qwen 3.8 27B для локального запуску

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.