Liquid AI випускає моделі LFM2.5 Q4_0 GGUF за допомогою Quantization-Aware Distillation
Liquid AI випустила 4-бітні контрольні точки Q4_0 GGUF для моделей серії LFM2.5, навчені за допомогою дистиляції з урахуванням квантування. Ці моделі відновлюють до 97% точності, втраченої при звичайному квантуванні.

Вплив: Середній
Чому це важливо
Розробники тепер можуть запускати високоточні та легкі моделі LFM2.5 локально з мінімальним споживанням пам'яті та без втрати швидкості.
TL;DR
- 01Дистиляція з урахуванням квантування (QAD) відновлює до 97.4% продуктивності оригінальної моделі, втраченої при 4-бітному квантуванні.
- 02Малі моделі (230M та 350M) відповідають точності Q5_K_M при збільшенні швидкості декодування до 33%.
- 03Ці контрольні точки GGUF оптимізовані для роботи на локальних пристроях, включаючи GPU на macOS та Arm CPU.
Ключові факти
- Відновлена точність
- До 97.4% від базової BF16
- Підтримувані моделі
- LFM2.5 (230M, 350M, 1.2B, 2.6B)
- Формат
- Q4_0 GGUF
- Приріст швидкості (230M/350M)
- від 4% до 33% порівняно з Q5_K_M
Високоточна дистиляція для локального запуску
Liquid AI представила технологію дистиляції з урахуванням квантування (QAD), щоб ліквідувати компроміс між розміром моделі, швидкістю роботи та якістю міркувань. Шляхом перенесення знань із високоточної моделі-вчителя у квантовану модель-учня, нові файли Q4_0 GGUF відновлюють 97.1%, 96.5%, 97.4% та 96.6% точності базових моделей BF16 для версій LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct та LFM2.5-2.6B відповідно.
Тести продуктивності та пропускної здатності
Оновлені версії забезпечують швидкість і обсяг пам’яті, властиві рідному формату Q4_0, при цьому відповідаючи точності важчих форматів квантування:
- LFM2.5-230M та 350M: Відповідають якості
Q5_K_Mіз підвищенням швидкості генерації на 4–33%. - LFM2.5-1.2B та 2.6B: Відповідають якості
Q4_K_Mіз приростом швидкості на 3–14%. - Сумісність: Моделі відповідають рівню
UD-Q4_K_XLвід Unsloth для версій на 230M та 1.2B.
Цільові пристрої для розгортання
Розробники можуть запускати ці моделі локально за допомогою llama.cpp або будь-якого іншого середовища, що підтримує GGUF. Сумісність перевірено як на GPU (MacBook Pro, NucBox EVO-X2), так і на Arm CPU (Samsung Galaxy S26 Ultra, Raspberry Pi 5).
Спробуй за 2 хвилини
./llama-cli -m LFM2.5-1.2B-Instruct-QAD-Q4_0.gguf -p "Write a python function to merge two sorted arrays."bash
✓ Коли використовувати
- При розгортанні малих, високоефективних LLM на граничних пристроях типу Raspberry Pi 5 або смартфонах.
- Коли потрібен обсяг пам'яті 4-бітної моделі, але необхідна точність на рівні 5-біт або оригінальної точності.
- Для локальних агентних сценаріїв з низькою затримкою або виклику інструментів.
✕ Коли НЕ варто
- Коли завдання вимагає величезних параметричних баз знань, які можуть надати лише моделі розміром 70B+.
- Якщо ваше середовище виконання не підтримує стандартний формат GGUF Q4_0.
Що зробити сьогодні
- Завантажте нові моделі QAD Q4_0 GGUF з Hugging Face.
- Протестуйте пропускну здатність локального виведення на вашому обладнанні за допомогою llama.cpp.
Джерела