Liquid AI випустила енкодери LFM2.5 для швидкого інференсу контексту 8K на CPU
Компанія Liquid AI випустила дві відкриті моделі двонаправлених енкодерів (LFM2.5-Encoder-230M та 350M), оптимізовані для довгих контекстів. На CPU модель 230M обробляє 8192 токени за 28 секунд, що в 3.7 рази швидше за ModernBERT-base.
Вплив: Середній
Чому це важливо
Ви можете запускати дешеві пайплайни класифікації, маршрутизації інтентів та пошуку PII на звичайних процесорах без залучення GPU.
TL;DR
- 01LFM2.5-Encoder-230M виконує обробку 8k токенів на CPU в 3.7 рази швидше за ModernBERT-base.
- 02Підходить для класифікації, вилучення PII та маршрутизації без залучення важких LLM.
- 03Моделі 230M та 350M випущені з відкритими вагами на Hugging Face.
Ключові факти
- Розміри моделей
- 230M та 350M параметрів
- Розмір контексту
- 8192 токени
- Прискорення на CPU (8k)
- у 3.7 раза швидше за ModernBERT-base (за даними авторів)
- Час проходу на CPU (8k)
- ~28 секунд (для версії 230M)
Запуск LFM2.5-Encoders у бібліотеці Transformers
Моделі доступні на Hugging Face із відкритими вагами. Ви можете завантажити модель безпосередньо через transformers:
from transformers import AutoModelForMaskedLM, AutoTokenizer
model_id = "LiquidAI/LFM2.5-Encoder-230M"
tok = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
mlm = AutoModelForMaskedLM.from_pretrained(model_id, trust_remote_code=True)
text = f"The capital of France is {tok.mask_token}."
inputs = tok(text, return_tensors="pt")
logits = mlm(**inputs).logitsДонавчання під прикладні задачі
Для класифікації текстів, виявлення PII або перевірки відповідності правилам додайте власний класифікаційний шар до основи енкодера:
from transformers import AutoModel
body = AutoModel.from_pretrained(
"LiquidAI/LFM2.5-Encoder-230M",
trust_remote_code=True
)Під час навчання на сумісних GPU підтримується Flash Attention 2 для прискорення обчислень.
Спробуй за 2 хвилини
from transformers import AutoModelForMaskedLM, AutoTokenizer
model_id = "LiquidAI/LFM2.5-Encoder-230M"
tok = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
mlm = AutoModelForMaskedLM.from_pretrained(model_id, trust_remote_code=True)
text = f"The capital of France is {tok.mask_token}."
inputs = tok(text, return_tensors="pt")
logits = mlm(**inputs).logitspython
✓ Коли використовувати
- Використовуйте для високонавантаженої обробки тексту на CPU: перевірки політик безпеки, пошуку PII та класифікації.
✕ Коли НЕ варто
- Не використовуйте як генеративну модель для вільної генерації тексту або чату.
Що зробити сьогодні
- Протестуйте LiquidAI/LFM2.5-Encoder-230M на завданнях класифікації документів та маршрутизації.
- Порівняйте затримку інференсу на CPU з наявними рішеннями на базі BERT чи RoBERTa.
Джерела