Aleph Alpha випустила Kolibri: 78B MoE модель, оптимізовану для європейських мов
Aleph Alpha представила Kolibri — відкриту під ліцензією Apache 2.0 модель на 78.1 млрд параметрів (3.46 млрд активних). Новий токенізатор UniBPE скорочує кількість токенів для складних мов на кшталт німецької за підтримки великого контексту.

Чому це важливо
Ви можете розгорнути суверенну MoE-модель під ліцензією Apache 2.0, яка скорочує витрати токенів і контексту при роботі зі складними європейськими мовами.
TL;DR
- 01Kolibri забезпечує швидкий інференс, активуючи лише 3.46 млрд параметрів із 78 млрд загальних.
- 02Алгоритм UniBPE скорочує витрати токенів для складної лексики на 15%.
- 03Чергування локальної та повної уваги дозволяє утримувати понад 1 млн токенів контексту.
Ключові факти
- Загальна кількість параметрів
- 78.1 млрд
- Активні параметри на токен
- 3.46 млрд (4.4%)
- Базове контекстне вікно
- 262 144 токени (протестовано до 1 048 576)
- Розмір ваг у FP8
- Близько 78 ГБ
- Ліцензія
- Apache 2.0
Деталі архітектури
Kolibri розроблена для локального розгортання в межах європейського регуляторного поля:
- Параметри: 78.1 млрд загалом, 3.46 млрд активних на кожен токен (4.4% навантаження).
- Структура: 50 шарів, 384 експерти плюс 1 спільний, маршрутизація до 6 експертів.
- Ліцензія та ваги: Apache 2.0; ваги у форматі FP8 займають близько 78 ГБ.
Токенізація через UniBPE
Більшість сучасних токенізаторів неефективно розбивають складені слова європейських мов. Aleph Alpha використала підхід UniBPE, що поєднує BPE зі скорингом Unigram. На німецьких юридичних текстах модель потребує на 15% менше токенів, ніж словник o200k_base від OpenAI, демонструючи ідентичну щільність у текстах англійською.
Довгий контекст і міркування
Щоб забезпечити підтримку контексту до 1 048 576 токенів без втрати швидкості, 40 із 50 шарів використовують вікно уваги на 512 токенів, чергуючись із повною увагою кожні п'ять шарів. У тесті RULER на 1 млн токенів базова модель набрала 63.2 бала (проти 57.5 у Qwen3.5 35B-A3B), а підготовка датасету дозволила уникнути англомовних зсувів у ланцюжках думок.
Спробуй за 2 хвилини
from transformers import AutoModelForCausalLM, AutoTokenizer
# Load Kolibri open weights under Apache 2.0
tokenizer = AutoTokenizer.from_pretrained("Aleph-Alpha/Kolibri-78B")
model = AutoModelForCausalLM.from_pretrained("Aleph-Alpha/Kolibri-78B", device_map="auto")python
✓ Коли використовувати
- Корпоративні проєкти з жорсткими вимогами до суверенітету даних та європейського законодавства.
- Обробка великих масивів технічних або юридичних документів німецькою та англійською мовами.
- Задачі з контекстом до 1 млн токенів, де потрібна низька собівартість генерації на токен.
✕ Коли НЕ варто
- Розгортання на споживчих GPU з 8 або 16 ГБ пам'яті без оффлоадингу (потрібно не менше 78 ГБ VRAM).
- Генерація коротких відповідей виключно англійською, де вистачить моделей на 7B–14B параметрів.
- Інфраструктури, де нестандартний словник на 128k токенів викликає конфлікти в пайплайні.
Що зробити сьогодні
- Оцініть коефіцієнт стиснення токенів за допомогою бібліотеки Hugging Face tokenizers.
- Протестуйте Kolibri у vLLM або Transformers для європейських проектів з жорсткими вимогами до даних.
- Використовуйте ваги у FP8 (78 ГБ) для запуску моделі на робочих станціях з достатнім обсягом VRAM.
Що каже спільнота
“People follow the latest frontier lab models with great attention and migrate to the next big model on their subscriptions. Meanwhile these local models have quietly gotten REALLY good.”
“It depends on the use case, but I believe SLMs can do great with smaller tasks. People got so attached to 'general purpose' that they forgot software can be designed for specific, smaller use cases.”