Локальні LLM
Bonsai 2 27B забезпечує майже безвтратне тернарне стиснення для кодинг-агентів
Prism ML випустила Ternary Bonsai 2 27B, яка квантує Qwen3.8 27B до 1.76 біта на вагу з вагою у пам'яті лише 5.9 ГБ. Реліз зберігає 98.2% продуктивності базової моделі на бенчмарках, дозволяючи запускати агентські цикли кодингу на споживчих GPU.
18 вересня 2026 р. 4 хв читання
Куратор Oleksandr Kuzmenko, AI Product EngineerОновлено 18 вересня 2026 р.Джерела вказані в кожному матеріалі
За участі AI · перевірено редакторомЯк ми використовуємо AI

Вплив: Високий
Чому це важливо
Тепер ви можете запускати повноцінного 27B агента для кодингу та керування комп'ютером повністю офлайн на споживчому залізі з 6 ГБ VRAM.
TL;DR
- 01Запускає 27B мультимодальну модель і computer-use у межах 5.9 ГБ оперативної пам'яті.
- 02Зберігає 98.2% вихідної точності на BigCodeBench, LiveCodeBench v6 та HumanEval+.
- 03Забезпечує 143 токени/с на RTX 5090 та 46.8 токенів/с на Apple Silicon M5 Max.
Ключові факти
- Розмір моделі
- 5.9 ГБ
- Ефективна розрядність
- 1.76 біта/вага
- Вікно контексту
- 262K токенів
- Збереження бенчмарків
- 98.2% (за даними вендора)
- Швидкість (RTX 5090)
- 143 токени/с
- Ліцензія
- Apache 2.0
Екстремальне квантування без деградації логіки Ternary Bonsai 2 27B на базі Qwen3.8 27B стискає розмір моделі більш ніж у 9 разів до 5.9 ГБ, використовуючи 1.76 ефективного біта на вагу. Якщо ранні експерименти з наднизькою розрядністю ламали багатокрокові цикли через накопичення помилок, то Bonsai 2 отримує 83.9 бала на комплексних бенчмарках, зберігаючи 98.2% вихідної якості. ### Швидкість на залізі та інтеграція в агенти Модель демонструє 143 токени/с на NVIDIA RTX 5090 і 46.8 токенів/с на Apple M5 Max за допомогою оптимізованих ядер MLX. Енергоспоживання на RTX 4090 становить 0.714 мВт·год на токен, що на 40% ефективніше за стандартну 8B модель без квантування. Prism ML підтвердила стабільну роботу з автономним агентом Cline та сценаріями computer-use на вікні контексту 262K під ліцензією Apache 2.0.
Спробуй за 2 хвилини
git clone https://github.com/prismml/bonsai && cd bonsai && pip install -e . && python -m bonsai.serve --model ternary-bonsai-2-27b --context-window 262144bash
✓ Коли використовувати
- Запуск офлайн-агентів для кодингу із суворими вимогами до приватності.
- Розгортання багатокрокових агентів на звичайних ноутбуках або робочих станціях з однією GPU.
- Тривалі фонові процеси аналізу, де виклики комерційних API стають надто дорогими.
Що зробити сьогодні
- Завантажте ваги моделі з офіційного репозиторію під ліцензією Apache 2.0.
- Протестуйте локальну швидкість інференсу через кастомні ядра MLX на Apple Silicon або CUDA на GPU RTX.
- Підключіть локальний endpoint до Cline або Cursor для перевірки багатокрокового редагування без хмарних витрат.
Джерела