Перейти до вмісту
ГоловнаНовиниДайджестиКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Локальні LLM/
  4. Bonsai 2 27B забезпечує майже безвтратне тернарне стиснення для кодинг-агентів
Локальні LLM

Bonsai 2 27B забезпечує майже безвтратне тернарне стиснення для кодинг-агентів

Prism ML випустила Ternary Bonsai 2 27B, яка квантує Qwen3.8 27B до 1.76 біта на вагу з вагою у пам'яті лише 5.9 ГБ. Реліз зберігає 98.2% продуктивності базової моделі на бенчмарках, дозволяючи запускати агентські цикли кодингу на споживчих GPU.

18 вересня 2026 р.· 4 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 18 вересня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Bonsai 2 27B забезпечує майже безвтратне тернарне стиснення для кодинг-агентів

Вплив: Високий

Чому це важливо

Тепер ви можете запускати повноцінного 27B агента для кодингу та керування комп'ютером повністю офлайн на споживчому залізі з 6 ГБ VRAM.

TL;DR

  • 01Запускає 27B мультимодальну модель і computer-use у межах 5.9 ГБ оперативної пам'яті.
  • 02Зберігає 98.2% вихідної точності на BigCodeBench, LiveCodeBench v6 та HumanEval+.
  • 03Забезпечує 143 токени/с на RTX 5090 та 46.8 токенів/с на Apple Silicon M5 Max.

Ключові факти

Розмір моделі5.9 ГБ
Вікно контексту262K токенів
Розмір моделі
5.9 ГБ
Ефективна розрядність
1.76 біта/вага
Вікно контексту
262K токенів
Збереження бенчмарків
98.2% (за даними вендора)
Швидкість (RTX 5090)
143 токени/с
Ліцензія
Apache 2.0

Екстремальне квантування без деградації логіки Ternary Bonsai 2 27B на базі Qwen3.8 27B стискає розмір моделі більш ніж у 9 разів до 5.9 ГБ, використовуючи 1.76 ефективного біта на вагу. Якщо ранні експерименти з наднизькою розрядністю ламали багатокрокові цикли через накопичення помилок, то Bonsai 2 отримує 83.9 бала на комплексних бенчмарках, зберігаючи 98.2% вихідної якості. ### Швидкість на залізі та інтеграція в агенти Модель демонструє 143 токени/с на NVIDIA RTX 5090 і 46.8 токенів/с на Apple M5 Max за допомогою оптимізованих ядер MLX. Енергоспоживання на RTX 4090 становить 0.714 мВт·год на токен, що на 40% ефективніше за стандартну 8B модель без квантування. Prism ML підтвердила стабільну роботу з автономним агентом Cline та сценаріями computer-use на вікні контексту 262K під ліцензією Apache 2.0.

Спробуй за 2 хвилини

git clone https://github.com/prismml/bonsai && cd bonsai && pip install -e . && python -m bonsai.serve --model ternary-bonsai-2-27b --context-window 262144

bash

✓ Коли використовувати

  • Запуск офлайн-агентів для кодингу із суворими вимогами до приватності.
  • Розгортання багатокрокових агентів на звичайних ноутбуках або робочих станціях з однією GPU.
  • Тривалі фонові процеси аналізу, де виклики комерційних API стають надто дорогими.

Що зробити сьогодні

  • →Завантажте ваги моделі з офіційного репозиторію під ліцензією Apache 2.0.
  • →Протестуйте локальну швидкість інференсу через кастомні ядра MLX на Apple Silicon або CUDA на GPU RTX.
  • →Підключіть локальний endpoint до Cline або Cursor для перевірки багатокрокового редагування без хмарних витрат.
#Bonsai 2 27B#Qwen3.8#Cline#CUDA#MLX

Джерела

  • Prism ML Bonsai 2 27B Announcement
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаAlibaba відкрила OpenCodeReview: скорочення витрат токенів на рев'ю коду на 89%Наступна новина →Anthropic відкрила GPU-ядра від Claude, що прискорюють інференс у 4 рази

Схожі матеріали

  • Локальні LLMАналіз Mac Mini на чипах M6 та M5 Pro для інференсу локальних LLM
  • Локальні LLMEl Yayster запускає безпечного локального LLM-агента всередині середовища Emacs

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.