Перейти до вмісту
ГоловнаНовиниКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Локальні LLM/
  4. Оптимізація параметрів мислення моделі Qwen 3.8 27B для локального запуску
Локальні LLM

Оптимізація параметрів мислення моделі Qwen 3.8 27B для локального запуску

Alibaba випустила мультимодальну модель Qwen 3.8 27B під ліцензією Apache 2.0. Тести Саймона Віллісона показали, що стандартне значення міркувань 'xhigh' призводить до надмірних затримок і потребує ручного зниження параметра.

17 серпня 2026 р.· 4 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 17 серпня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Оптимізація параметрів мислення моделі Qwen 3.8 27B для локального запуску

Вплив: Середній

Чому це важливо

Встановіть параметр reasoning_effort на рівень low або вимкніть його при локальному запуску Qwen 3.8 27B, щоб уникнути кількапакетних затримок і перевитрати контексту.

TL;DR

  • 01Qwen 3.8 27B підтримує зір та генерацію коду під відкритою ліцензією Apache 2.0
  • 02Стандартний режим xhigh призводить до витрати десятків тисяч токенів на міркування
  • 03Змінюйте параметр reasoning_effort на low або вимикайте його для повсякденних завдань

Ключові факти

27 млрдКількість параметрів
Apache 2.0Ліцензія
262 144 токениМаксимальний контекст
Кількість параметрів
27 млрд
Ліцензія
Apache 2.0
Розмір квантованого білда
17 ГБ (Q4_K_M GGUF)
Максимальний контекст
262 144 токени

Характеристики моделі та квантування

Qwen 3.8 27B — мультимодальна модель з відкритою ліцензією Apache 2.0, призначена для локального виконання на робочих станціях. Квантований білд GGUF Q4_K_M розміром 17 ГБ ефективно працює на машинах з об'єднаною пам'яттю (Apple Silicon) або дискретних відеокартах.

Проблема конфігурації xhigh

Модель підтримує параметр reasoning_effort, який за замовчуванням встановлено на xhigh. Через це простий запит може блокувати генерацію:

  • Режим xhigh: Тестовий запит на генерацію SVG використав 22 276 токенів роздумів і тривав 21 хвилину.
  • Вимкнений reasoning: Той самий запит виконав генерацію за 137 секунд (3 715 токенів виводу).
  • Ліміти контексту: Стандартний буфер LM Studio на 8 192 токени швидко переповнюється; для стабільної роботи рекомендується встановити максимальний ліміт до 262 144 токенів.

Локальне розпізнавання об'єктів

Попри схильність до надмірного аналізу, Qwen 3.8 27B демонструє точне визначення координат об'єктів у діапазоні 0–1000 та здатна за один промпт створити повноцінний HTML/JS-інструмент для візуалізації обмежувальних рамок.

Спробуй за 2 хвилини

# Example running Qwen vision inference via llm CLI
llm -a https://static.inaturalist.org/photos/714731804/large.jpg \
  'Return JSON bounding boxes for items in this photo, 0-1000 scale for each dimension'

bash

✓ Коли використовувати

  • Локальний запуск мультимодальних моделей генерації коду на робочих станціях від 32 ГБ RAM
  • Отримання просторових координат об'єктів на зображеннях без плати за хмарні API
  • Побудова автономних конвеєрів аналізу графічних даних

Що зробити сьогодні

  • →Завантажте квантований файл Q4_K_M GGUF (17 ГБ) моделі Qwen 3.8 27B для LM Studio
  • →Встановіть параметр reasoning_effort на рівень low у конфігурації інференсу
  • →Збільшіть розмір контекстного вікна до 262 144 токенів для уникнення переповнення
#Qwen 3.8 27B#LM Studio#llama.cpp

Джерела

  • Simon Willison: Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаDiagram Design генерує брендовані архітектурні діаграми у Claude Code та CodexНаступна новина →Amp запускає Orbs для автономного виконання ШІ-агентів у хмарі

Схожі матеріали

  • Локальні LLMDaimon: локальний проксі маскує конфіденційні дані перед відправкою до сторонніх LLM
  • Локальні LLMLiquid AI випускає моделі LFM2.5 Q4_0 GGUF за допомогою Quantization-Aware Distillation
  • Локальні LLMКласифікація локальних поштових скриньок за допомогою Ollama та Open Interpreter
  • Локальні LLMQwen 3.8 27B зрівнялася за результатами з GPT-5.6 Luna в індексі Artificial Analysis

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.