Перейти до вмісту
ГоловнаНовиниКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Локальні LLM/
  4. Needle 2: 14MB LLM для виклику функцій на периферійних пристроях
Локальні LLM

Needle 2: 14MB LLM для виклику функцій на периферійних пристроях

Компанія Cactus Compute випустила Needle 2 — модель на 45M параметрів розміром 14MB, створену для структурованого виклику інструментів на бюджетному обладнанні вартістю до $200. Працюючи з 2-бітною квантизацією всередині єдиного C++ бінарника, вона забезпечує автономне виконання з низькою затримкою.

11 серпня 2026 р.· 4 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 11 серпня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Needle 2: 14MB LLM для виклику функцій на периферійних пристроях

Вплив: Високий

Чому це важливо

Тепер ви можете вбудовувати надійний автономний ШІ для виклику функцій у мікроконтролери, IoT-пристрої та мобільні застосунки з обсягом пам'яті всього 14MB.

TL;DR

  • 01Вміщує повноцінний виклик функцій у виконавчий файл розміром 14MB із мінімальними вимогами до RAM.
  • 02Гарантує точний синтаксис параметрів інструментів завдяки граматикам байтового рівня.
  • 03Поставляється як єдиний C++ бінарник із автоматичним вибором CPU-ядер для ARM, x86 та Wasm.

Ключові факти

Розмір моделі14 МБ
Кількість параметрів45 Мільйонів
Контекстне вікно256 токенів (ковзне)
Розмір моделі
14 МБ
Кількість параметрів
45 Мільйонів
Квантизація
2-бітна (Cactus Quants)
Контекстне вікно
256 токенів (ковзне)
FLOPs на токен
70 MFLOPs

Ультракомпактна архітектура для периферійного обладнання Needle 2 орієнтована на дешеві вбудовані системи, носимі пристрої та мікроконтролери, зосереджуючись виключно на мапінгу функцій і вилученні структурованих даних. Моделі потрібно лише 14MB RAM, і вона працює на апаратурі без окремих GPU чи NPU. Ключові особливості архітектури: - Simple Attention Network: Використовує ковзне вікно на 256 токенів та перетворення Вольша-Адамара для мінімізації обчислень. - 2-бітна квантизація без втрат: Тренована від початку до кінця за допомогою Quantization-Aware Training (QAT) для ваг, активацій та KV-кешу. - Граматичні обмеження на рівні байтів: Обмежує логіти декодування схемою інструменту, пропускаючи до 98% проєкцій словника. ### Локальне навчання та розгортання Продукт поставляється як автономний C++ бінарник із підтримкою ARM Cortex-M, x86, RISC-V та WebAssembly SIMD. Розробники можуть донавчати власні словники інструментів на звичайному Mac або PC за кілька хвилин за допомогою Python-пакета перед інтеграцією.

Спробуй за 2 хвилини

pip install cactus-needle && needle tune --schema tools.json --data train.jsonl --output custom_needle.bin

bash

✓ Коли використовувати

  • Локальний автономний виклик функцій на бюджетному залізі, як-от мікроконтролери до $200 чи носимі пристрої.
  • Забезпечення суворого виводу за схемою без ризику синтаксичних помилок.

✕ Коли НЕ варто

  • Діалоги на довільні теми або складні розмірковування про світ.
  • Завдання з великим контекстом, що потребують історії документів понад 256 токенів.

Що зробити сьогодні

  • →Завантажте Python-пакет Needle 2 для вимірювання затримки виклику функцій локально.
  • →Скомпілюйте власні схеми інструментів у граматики байтового рівня для детермінованого виводу.
  • →Протестуйте логіку автономного фолбеку за допомогою порожніх відповідей для невпевнених запитів.

Що каже спільнота

  • “i would assume a model this size would require finetuning tbh. even functiongemma recommends that.”

    — electroglyph на Hacker News

  • “It seems to fail. I sent the prompt: “ 5° warmer” And it said: “ setting the temperature to 5°F””

    — raylad на Hacker News

#Needle 2#Cactus Quants#vLLM#FunctionGemma

Джерела

  • Needle 2 Technical Specification
  • Hacker News Discussion on Needle 2
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаAnthropic та Google впроваджують невидимі водяні знаки в тексти Claude та GeminiНаступна новина →IBM ALTK-Evolve скорочує витрати на контекст агентів до 85% порівняно з ACE

Схожі матеріали

  • Локальні LLMDaimon: локальний проксі маскує конфіденційні дані перед відправкою до сторонніх LLM
  • Локальні LLMLiquid AI випускає моделі LFM2.5 Q4_0 GGUF за допомогою Quantization-Aware Distillation
  • Локальні LLMКласифікація локальних поштових скриньок за допомогою Ollama та Open Interpreter
  • Локальні LLMQwen 3.8 27B зрівнялася за результатами з GPT-5.6 Luna в індексі Artificial Analysis

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.