Перейти до вмісту
ГоловнаНовиниДайджестиКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Моделі й дослідження/
  4. Мультимодальні енкодери NeoMME забезпечують візуальний пошук документів зі швидкістю 51 сторінка на секунду
Моделі й дослідження

Мультимодальні енкодери NeoMME забезпечують візуальний пошук документів зі швидкістю 51 сторінка на секунду

Hcompany представила NeoMME — сімейство відкритих мультимодальних енкодерів на 260M та 800M параметрів під ліцензією Apache 2.0 без окремих зорових веж і декодерів. NeoMME-Retriever обробляє 51 сторінку на секунду на NVIDIA L40S і скорочує розмір індексу у 255 разів.

4 вересня 2026 р.· 7 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 4 вересня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Мультимодальні енкодери NeoMME забезпечують візуальний пошук документів зі швидкістю 51 сторінка на секунду

Вплив: Середній

Чому це важливо

Замініть важкі візуальні мовні моделі у конвеєрах пошуку, щоб індексувати PDF у високій роздільності безпосередньо з у 255 разів меншим обсягом пам'яті.

TL;DR

  • 01Обробляє текстові токени та графічні патчі 32×32 в єдиному двонаправленому трансформері без окремих візуальних веж і декодерів.
  • 02NeoMME-Retriever-260M кодує 51 сторінку/с на L40S і майже не поступається ColQwen2.5 на ViDoRe v3 при 14-кратно меншій кількості параметрів.
  • 03Ієрархічний пулінг токенів та асиметричне квантування стискають індекс пізньої взаємодії у 255 разів до 6 кБ на сторінку.

Ключові факти

Швидкість обробки
51 стор/с (модель 260M при 2048x2048 на NVIDIA L40S, за даними авторів)
ViDoRe v3 nDCG@10
0.523 (модель 260M) проти 0.556 (модель 800M), за даними авторів
Стиснення індексу
З 1.5 МБ до 6 кБ на сторінку (зменшення у 255 разів, за даними авторів)
Розмір контексту
16 384 токени (до двох зображень 3840x2160 4K UHD)
Ліцензія
Apache 2.0

Єдина мультимодальна архітектура

Традиційні адаптери для візуального пошуку поєднують окремий зоровий енкодер на зразок SigLIP з авторегресійним мовним декодером. NeoMME відмовляється від обох компонентів: вхідні токени тексту та сітка патчів 32×32 надходять безпосередньо в єдиний двонаправлений Transformer. Оскільки ранжування та класифікація не потребують авторегресійної генерації тексту, відсутність декодера усуває зайві обчислювальні витрати. Стек енкодера використовує grouped-query attention, нормалізацію query-key, gated attention, 2D RoPE, squared-ReLU MLP та чергування ковзного вікна уваги (sliding-window) з глобальною увагою на кожному шостому та фінальному шарах.

Навчання через масковану дифузію

NeoMME натреновано з нуля як дискретний маскований дифузійний денойзер тексту на 524 мільярдах упакованих токенів (з них 290 мільярдів суто текстових) за допомогою оптимізатора NorMuon. Якщо для тексту коефіцієнт маскування варіюється від 0 до 1, то в мультимодальних зразках він становить від 0.3 до 1 при повністю відкритих візуальних патчах. Високий рівень маскування змушує модель вилучати семантику безпосередньо з графічних даних документа замість використання текстових евристик.

Двоголовий пошук та стиснення індексу у 255 разів

NeoMME-Retriever містить дві одночасно натреновані голови: щільну (dense) для усередненого векторного пошуку через ANN та голову пізньої взаємодії (late-interaction), що проєктує токени у 128-вимірні вектори. На GPU NVIDIA L40S модель на 260M обробляє 51 сторінку за секунду з роздільністю 2048×2048 — удвічі швидше за ColModernVBERT. Для великих баз ієрархічний пулінг токенів та асиметричне квантування стискають обсяг індексу з ~1.5 МБ до 6 кБ на сторінку (у 255 разів менше) зі збереженням понад 95% вихідного показника nDCG@10.

Спробуй за 2 хвилини

from transformers import AutoModel, AutoProcessor

# Load NeoMME-Retriever from Hugging Face
model_id = "Hcompany/neomme-retriever-260m"
model = AutoModel.from_pretrained(model_id, trust_remote_code=True)
processor = AutoProcessor.from_pretrained(model_id, trust_remote_code=True)

python

✓ Коли використовувати

  • Візуальний пошук у складних PDF-файлах із таблицями, графіками та спеціальною версткою без попереднього OCR.
  • Масштабні пошукові системи, де обсяг пам'яті для зберігання індексів пізньої взаємодії потрібно обмежити кілобайтами на сторінку.
  • Гібридні пошукові конвеєри, які потребують одночасного швидкого dense-пошуку та точного late-interaction переранжування.

✕ Коли НЕ варто

  • Генеративні сценарії, де потрібні розмовні відповіді, написання коду чи авторегресійне доповнення тексту.
  • Суто текстові бази даних, де стандартні bi-енкодери розміром до 100M повністю покривають вимоги до швидкості та якості.

Що зробити сьогодні

  • →Протестуйте NeoMME-Retriever-260M у Hugging Face Transformers для відмови від попереднього OCR-розпізнавання PDF.
  • →Налаштуйте двохетапний пошук: первинна вибірка через dense-ембеддинги та фінальне переранжування через late-interaction.
  • →Застосуйте ієрархічний пулінг та асиметричне квантування для масштабування сховища векторних індексів.
#Hugging Face#Transformers#ColPali#NextPlaid#ModernBERT

Джерела

  • NeoMME: an efficient Multimodal-native and Multilingual Encoder
ПоділитисяПоділитися в XПоділитися в LinkedIn
Наступна новина →OpenAI випустила GPT-6 Astra з фокусом на програмування та автономних агентів

Схожі матеріали

  • Моделі й дослідженняAnthropic випустила Claude Fable 5.1 зі зниженою ціною читання кешу промптів
  • Моделі й дослідженняAllenAI презентує BenchMIRT для аудиту та скорочення бенчмарків LLM
  • Моделі й дослідженняGoogle випустила TimesFM-3 для zero-shot мультиваріантного прогнозування часових рядів
  • Моделі й дослідженняAnthropic продемонструвала автоматизовані дослідники вирівнювання AI за чотири долари на годину

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.