Мультимодальні енкодери NeoMME забезпечують візуальний пошук документів зі швидкістю 51 сторінка на секунду
Hcompany представила NeoMME — сімейство відкритих мультимодальних енкодерів на 260M та 800M параметрів під ліцензією Apache 2.0 без окремих зорових веж і декодерів. NeoMME-Retriever обробляє 51 сторінку на секунду на NVIDIA L40S і скорочує розмір індексу у 255 разів.

Вплив: Середній
Чому це важливо
Замініть важкі візуальні мовні моделі у конвеєрах пошуку, щоб індексувати PDF у високій роздільності безпосередньо з у 255 разів меншим обсягом пам'яті.
TL;DR
- 01Обробляє текстові токени та графічні патчі 32×32 в єдиному двонаправленому трансформері без окремих візуальних веж і декодерів.
- 02NeoMME-Retriever-260M кодує 51 сторінку/с на L40S і майже не поступається ColQwen2.5 на ViDoRe v3 при 14-кратно меншій кількості параметрів.
- 03Ієрархічний пулінг токенів та асиметричне квантування стискають індекс пізньої взаємодії у 255 разів до 6 кБ на сторінку.
Ключові факти
- Швидкість обробки
- 51 стор/с (модель 260M при 2048x2048 на NVIDIA L40S, за даними авторів)
- ViDoRe v3 nDCG@10
- 0.523 (модель 260M) проти 0.556 (модель 800M), за даними авторів
- Стиснення індексу
- З 1.5 МБ до 6 кБ на сторінку (зменшення у 255 разів, за даними авторів)
- Розмір контексту
- 16 384 токени (до двох зображень 3840x2160 4K UHD)
- Ліцензія
- Apache 2.0
Єдина мультимодальна архітектура
Традиційні адаптери для візуального пошуку поєднують окремий зоровий енкодер на зразок SigLIP з авторегресійним мовним декодером. NeoMME відмовляється від обох компонентів: вхідні токени тексту та сітка патчів 32×32 надходять безпосередньо в єдиний двонаправлений Transformer. Оскільки ранжування та класифікація не потребують авторегресійної генерації тексту, відсутність декодера усуває зайві обчислювальні витрати. Стек енкодера використовує grouped-query attention, нормалізацію query-key, gated attention, 2D RoPE, squared-ReLU MLP та чергування ковзного вікна уваги (sliding-window) з глобальною увагою на кожному шостому та фінальному шарах.
Навчання через масковану дифузію
NeoMME натреновано з нуля як дискретний маскований дифузійний денойзер тексту на 524 мільярдах упакованих токенів (з них 290 мільярдів суто текстових) за допомогою оптимізатора NorMuon. Якщо для тексту коефіцієнт маскування варіюється від 0 до 1, то в мультимодальних зразках він становить від 0.3 до 1 при повністю відкритих візуальних патчах. Високий рівень маскування змушує модель вилучати семантику безпосередньо з графічних даних документа замість використання текстових евристик.
Двоголовий пошук та стиснення індексу у 255 разів
NeoMME-Retriever містить дві одночасно натреновані голови: щільну (dense) для усередненого векторного пошуку через ANN та голову пізньої взаємодії (late-interaction), що проєктує токени у 128-вимірні вектори. На GPU NVIDIA L40S модель на 260M обробляє 51 сторінку за секунду з роздільністю 2048×2048 — удвічі швидше за ColModernVBERT. Для великих баз ієрархічний пулінг токенів та асиметричне квантування стискають обсяг індексу з ~1.5 МБ до 6 кБ на сторінку (у 255 разів менше) зі збереженням понад 95% вихідного показника nDCG@10.
Спробуй за 2 хвилини
from transformers import AutoModel, AutoProcessor
# Load NeoMME-Retriever from Hugging Face
model_id = "Hcompany/neomme-retriever-260m"
model = AutoModel.from_pretrained(model_id, trust_remote_code=True)
processor = AutoProcessor.from_pretrained(model_id, trust_remote_code=True)python
✓ Коли використовувати
- Візуальний пошук у складних PDF-файлах із таблицями, графіками та спеціальною версткою без попереднього OCR.
- Масштабні пошукові системи, де обсяг пам'яті для зберігання індексів пізньої взаємодії потрібно обмежити кілобайтами на сторінку.
- Гібридні пошукові конвеєри, які потребують одночасного швидкого dense-пошуку та точного late-interaction переранжування.
✕ Коли НЕ варто
- Генеративні сценарії, де потрібні розмовні відповіді, написання коду чи авторегресійне доповнення тексту.
- Суто текстові бази даних, де стандартні bi-енкодери розміром до 100M повністю покривають вимоги до швидкості та якості.
Що зробити сьогодні
- Протестуйте NeoMME-Retriever-260M у Hugging Face Transformers для відмови від попереднього OCR-розпізнавання PDF.
- Налаштуйте двохетапний пошук: первинна вибірка через dense-ембеддинги та фінальне переранжування через late-interaction.
- Застосуйте ієрархічний пулінг та асиметричне квантування для масштабування сховища векторних індексів.
Джерела