Marker 2 оновлює пайплайн конвертації PDF із 5-разовим прискоренням проти MinerU
Datalab випустила Marker 2 — повне переписування відкритого пайплайну парсингу документів на базі Surya OCR 2 та 20M-параметричної моделі верстки. Тести olmOCR-bench показують 76.0% точності при швидкості 2.9 сторінок на секунду на B200 GPU.
Вплив: Середній
Чому це важливо
Інженери RAG-пайплайнів можуть обробляти масиви документів значно швидше та дешевше без втрати точності структуризації.
TL;DR
- 01Marker 2 досягає 76% точності на olmOCR-bench, працюючи в 5.4 раза швидше за MinerU
- 02Розділена архітектура дозволяє CPU-воркерам використовувати один інференс-сервер Surya VLM
Ключові факти
- Швидкість Balanced Mode (за даними розробника)
- 2.9 стор/сек (B200 GPU)
- Точність Balanced Mode
- 76.0% загалом (olmOCR-bench)
- Швидкість на CPU
- 23.7 стор/сек (--disable_ocr)
- Ліцензійний ліміт
- Безкоштовно для компаній до $5M
Архітектурне оновлення
Datalab повністю переписала Marker 2 на базі трьох компонентів: Surya OCR 2, швидкої 20M-параметричної моделі визначення верстки та оновленого рушія pdftext, який працює втричі швидше. Головною оптимізацією стало відокремлення обчислень: легкі CPU-процеси відправляють візуальні завдання на централізований сервер Surya.
Результати бенчмарку olmOCR-bench
На бенчмарку olmOCR-bench від Allen AI (1 403 PDF-файли та ~8 400 тестів) режим Marker 2 balanced показав 76.0% точності зі швидкістю 2.9 сторінок на секунду на NVIDIA B200 GPU. Це випереджає MinerU (72.7% при 0.54 стор/с) та Docling (50.3% при 2.1 стор/с).
Режими роботи та ліцензування
balanced: оптимізований під GPU збір макету з вибірковим OCR (точність 76.0%).fast: режим CPU/MPS з мінімальним викликом VLM (точність 66.6%, 7.4 стор/с).--disable_ocr: витягування текстового шару на CPU (точність 43.6%, 23.7 стор/с).
Ліцензія: код Apache 2.0; ваги моделей OpenRAIL-M (безкоштовно для стартапів із виручкою/інвестиціями до $5M).
Спробуй за 2 хвилини
pip install marker-pdf
marker_single sample.pdf --mode balancedbash
✓ Коли використовувати
- Конвертація великих масивів PDF у Markdown для RAG-систем
- Витягування структурованого тексту з цифрових та сканованих PDF на локальних GPU
✕ Коли НЕ варто
- Ультрашвидке витягування тексу без структури на CPU (краще використати LiteParse)
- Коммерційне використання компаніями з доходом понад $5M без придбання ліцензії
Що зробити сьогодні
- Протестувати режим Marker 2 balanced на власному наборі PDF-документів
- Перевірити ліцензійні обмеження, якщо дохід вашої компанії перевищує $5M
Джерела