Автоматизація вилучення еталонних даних за допомогою подвійного LLM-шлюзу та агентного арбітражу
Проєкт dnb-toc-ground-truth демонструє гібридний пайплайн, що об'єднує дві незалежні візуальні LLM із порогом узгодження 90% для структурованого вилучення даних. Розбіжності автоматично ескалюються до мультимодального агента на кшталт Claude для арбітражу, що дозволяє створювати якісні набори даних для файнтюнінгу легких моделей.

Вплив: Середній
Чому це важливо
Ви можете суттєво скоротити витрати на структуроване вилучення даних, залишаючи дорогих передових LLM-агентів виключно для вирішення розбіжностей між меншими візуальними моделями.
TL;DR
- 01Використовуйте консенсус двох LLM для автоматичного фільтрування високоточних результатів.
- 02Ескалюйте сумнівні або розбіжні результати розпізнавання до мультимодальних агентів.
- 03Проводьте файнтюнінг менших моделей на кшталт NuExtract3 на еталонних даних від агентів.
Ключові факти
- Поріг узгодження авто-шлюзу
- 90%
- Обсяг вибірки оцінених книг
- 54 з 547
- Середня F1-оцінка Crossref
- 76%
- Середня точність Crossref
- 85%
- Середня повнота Crossref
- 77%
Шлюз узгодження двох моделей
Для масштабованої генерації еталонних даних пайплайн запускає дві окремі візуальні LLM — Qwen/Qwen3-Omni-30B-A3B-Instruct та mistralai/Mistral-Small-3.2-24B-Instruct-2506 — на однакових зображеннях сторінок змісту. Результати порівнюються за допомогою dnb_toc_ground_truth.matching.gate_books. Якщо рівень збігу елементів становить 90% або більше, об'єднаний JSON зберігається напряму (source: bulk_gate).
Агентний арбітраж та LoRA-дистиляція
Якщо початковий шлюз узгодження не спрацьовує або моделі розходяться, пайплайн викликає мультимодального AI-агента, такого як Claude (source: agent_arbitration). Агент аналізує оригінальні зображення та створює еталонну транскрипцію. Отримані дані потім використовуються для LoRA файнтюнінгу менших вузькоспеціалізованих моделей вилучення, таких як numind/NuExtract3.
Зовнішня верифікація через Crossref
Щоб перевірити якість вилучення незалежно від внутрішньої узгодженості LLM, скрипти cli/backfill_crossref.py та cli/evaluate_crossref.py порівнюють еталонні дані з поглавними метаданими Crossref. На початковій вибірці з 54 книг із повними метаданими досягнуто середньої точності (precision) 85%, повноти (recall) 77% та F1-оцінки 76%.
Спробуй за 2 хвилини
uv run python cli/evaluate_crossref.py --all-modelsbash
✓ Коли використовувати
- При створенні великомасштабних пайплайнів структурованого вилучення даних зі сканованих PDF або зображень.
- При підготовці наборів даних для файнтюнінгу малих спеціалізованих моделей із мінімальними витратами на API.
✕ Коли НЕ варто
- При обробці простих текстових документів, що не потребують мультимодального візуального зіставлення.
- Коли бюджет дозволяє запускати всі документи напряму через топові агентні моделі.
Що зробити сьогодні
- Запустіть uv run python cli/evaluate_crossref.py для тестування пайплайнів оцінки вилучення.
- Впровадьте поріг розбіжностей 90% між двома візуальними LLM перед викликом дорогого агента.
Джерела