Перейти до вмісту
ГоловнаНовиниКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Агенти й MCP/
  4. Автоматизація вилучення еталонних даних за допомогою подвійного LLM-шлюзу та агентного арбітражу
Агенти й MCP

Автоматизація вилучення еталонних даних за допомогою подвійного LLM-шлюзу та агентного арбітражу

Проєкт dnb-toc-ground-truth демонструє гібридний пайплайн, що об'єднує дві незалежні візуальні LLM із порогом узгодження 90% для структурованого вилучення даних. Розбіжності автоматично ескалюються до мультимодального агента на кшталт Claude для арбітражу, що дозволяє створювати якісні набори даних для файнтюнінгу легких моделей.

24 серпня 2026 р.· 4 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 24 серпня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Автоматизація вилучення еталонних даних за допомогою подвійного LLM-шлюзу та агентного арбітражу

Вплив: Середній

Чому це важливо

Ви можете суттєво скоротити витрати на структуроване вилучення даних, залишаючи дорогих передових LLM-агентів виключно для вирішення розбіжностей між меншими візуальними моделями.

TL;DR

  • 01Використовуйте консенсус двох LLM для автоматичного фільтрування високоточних результатів.
  • 02Ескалюйте сумнівні або розбіжні результати розпізнавання до мультимодальних агентів.
  • 03Проводьте файнтюнінг менших моделей на кшталт NuExtract3 на еталонних даних від агентів.

Ключові факти

Поріг узгодження авто-шлюзу90%
Середня F1-оцінка Crossref76%
Середня точність Crossref85%
Середня повнота Crossref77%
Поріг узгодження авто-шлюзу
90%
Обсяг вибірки оцінених книг
54 з 547
Середня F1-оцінка Crossref
76%
Середня точність Crossref
85%
Середня повнота Crossref
77%

Шлюз узгодження двох моделей

Для масштабованої генерації еталонних даних пайплайн запускає дві окремі візуальні LLM — Qwen/Qwen3-Omni-30B-A3B-Instruct та mistralai/Mistral-Small-3.2-24B-Instruct-2506 — на однакових зображеннях сторінок змісту. Результати порівнюються за допомогою dnb_toc_ground_truth.matching.gate_books. Якщо рівень збігу елементів становить 90% або більше, об'єднаний JSON зберігається напряму (source: bulk_gate).

Агентний арбітраж та LoRA-дистиляція

Якщо початковий шлюз узгодження не спрацьовує або моделі розходяться, пайплайн викликає мультимодального AI-агента, такого як Claude (source: agent_arbitration). Агент аналізує оригінальні зображення та створює еталонну транскрипцію. Отримані дані потім використовуються для LoRA файнтюнінгу менших вузькоспеціалізованих моделей вилучення, таких як numind/NuExtract3.

Зовнішня верифікація через Crossref

Щоб перевірити якість вилучення незалежно від внутрішньої узгодженості LLM, скрипти cli/backfill_crossref.py та cli/evaluate_crossref.py порівнюють еталонні дані з поглавними метаданими Crossref. На початковій вибірці з 54 книг із повними метаданими досягнуто середньої точності (precision) 85%, повноти (recall) 77% та F1-оцінки 76%.

Спробуй за 2 хвилини

uv run python cli/evaluate_crossref.py --all-models

bash

✓ Коли використовувати

  • При створенні великомасштабних пайплайнів структурованого вилучення даних зі сканованих PDF або зображень.
  • При підготовці наборів даних для файнтюнінгу малих спеціалізованих моделей із мінімальними витратами на API.

✕ Коли НЕ варто

  • При обробці простих текстових документів, що не потребують мультимодального візуального зіставлення.
  • Коли бюджет дозволяє запускати всі документи напряму через топові агентні моделі.

Що зробити сьогодні

  • →Запустіть uv run python cli/evaluate_crossref.py для тестування пайплайнів оцінки вилучення.
  • →Впровадьте поріг розбіжностей 90% між двома візуальними LLM перед викликом дорогого агента.
#Claude#Qwen3-Omni-30B#Mistral-Small-3.2#NuExtract3#Crossref#uv

Джерела

  • GitHub - cboulanger/dnb-toc-ground-truth
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаMoneyPrinterTurbo автоматизує створення HD-відео через багатомодельні AI-сценарії

Схожі матеріали

  • Агенти й MCPІзоляція паралельних AI-агентів розробки в окремі хмарні віртуальні машини
  • Агенти й MCPКорпоративний паттерн Model Context Protocol вимагає підтвердження змін та ізоляції ін'єкцій
  • Агенти й MCPGrok Bot аналізує відеозаписи екрана з аудіо для автоматизації рутинних завдань
  • Агенти й MCPІнженер використав декілька AI-моделей для пошуку root-експлойта для Amazon Fire

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.