ProvenanceGuard додає верифікацію першоджерел до агентів Model Context Protocol
Multiverse Computing випустила ProvenanceGuard — автономний шар постгенераційної перевірки для агентів Model Context Protocol. Замість об'єднання викликів інструментів в анонімний контекст, система відстежує ідентифікатори джерел для кожного твердження окремо.

Вплив: Середній
Чому це важливо
Ви можете інтегрувати цей гейт постгенерації у власні агентні пайплайни, щоб гарантувати відповідність тверджень моделі саме тим інструментам, на які вона посилається.
TL;DR
- 01Традиційні RAG-верифікатори ігнорують атрибуцію інструментів, пропускаючи посилання на хибне джерело в MCP.
- 02ProvenanceGuard фіксує ID інструментів для кожного твердження і блокує 100% навмисних підмін першоджерела.
- 03Локальні моделі перевірки (MiniLM і DeBERTa) додають лише ~0.5 с затримки на відповідь без викликів хмарних API.
Ключові факти
- Вибірка оцінки експертами
- 361 твердження у 40 трейсах
- Блокування некоректних тверджень
- 138 із 139 виявлено (99.3%)
- Детекція підміни джерел
- 50 із 50 виявлено (100%)
- Точність вибору першоджерела
- 86% у базовому тесті, 50.3% для схожих джерел
- Затримка локального пайплайну
- ~0.5 секунди на відповідь
Проблема перехресної підміни джерел
Коли автономні агенти викликають декілька інструментів через Model Context Protocol (MCP), традиційні скорери достовірності скидають усі вихідні дані в один контекст. Це створює критичну вразливість — змішування джерел (cross-source conflation): твердження є правдивим у межах сесії, але приписане зовсім іншому інструменту або запису. У чутливих системах посилання на загальний регламент замість персонального запису клієнта призводить до серйозних помилок, навіть якщо текст звучить переконливо.
П'ятикроковий пайплайн верифікації
ProvenanceGuard працює як автономний постгенераційний шлюз поверх трейсів без повторного тренування базової моделі:
1. Декомпозиція тверджень: розбиття відповіді на атомарні твердження за допомогою локальної LLM. 2. Маршрутизація джерел: зіставлення твердження з конкретним source ID інструменту через MiniLM. 3. Скоринг відповідності: перевірка логічного слідування моделлю DeBERTa NLI з суворою валідацією дат, чисел та ідентифікаторів. 4. Звірка атрибуції: перевірка, чи збігається вказане у відповіді джерело з фактично викликаним MCP-інструментом. 5. Відновлення та фолбек: передача заблокованих відповідей у цикл виправлення за типом RARR для безпечної корекції.
Бенчмарки та продуктивність
На вибірці з 361 твердження у 40 складних мультиінструментальних трейсах експерти забракували 139 тверджень; ProvenanceGuard виявив 138 із них. У тесті з 50 навмисними підмінами джерела система зупинила всі 50 помилок. Додаткова затримка локального пайплайну складає близько 0.5 секунди на відповідь, а виклики NLI тривають лічені мілісекунди.
Спробуй за 2 хвилини
from dataclasses import dataclass
from typing import List
@dataclass
class MCPToolTrace:
source_id: str
tool_name: str
output_text: str
def verify_claim_provenance(claim: str, cited_source_id: str, traces: List[MCPToolTrace]) -> bool:
matched_trace = next((t for t in traces if t.source_id == cited_source_id), None)
if not matched_trace:
return False
# Run DeBERTa NLI check strictly against matched_trace.output_text
return nli_entailment_check(premise=matched_trace.output_text, hypothesis=claim)python
✓ Коли використовувати
- Мультиінструментальні агенти MCP, що звертаються до баз даних, API та документів за одну сесію.
- Чутливі сфери (медицина, фінтех, юриспруденція), де хибна атрибуція факту порушує вимоги комплаєнсу.
✕ Коли НЕ варто
- Прості однокрокові RAG-пайплайни з єдиним текстовим індексом.
- Голосові інтерфейси реального часу, де затримка у 500 мс є критичною.
Що зробити сьогодні
- Зберігайте метадані викликів інструментів та унікальні source ID у трейсах виконання MCP-клієнта.
- Розділяйте перевірку фактичної точності та валідацію першоджерела в пайплайнах оцінки агентів.
- Налаштуйте цикл фолбеків у стилі RARR для корекції тверджень, які не пройшли звірку джерел.
Джерела