Перейти до вмісту
ATAI Today Brief
ГоловнаНовиниКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Агенти й MCP/
  4. Google Science One усуває галюцинації дослідницьких агентів за допомогою Chain-of-Evidence
Агенти й MCP

Google Science One усуває галюцинації дослідницьких агентів за допомогою Chain-of-Evidence

31 липня 2026 р.· 4 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 31 липня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Google Science One усуває галюцинації дослідницьких агентів за допомогою Chain-of-Evidence

Google представила фреймворк Science One та систему CoE Audit для забезпечення строгої верифікації автономних AI-дослідників. Отримуючи джерела через API та пов'язуючи кожне твердження з виконуваним кодом, система повністю усуває фантомні цитування.

Вплив: Високий

Чому це важливо

Ви можете застосувати паттерн Chain-of-Evidence для запобігання галюцинаціям та розходженням між кодом і текстом у власних автономних агентах.

TL;DR

  • 01Не покладайтеся на параметричну пам'ять для цитувань; інтегруйте зовнішні API
  • 02Впроваджуйте пост-хок аудит для незалежного повторного запуску згенерованого коду
  • 03Використовуйте LLM-суддів для зіставлення текстового опису з реальним вихідним кодом

Ключові факти

Рівень галюцинацій цитувань базових системдо 21%
Рівень галюцинацій цитувань Science One0%
Рівень галюцинацій цитувань базових систем
до 21%
Рівень галюцинацій цитувань Science One
0%
Медалі на MLE-Bench
2 золоті, 2 срібні

Заземлення через зовнішні API

Science One не покладається на параметричну пам'ять для цитувань. Модуль Problem Investigator робить запити до Semantic Scholar API, аналізуючи до 100 повнотекстових PDF-документів. Це знизило рівень фантомних посилань з 21% у базових системах до 0%.

Ізольовані дослідження та верифікація тверджень

Двигун Discovery оцінює паралельні гілки розв'язання задач, зберігаючи результати у логах лише для читання. Перед формуванням фінального тексту модуль Claim Verifier додає інлайн-теги доказів, які зв'язують кожну метрику та опис методу з вихідним кодом.

Чотири етапи CoE Audit

Протокол пост-хок аудиту перевіряє цілісність артефактів: 1. Score Verification: Повторно запускає код для підтвердження метрик. 2. Specification Check: Перевіряє відсутність маніпуляцій з метриками оцінювання. 3. Reference Verification: Перевіряє цитування через наукові API. 4. Method-Code Alignment: Використовує LLM-суддів для зіставлення текстового опису з вихідним кодом.

✓ Коли використовувати

  • Розробка автономних агентів для досліджень та Data Science
  • Автоматизація складних процесів генерації коду, що потребують аудиту

✕ Коли НЕ варто

  • Прості однокрокові промпти, де критична мінімальна затримка
  • Сесії творчого брейнштормінгу без вимог суворої верифікації

Що зробити сьогодні

  • →Інтегруйте перевірку цитувань через API перед генерацією підсумкового markdown
  • →Додайте автоматичний повторний запуск коду в пайплайн агента для перевірки реальних метрик
#Science One Framework#Semantic Scholar API#MLE-Bench#Parameter-Golf

Джерела

  • Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence
ПоділитисяПоділитися в XПоділитися в LinkedIn
Наступна новина →Звіт Anthropic підкреслює ризики помилок мережевої конфігурації під час тестування AI-агентів

Схожі матеріали

  • Агенти й MCPЗвіт Anthropic підкреслює ризики помилок мережевої конфігурації під час тестування AI-агентів
  • Агенти й MCPПорівняння AI-агентів: Hermes Agent випереджає OpenClaw за обсягом токенів
  • Агенти й MCPТест Vending-Bench виявив картельні змови та обман у поведінці автономних агентів
  • Агенти й MCPСтруктурування інструкцій субагентів Claude для мінімізації накладних витрат

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.