Inherent Labs презентує 27B агент Faraday для відтворення наукових досліджень
Inherent Labs представила Faraday — агента-науковця на 27 мільярдів параметрів, натренованого за допомогою тривалого навчання з підкріпленням на датасеті Replica. Використовуючи GPT-5.5 Codex як інструмент виконання, Faraday перевершує більші моделі на кшталт Claude Opus 4.8 у відтворенні дослідницьких графіків та експериментів.

Вплив: Середній
Чому це важливо
Інженери мультиагентних систем можуть перейняти архітектурний паттерн Faraday: використання компактної спеціалізованої моделі-диригента у зв'язці з потужними базовими кодинг-агентами.
TL;DR
- 01Faraday доводить, що 27B модель може ефективно диригувати значно більшою LLM (GPT-5.5 Codex) як інструментом виконання.
- 02Навчання агентів на завданнях відтворення досліджень формує узагальнювані навички розв'язання неструктурованих задач.
- 03Агрегація семплів та покроковий розподіл кредиту стабілізують RL-навчання при використанні шумних LLM-суддів.
Ключові факти
- Параметри моделі
- 27B
- Кількість завдань бенчмарку
- 310 завдань у 100 наукових працях
- Модель-інструмент
- GPT-5.5 Codex
Тривале навчання з підкріпленням на середовищі Replica
Inherent Labs створила Faraday за допомогою Replica — нового середовища RL-завдань, яке містить 310 завдань з відтворення результатів 100 наукових праць у галузі ML та природничих наук. Кожне завдання вимагає від агента точного відтворення опублікованих графіків у межах обмеженого бюджету часу та обчислень без доступу до вихідного коду. Замість ручних еволюційних циклів Faraday застосовує long-horizon RL для формування наукової інтуїції.
Ієрархічна оркестрація агентів із кодинг-інструментами
Замість ізольованого виконання 27B-модель Faraday виступає в ролі високорівневого диригента, який керує інструментом GPT-5.5 Codex для написання та запуску коду. Під час тренування Faraday навчився керувати GPT-5.4-mini, а на етапі тестування успішно адаптувався до сильнішого GPT-5.5 Codex. Для стабілізації сигналів винагороди під час багатокрокових досліджень розробники використали автогенеровані рубрики оцінювання, мульти-семплінг агрегацію та покроковий розподіл кредиту (turn-level credit assignment).
✓ Коли використовувати
- Проєктування ієрархічних мультиагентних систем, де мала модель керує потужними інструментами.
- Налаштування складних RL-сигналів винагороди для багатокрокових дослідницьких процесів.
✕ Коли НЕ варто
- Розробка чат-ботів реального часу з низькою затримкою.
- Прості одноінструкційні завдання генерації коду, де достатньо одного промпту.
Що зробити сьогодні
- Оцінити можливість використання двошарової архітектури з малою моделлю-диригентом замість довгого промптингу великої LLM.
- Впровадити покроковий розподіл кредиту (turn-level credit assignment) під час оцінювання багатокрокових траєкторій агентів.
Джерела