Anthropic продемонструвала автоматизовані дослідники вирівнювання AI за чотири долари на годину
Дослідник Anthropic Чень Юе-Хань опублікував роботу, яка показує, що автоматизовані дослідники вирівнювання можуть стабільно покращувати бенчмарки моделей. Працюючи через API за $4 на годину, система перевершила пропозиції досвідчених людських дослідників за шість годин.

Вплив: Середній
Чому це важливо
Ви можете вивчити, як структуровані агентні цикли виконують пошук літератури, тестування гіпотез та 30-хвилинні ітерації навчання для автоматизації пост-тренувальних процесів.
TL;DR
- 01Автоматизовані системи вирівнювання з 30-хвилинними ітераціями навчання успішно покращили 10 цільових бенчмарків.
- 02Вартість виконання API становила в середньому $4 на годину порівняно з $150 на годину для людських команд.
- 03Якість бенчмарків залишається основним вузьким місцем для рекурсивних дослідницьких агентів.
Ключові факти
- Вартість API-інференсу
- $4 на годину
- Вартість людського дослідника
- $150 на годину
- Тривалість ітерації навчання
- 30 хвилин
Автоматизоване дослідження вирівнювання
Дослідник Anthropic Чень Юе-Хань описав систему Automated Alignment Researcher, здатну ітеративно знаходити техніки вирівнювання без втручання людини.
Результати бенчмарків та витрати
Систему протестували на 10 цільових бенчмарках. Автоматизований пайплайн працює приблизно за $4 на годину API-інференсу, перевершуючи середні результати людських дослідників за шість годин при традиційній вартості $150 на годину.
Механіка робочого процесу
Кожна ітерація виконує пошук у літературі, генерує кандидати методів і запускає 30-хвилинну сесію тонкого налаштування перед валідацією на бенчмарках.
✓ Коли використовувати
- Використовуйте автоматизовані робочі процеси для ітерацій над спеціалізованими метриками після навчання.
- Застосовуйте агентні цикли для швидкого дослідження гіпотез під час оптимізації моделей.
✕ Коли НЕ варто
- Не покладайтеся на автоматизовані цикли досліджень при оцінці неперевірених або зашумлених бенчмарків.
- Уникайте використання автоматичного зворотного зв'язку без чітких обмежувачів у критичних для безпеки системах.
Що зробити сьогодні
- Ознайомтеся з публікацією про автоматизоване вирівнювання для аналізу циклів генерації гіпотез агентами.
- Оцініть логіку автоматизованого оцінювання бенчмарків у власних пайплайнах тонкого налаштування.
Джерела