Бенчмарк Claude Opus 5.5: Чому скіли агентів та оновлення CLI залишаються важливими
Команда Driftproof протестувала Claude Opus 5.5 через 15 годин після релізу на трьох скілах із addyosmani/agent-skills. Без файлу SKILL.md Opus 5.5 показав гірші результати в conventional commits та розмітці рев'ю, ніж Opus 5. Крім того, виклик нової моделі в Claude Code вимагає обов'язкового оновлення до версії 2.1.280 або вище.

Вплив: Середній
Чому це важливо
Зберігайте файли конфігурацій SKILL.md у репозиторіях замість сподівань на те, що оновлена базова модель автоматично замінить системні інструкції.
TL;DR
- 01Не видаляйте файли SKILL.md; без них Opus 5.5 отримав оцінку 0.300 за оформлення conventional commits проти 0.765 у Opus 5.
- 02Оновіть утиліту Claude Code до версії 2.1.280 або вище перед перемиканням на Opus 5.5.
- 03Перевіряйте звіти бенчмарків локально за допомогою валідатора Driftproof CLI з відкритим кодом.
Ключові факти
- Необхідна версія Claude Code CLI
- >= 2.1.280
- Кількість викликів моделі в бенчмарку
- 204 виклики
- Оцінка Conventional Commits без скіла (Opus 5.5 проти Opus 5)
- 0.300 проти 0.765
- Оцінка розмітки важливості рев'ю без скіла (Opus 5.5 проти Opus 5)
- 0.680 проти 0.862
- Вартість запуску бенчмарку
- $0.00 за підпискою (~$10 за тарифами API)
Оновлення моделі потребує оновлення середовища виконання
Під час тестування Claude Opus 5.5 після релізу інженери Driftproof виявили, що Claude Code CLI версії 2.1.272 блокував перший запит до Opus 5.5 із помилкою, вимагаючи версію 2.1.280 або новішу. Перехід на Opus 5.5 в автономних пайплайнах вимагає обов'язкового оновлення самого пакету утиліти перед перемиканням назви моделі в конфігураціях.
Скіли захищають від деградації форматування
Для трьох публічних скілів (code-review-and-quality, git-workflow-and-versioning, documentation-and-adrs) наявність інструкцій SKILL.md нівелювала деградацію результатів:
- Conventional Commits: Без файлу правил Opus 5.5 перестав додавати префікси
fix:, отримавши0.300проти0.765у Opus 5. - Градація важливості рев'ю: У рев'ю без підказок Opus 5.5 втратив мітки критичності у двох із чотирьох запусків, показавши
0.680проти0.862у Opus 5. - Рівні показники зі скілами: За наявності
SKILL.mdрізниця між Opus 5 та Opus 5.5 майже зникла (+0.009,-0.023,-0.143за шкалою від 0 до 1).
Верифікація результатів
Тест із 204 викликів коштував $0.00 на підписці (близько $10 за API тарифами). Усі артефакти зафіксовані хешами, а перевірити валідність звітів можна локально за допомогою команди npx driftproof validate <file>.
Спробуй за 2 хвилини
# Update Claude Code to support Opus 5.5
npm install -g @anthropic-ai/claude-code@latest
# Validate benchmark receipts from Driftproof Report 011
npx driftproof validate report-011.receipt.jsonbash
✓ Коли використовувати
- Використовуйте під час переведення агентських середовищ та систем код-рев'ю на Claude Opus 5.5.
- Використовуйте для перевірки реальної ефективності файлів скілів під час переходу між поколіннями моделей.
✕ Коли НЕ варто
- Не запускайте Claude Code версії 2.1.272 для викликів моделі Opus 5.5.
- Не видаляйте файли SKILL.md, розраховуючи, що Opus 5.5 самостійно забезпечить дотримання специфічних конвенцій без системних правил.
Що зробити сьогодні
- Виконайте npm install -g @anthropic-ai/claude-code@latest, щоб переконатися, що версія Claude Code не нижча за 2.1.280.
- Залиште активними файли SKILL.md у репозиторіях для генерації комітів та автоматичного код-рев'ю.
Джерела