NVIDIA випустила SkillEvaluator для тестування навичок штучного інтелекту в Claude Code та Cursor
NVIDIA випустила у відкритий доступ SkillEvaluator — інструмент автоматизованого тестування навичок AI-агентів для Claude Code, Codex та Cursor. Оцінка понад 300 навичок показала середнє зростання точності та ефективності на 31 пункт.

Вплив: Високий
Чому це важливо
Ви можете протестувати власні навички агентів та конфігурації Model Context Protocol за допомогою трирівневої фреймворк-оцінки.
TL;DR
- 01Використовуйте SkillEvaluator для вимірювання приросту ефективності власних навичок агентів перед деплоєм.
- 02Ізолюйте тестові запуски за допомогою пісочниць Harbor для запобігання побічним ефектам.
- 03Забезпечуйте унікальність описів інструментів на етапі Tier 2 для уникнення плутанини між навичками.
Ключові факти
- Кількість протестованих навичок
- Понад 300 для 30+ продуктів
- Середній приріст Skill Lift
- 31 пункт (39 пунктів без безпеки)
- Підтримувані середовища
- Claude Code, Codex, Cursor
Трирівневе тестування навичок агентів
NVIDIA SkillEvaluator стандартизує тестування навичок штучного інтелекту за трьома етапами:
- Tier 1 (Безпека та структура): Статична перевірка схем, сканування на наявність ін'єкцій промптів, витік секретів та лінтинг скриптів.
- Tier 2 (Унікальність): Використання векторних ембедінгів для виявлення дубльованих інструкцій та перекриття функцій у каталозі.
- Tier 3 (Живе тестування у пісочниці): Запуск завдань у ізольованому середовищі Harbor з порівнянням результатів роботи з навичкою та без неї.
Результати бенчмарку для 300+ навичок
Тестування у середовищах Claude Code та Codex показало значне зростання показників порівняно з базовим рівнем:
- Точність (Correctness): Базовий рівень без навички —
46/100. - Ознайомлення (Discoverability): Базовий рівень —
42/100. - Ефективність (Effectiveness): Базовий рівень —
39/100. - Продуктивність (Efficiency): Базовий рівень —
43/100. - Загальний Skill Lift: Середній приріст становить
31 пункт(39 пунктівбез урахування безпеки).
Спробуй за 2 хвилини
skillevaluator create-eval-dataset ./my-skill --full
skillevaluator tier3 evaluate ./my-skillbash
✓ Коли використовувати
- При розробці власних інструментів або навичок для Claude Code, Codex або Cursor.
- Під час перевірки безпеки та захисту від промпт-ін'єкцій у системних інтеграціях.
✕ Коли НЕ варто
- Під час простих одноразових викликів API без використання агентів та маршрутизації інструментів.
Що зробити сьогодні
- Створіть тестовий датасет для власної навички агента за допомогою команди skillevaluator create-eval-dataset.
- Запустіть живий аналіз Tier 3 для вимірювання точності виконання та витрати токенів.
Джерела