Тестування GPT-5.6 Luna проти GPT-6 Astra для автоматизованого рев'ю коду
Entelligence протестувала GPT-5.6 Luna проти GPT-6 Astra на 50 пулл-реквестах із відкритих репозиторіїв. Luna виявила 75% від кількості підтверджених багів Astra (69 проти 92 зі 143) лише за 3.6% вартості токенів, але пропустила критичні вразливості автентифікації.

Вплив: Середній
Чому це важливо
Передові моделі надто дорогі для перевірки кожного PR у CI/CD. Розуміння меж ефективності дешевих моделей та їхніх сліпих зон безпеки дозволяє створювати рентабельні комбіновані системи рев'ю.
TL;DR
- 01Luna виявила 75% від кількості багів Astra (69 проти 92 зі 143) за 3.6% загальної вартості.
- 02Рівень хибних зауважень у Luna склав 25.8% проти 4.2% в Astra.
- 03Luna пропустила більшість проблем безпеки, зафіксувавши лише 9 із 24 (проти 19 в Astra).
- 04Запуск обох моделей на кожному PR дозволив виявити 117 зі 143 багів (82%) за $5.86 сумарно.
Ключові факти
- Вартість GPT-5.6 Luna
- $0.20 вхід / $1.20 вихід за 1M токенів
- Вартість GPT-6 Astra
- $10 вхід / $50 вихід за 1M токенів
- Середня вартість рев'ю
- $0.0041 (Luna) проти $0.113 (Astra)
- Середня затримка рев'ю
- 23 с (Luna) проти 36 с (Astra)
- Виявлення багів безпеки
- 9/24 (Luna) проти 19/24 (Astra)
- Частка хибних спрацьовувань
- 24/93 (25.8%) для Luna проти 4/96 (4.2%) для Astra
Співвідношення ціни та затримки
GPT-5.6 Luna коштує $0.20 за 1M вхідних токенів і $1.20 за 1M вихідних токенів, тоді як GPT-6 Astra оцінюється в $10 на вході та $50 на виході. На 50 тестових PR із дефектами перевірка Luna коштувала сумарно $0.20 ($0.0041 за PR) проти $5.66 ($0.113 за PR) для Astra. Час аналізу Luna склав 23 секунди проти 36 секунд в Astra.
Рівень виявлення та сліпі зони безпеки
Luna знайшла 69 підтверджених багів (75% від результату Astra), тоді як Astra виявила 92 зі 143 загальних зафіксованих дефектів. Разом із тим Luna продукувала значно більше шуму: 24 із 93 її зауважень були відхилені верифікаторами порівняно з 4 помилками з 96 в Astra. Розподіл знайдених проблем за категоріями:
- Дані та логіка: Luna — 39; Astra — 47.
- Конкурентність: Luna — 10; Astra — 13.
- Безпека: Luna — 9 із 24; Astra — 19 із 24.
У тестах Keycloak, де зміни стосувалися авторизації, Luna виявила лише 6 валідних багів проти 14 у Astra, маючи 50% хибних спрацьовувань. Luna пропустила незаблоковані коди відновлення та помилку перекриття глобальних прав доступу.
Ефект від комбінування моделей
Примітно, що 25 валідних багів були помічені виключно Luna (наприклад, стан гонитви з робочими потоками в Sentry). Запуск обох моделей на кожному pull request дозволив би виявити 117 зі 143 підтверджених дефектів (82%) сумарно за $5.86 ($0.20 за Luna плюс $5.66 за Astra), додавши 25 унікальних знайдених помилок.
✓ Коли використовувати
- Для масового та економного пошуку базових помилок логіки та обробки даних у повсякденних змінах коду.
✕ Коли НЕ варто
- Під час рев'ю критичного коду авторизації, перевірки токенів або криптографічних функцій без додаткової перевірки.
Що зробити сьогодні
- Уникайте використання бюджетних моделей наодинці для коду автентифікації, прав доступу та безпеки.
- Розгляньте можливість паралельного запуску моделей для виявлення взаємодоповнюючих помилок у логіці та конкурентності.
Джерела