Перейти до вмісту
ГоловнаНовиниДайджестиКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Vibe coding/
  4. Кількісна оцінка надлишковості коду ШІ-агентів за допомогою AST-Grep та метрик ерозії
Vibe coding

Кількісна оцінка надлишковості коду ШІ-агентів за допомогою AST-Grep та метрик ерозії

Бенчмаркінг показав, що ШІ-агенти створюють код із удвічі вищою вербозністю та архітектурною ерозією, ніж у людських репозиторіях. Ітеративні цикли агентів накопичують невдалі абстракції, через що показник успішності у строгих тестах падає до нуля.

11 вересня 2026 р.· 6 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 11 вересня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Кількісна оцінка надлишковості коду ШІ-агентів за допомогою AST-Grep та метрик ерозії

Вплив: Високий

Чому це важливо

Тести для нового коду перевіряють його функціональну правильність, але не помічають деградацію архітектури. Через швидку генерацію коду моделями структурна ентропія непомітно накопичується, доки навіть передові агенти не починають зазнавати невдач.

TL;DR

  • 01Код від ШІ-агентів має приблизно вдвічі вищу вербозність та архітектурну ерозію порівняно з репозиторіями, написаними людьми.
  • 02Провідні моделі демонструють 0% успішних проходжень у суворих багатоетапних тестах зі скиданням контексту між чекпоїнтами.
  • 03Використання LLM як судді для оцінки якості коду залишається нестабільним і за точністю нагадує генератор випадкових чисел.

Ключові факти

Вербозність у вайб-проєктахДо 0.40
Ерозія у вайб-проєктахДо 0.75
Вербозність коду агентів
0.33 ± 0.10 (проти 0.15 ± 0.06 у людей)
Ерозія коду агентів
0.68 ± 0.20 (проти 0.31 ± 0.17 у людей)
Вербозність у вайб-проєктах
До 0.40
Ерозія у вайб-проєктах
До 0.75
Успішність у строгих багатоетапних тестах
0% серед провідних моделей міркування

Кількісний вимір надлишковості у вайб-кодингу

Хоча мовні моделі генерують синтаксично правильний код, що проходить базові тести, ітеративна робота веде до вибухового зростання рядків коду. Дослідник Себастьян з Earendil перевірив метрики бенчмарку SlopCodeBench, відмовившись від ненадійного підходу LLM-як-суддя, оцінки якого часто нагадують генератор випадкових чисел.

Вербозність та ерозія функцій

SlopCodeBench виділяє дві ключові математичні метрики кодової деградації:

  • Вербозність (Verbosity): частка рядків дублікатів та спрацювань ast-grep відносно загальної кількості рядків (LOC). Для коду людей середній показник становить 0.15 ± 0.06, тоді як для коду агентів — 0.33 ± 0.10.
  • Ерозія (Erosion): концентрація маси кодової бази у складних функціях із цикломатичною складністю CC(f) > 10. Маса функції визначається як mass(f) = CC(f) * sqrt(SLOC(f)). Для коду агентів показник становить 0.68 ± 0.20, що вдвічі перевищує людські репозиторії (0.31 ± 0.17).

Чому ітеративні агенти ламаються на довгих дистанціях

У SlopCodeBench агенти проходять кілька раундів інструкцій зі скиданням контексту між чекпоїнтами, що імітує реальний процес програмування. Погані архітектурні рішення нашаровуються, і в результаті навіть топові моделі міркування отримують 0% успішних завершень за суворими критеріями. Це демонструє, що самі агенти не здатні впоратися зі сміттєвим кодом, коли невдалі абстракції накопичуються від раунду до раунду.

Спробуй за 2 хвилини

mass = cc * (sloc ** 0.5)
erosion = sum(f.mass for f in funcs if f.cc > 10) / sum(f.mass for f in funcs)

python

✓ Коли використовувати

  • Використовуйте формули ерозії та аналіз на базі AST для перевірки стану кодових баз, де активно застосовується ШІ-генерація.

✕ Коли НЕ варто

  • Не покладайтеся на прямі оцінки від LLM-суддів за шкалою від 1 до 10 для вимірювання чистоти коду.

Що зробити сьогодні

  • →Відстежуйте дельту кількості рядків коду (LOC) у PR від агентів як перший індикатор розростання зайвих абстракцій.
  • →Контролюйте цикломатичну складність та масу функцій для виявлення архітектурної ерозії.
#ast-grep#SlopCodeBench

Джерела

  • If coding is solved, what now?: Measuring the sloppiness of code
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаOpenAI призупиняє нові підписки Pro за 200 доларів через ажіотаж довкола Astra

Схожі матеріали

  • Vibe codingОцінка доцільності розробки через тестування всередині автономних циклів ШІ-агентів
  • Vibe codingWasItVibed аналізує публічні сайти за 46 детерміністичними правилами на AI-код
  • Vibe codingЛіцензія VibeCoded AI-Slop v1.0 встановлює відмову від зобов'язань для ШІ-коду

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.