Benzi індексує код через Tree-Sitter для редагування на базі AST
Benzi відмовляється від завантаження всього репозиторію в контекст на користь компіляції через tree-sitter, зіставляючи символи й ланцюжки викликів зі складністю O(1). На SWE-bench Verified у зв'язці з DeepSeek v4-flash вартість виправлення бага склала близько одного цента.

Вплив: Середній
Чому це важливо
Ви можете усунути роздутий контекст промптів та синтаксичні помилки, надавши агенту детермінований статичний індекс замість звичайного пошуку файлів.
TL;DR
- 01Замінює масивне читання файлів детермінованим індексом компілятора для 10 мов програмування.
- 02Автоматично скасовує правки моделі, які призводять до порушення синтаксичного дерева AST.
- 03Знижує витрати на виправлення дефектів до ~$0.01 на DeepSeek v4-flash за даними SWE-bench Verified.
Ключові факти
- Вартість фіксу на DeepSeek
- ~$0.01 за баг (дані розробника)
- Порівняння з Claude Code
- До $0.18 за крок (дані розробника)
- Підтримувані мови
- 10 мов + HTML/CSS/DOM-JS
- Тестовий набір
- 500 завдань SWE-bench Verified
Парсинг через Tree-Sitter замість скидання контексту
На відміну від інструментів, що покладаються на grep чи векторні ембедінги, Benzi виконує повний прохід парсером tree-sitter перед генерацією відповідей. Для десяти мов (включно з Python, TypeScript, Go та Rust) і розмітки система формує індекс символів, зв'язків та наслідування. Потоки даних пов'язуються безпосередньо в точках виклику, що дає змогу виконувати команди на зразок backflow чи trace_path за один крок $O(1)$.
Аналіз зони ураження та валідація правок
Запис коду здійснюється через контрольовані шлюзи:
- Оцінка радіуса змін: Агент аналізує залежних споживачів функції до застосування дифів.
- Синтаксичні шлюзи: Будь-яка зміна перевіряється синтаксичним деревом AST; у разі помилки парсингу правка автоматично скасовується.
- Трасування виконання: Для Python агент підключає трейсер, що фіксує аргументи й фактичний dispatch, усуваючи неоднозначності статичного аналізу.
Ефективність і витрати на SWE-bench Verified
Тестування на 500 задачах SWE-bench Verified із DeepSeek v4-flash показало значну економію ресурсів. Benzi виправляв дефекти за середньою ціною близько $0.01 за баг завдяки мінімальній кількості зчитаних рядків, тоді як рішення з традиційним читанням файлів витрачали до $0.18 за крок у складних сценаріях.
✓ Коли використовувати
- Рефакторинг великих проєктів без надмірних витрат токенів на повне читання файлів.
- Запобігання синтаксичним збоям за допомогою автоматичного відкату невалідного коду.
✕ Коли НЕ варто
- Виключно консольні пайплайни та скрипти без підтримки графічного браузера чи VS Code.
- Мови за межами десяти підтримуваних граматик, що вимагають динамічного трасування.
Що зробити сьогодні
- Протестуйте індексацію кодової бази, вставивши посилання на публічний репозиторій у benzi.fly.dev.
- Встановіть розширення Benzi з VS Code Marketplace для тестування правок із валідацією AST.
- Використовуйте інструменти `trace_path` та `backflow` для аналізу складних ланцюжків викликів у проєкті.
Джерела