Саймон Віллісон протестував субагентів Codex Desktop для vibe-coding 3D-ігор
Саймон Віллісон випробував Codex Desktop у режимі GPT-5.6 Sol Ultra з активним використанням субагентів для одноразової генерації 3D-гри. Codex успішно скоординував розробку та генерацію текстур через gpt-image-2, але не помітив графічних багів під час підтвердження через скріншоти.
Вплив: Середній
Чому це важливо
Оцініть межі ефективності та проблеми візуальної самокорекції субагентів під час автоматичної генерації додатків.
TL;DR
- 01Оркестрація субагентів ефективно справляється з генерацією багатьох файлів та ресурсів
- 02Візуальна самокорекція агентів все ще пропускає очевидні графічні дефекти
- 03Аналізуйте дамп транскриптів для оцінки логіки субагентів та витрат на API
Ключові факти
- Час виконання
- 52 хвилини
- Основна модель
- GPT-5.6 Sol Ultra
- Модель ресурсів
- gpt-image-2
Багатоагентна генерація ігор
Саймон Віллісон опублікував аналіз проекту з порівнянням Claude Fable 5 та Codex Desktop під управлінням GPT-5.6 Sol Ultra. Отримавши складне завдання з одного промпту, Codex запустив субагентів для координації створення репозиторію, ігрової логіки та текстур через gpt-image-2 протягом 52-хвилинної сесії.
Обмеження візуального контролю
Хоча архітектура субагентів успішно зібрала механіку взаємодії персонажів та 3D-оточення, вона виявила обмеження автоматичної візуальної перевірки. Codex аналізував скріншоти додатку під час ітерацій, але не зміг виявити збільшені чорні сфери над моделями персонажів.
✓ Коли використовувати
- Швидке прототипування складних інтерактивних додатків та графіки
- Паралелізація генерації коду, графічних скриптів та базова конфігурація проектів
✕ Коли НЕ варто
- Покладатися виключно на візуальний аналіз агента для тестування UI/UX
- Автономні деплої у продакшен без проходження традиційних CI-тестів
Що зробити сьогодні
- Вивчіть публічний транскрипт Codex для аналізу промптів субагентів
- Впроваджуйте чіткі юніт-тести для перевірки графічних властивостей при використанні AI-агентів
Джерела