Прискорення GPU-ядра у 232 рази за допомогою Codex у циклі автодослідження
Учасник змагання GPU Mode використав Codex у замкненому циклі зворотного зв'язку для оптимізації CUDA-ядра QR-розкладу, досягнувши 232-разового прискорення відносно базового рівня. Підхід демонструє, як інженерія агентних циклів та автоматизований бенчмаркінг дозволяють швидко оптимізувати складний GPU-код.

Вплив: Високий
Чому це важливо
Ви можете застосувати інженерію агентних циклів у високопродуктивних обчисленнях, поєднавши Codex або Claude Code із CLI-інструментами автоматичного тестування та бенчмаркінгу.
TL;DR
- 01Інтеграція Codex із детермінованим циклом зворотного зв'язку дозволяє автоматично оптимізувати продуктивність.
- 02Базові знання предметної області у промптах допомагають обирати правильні алгоритмічні підходи.
- 03Ітеративний підхід агентів дозволяє розробникам без глибокого досвіду досягати суттєвого прискорення GPU-ядер.
Ключові факти
- Прискорення від базового рівня
- 232x
- Місце у лідерборді
- 12 з 183
- Всього відправок агентом
- 1500+ за 14 днів
- Розміри матриць
- від 512x512 до 4096x4096 FP32
Автоматизований бенчмаркінг для AI-агентів через Popcorn CLI AI-агенти демонструють найкращі результати у разі наявності чіткого авто-тестування. У конкурсі GPU Mode завдання полягало в оптимізації пакетної факторизації FP32 CUDA-матриць A (розмірами від 512x512 до 4096x4096) для повернення компактного QR-представлення, еквівалентного torch.geqrf(A). Організатори надали CLI-інструмент popcorn, який автоматизував перевірку коректності та вимірювання геометричного середнього часу виконання. ### Інженерія циклу (Loop Engineering) та стратегія Стратегія оптимізації поєднувала архітектурний напрямок від людини та швидкі ітерації агента: - Вибір алгоритму: Перехід до блочного алгоритму Хаусхолдера з WY-оновленнями для усунення послідовних залежностей і перетворення операцій на матричне множення (GEMM). - Інтенсивність ітерацій: Codex виконав понад 1500 автоматизованих відправок за 14 днів для оптимізації параметрів ядра. - Спрямування контексту: Надання агенту знань про розкладання матриць, що використовуються в сучасних AI-оптимізаторах (таких як Muon і Shampoo).
Спробуй за 2 хвилини
popcorn submit --kernel qr_v2.cu --benchmarkbash
✓ Коли використовувати
- Оптимізація обчислювально складних CUDA/Triton ядер із автоматичною перевіркою
- Налаштування автономних агентних циклів з оцінкою продуктивності через CLI
✕ Коли НЕ варто
- Розробка бізнес-логіки без автоматизованих циклів вимірювання продуктивності
- Задачі, де коректність коду неможливо перевірити детермінованими тестами
Що зробити сьогодні
- Створіть CLI-інструменти вимірювання продуктивності для надання код-агентам чіткого циклу перевірки.
- Задавайте високорівневі алгоритмічні орієнтири у промптах для AI-агентів.
Що каже спільнота
“They are easily verifiable and hill-climbable... built tools for the same automatic verifiability that is useful for LLMs.”
Джерела