Перейти до вмісту
ГоловнаНовиниКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Оптимізація токенів/
  4. Прискорення GPU-ядра у 232 рази за допомогою Codex у циклі автодослідження
Оптимізація токенів

Прискорення GPU-ядра у 232 рази за допомогою Codex у циклі автодослідження

Учасник змагання GPU Mode використав Codex у замкненому циклі зворотного зв'язку для оптимізації CUDA-ядра QR-розкладу, досягнувши 232-разового прискорення відносно базового рівня. Підхід демонструє, як інженерія агентних циклів та автоматизований бенчмаркінг дозволяють швидко оптимізувати складний GPU-код.

15 серпня 2026 р.· 4 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 15 серпня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Прискорення GPU-ядра у 232 рази за допомогою Codex у циклі автодослідження

Вплив: Високий

Чому це важливо

Ви можете застосувати інженерію агентних циклів у високопродуктивних обчисленнях, поєднавши Codex або Claude Code із CLI-інструментами автоматичного тестування та бенчмаркінгу.

TL;DR

  • 01Інтеграція Codex із детермінованим циклом зворотного зв'язку дозволяє автоматично оптимізувати продуктивність.
  • 02Базові знання предметної області у промптах допомагають обирати правильні алгоритмічні підходи.
  • 03Ітеративний підхід агентів дозволяє розробникам без глибокого досвіду досягати суттєвого прискорення GPU-ядер.

Ключові факти

232xПрискорення від базового рівня
12 з 183Місце у лідерборді
1500+ за 14 днівВсього відправок агентом
Прискорення від базового рівня
232x
Місце у лідерборді
12 з 183
Всього відправок агентом
1500+ за 14 днів
Розміри матриць
від 512x512 до 4096x4096 FP32

Автоматизований бенчмаркінг для AI-агентів через Popcorn CLI AI-агенти демонструють найкращі результати у разі наявності чіткого авто-тестування. У конкурсі GPU Mode завдання полягало в оптимізації пакетної факторизації FP32 CUDA-матриць A (розмірами від 512x512 до 4096x4096) для повернення компактного QR-представлення, еквівалентного torch.geqrf(A). Організатори надали CLI-інструмент popcorn, який автоматизував перевірку коректності та вимірювання геометричного середнього часу виконання. ### Інженерія циклу (Loop Engineering) та стратегія Стратегія оптимізації поєднувала архітектурний напрямок від людини та швидкі ітерації агента: - Вибір алгоритму: Перехід до блочного алгоритму Хаусхолдера з WY-оновленнями для усунення послідовних залежностей і перетворення операцій на матричне множення (GEMM). - Інтенсивність ітерацій: Codex виконав понад 1500 автоматизованих відправок за 14 днів для оптимізації параметрів ядра. - Спрямування контексту: Надання агенту знань про розкладання матриць, що використовуються в сучасних AI-оптимізаторах (таких як Muon і Shampoo).

Спробуй за 2 хвилини

popcorn submit --kernel qr_v2.cu --benchmark

bash

✓ Коли використовувати

  • Оптимізація обчислювально складних CUDA/Triton ядер із автоматичною перевіркою
  • Налаштування автономних агентних циклів з оцінкою продуктивності через CLI

✕ Коли НЕ варто

  • Розробка бізнес-логіки без автоматизованих циклів вимірювання продуктивності
  • Задачі, де коректність коду неможливо перевірити детермінованими тестами

Що зробити сьогодні

  • →Створіть CLI-інструменти вимірювання продуктивності для надання код-агентам чіткого циклу перевірки.
  • →Задавайте високорівневі алгоритмічні орієнтири у промптах для AI-агентів.

Що каже спільнота

  • “They are easily verifiable and hill-climbable... built tools for the same automatic verifiability that is useful for LLMs.”

    — porridgeraisin на Hacker News

#Codex#CUDA#Triton#PyTorch#Claude

Джерела

  • Auto-research with codex: How I achieved a 232x Faster Kernel
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаInherent Labs презентує 27B агент Faraday для відтворення наукових досліджень

Схожі матеріали

  • Оптимізація токенівТест SemiAnalysis AgentX вимірює реальне споживання токенів та ефективність AI-агентів
  • Оптимізація токенівOpenAI знижує ціни на API та кредити Codex для GPT-5.6 Sol на понад 20%
  • Оптимізація токенівНативний Bedrock Codex без явного керування кешем спричиняє високі витрати на запис
  • Оптимізація токенівHugging Face виявила перенавчання на бенчмарках у провідних мовних AI-моделях

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.