NVIDIA Nemotron 3 Ultra очолює відкриті моделі в агентному кодуванні Register-Transfer Level
NVIDIA представила модель Nemotron 3 Ultra у поєднанні з агентним фреймворком ACE-RTL, досягнувши середнього рівня успішності 97,1% у бенчмарку Comprehensive Verilog Design Problems. Модель 550B на гібридній архітектурі Mamba-Attention Mixture-of-Experts скорочує використання токенів до 71% на ітерацію порівняно з іншими відкритими моделями.
Вплив: Високий
Чому це важливо
Інженери апаратного забезпечення та розробники агентів можуть використовувати Nemotron 3 Ultra для генерації та налагодження коду у великому контексті з суттєво нижчими витратами на інференс.
TL;DR
- 01NVIDIA Nemotron 3 Ultra досягає 97,1% успішності у бенчмарках агентного кодування RTL.
- 02Гібридна архітектура Mamba-Attention MoE скорочує споживання токенів до 71% на крок.
- 03Ітеративні цикли агентів суттєво підвищують якість генерації апаратного коду.
Ключові факти
- Загальна кількість параметрів
- 550 млрд
- Активні параметри
- 55 млрд
- Контекстне вікно
- 1 млн токенів
- Обсяг претрейнінгу
- 20 трлн токенів
- Токенів на ітерацію (середнє)
- 6 629 (за даними розробника)
- Середня успішність CVDP
- 97,1% (за даними розробника)
Агентна розробка RTL з Nemotron 3 Ultra
NVIDIA поєднала модель Nemotron 3 Ultra з агентним фреймворком ACE-RTL для автоматизації складних завдань проектування апаратного забезпечення на Verilog та Register-Transfer Level (RTL). У бенчмарку Comprehensive Verilog Design Problems (CVDP) пайплайн досяг середнього показника успішності 97,1% у дев'яти категоріях завдань, перевершивши GLM 5.2 (92,1%) та Kimi K2.6 (95,2%).
Архітектура та ефективність токенів
Nemotron 3 Ultra використовує архітектуру Mixture-of-Experts (MoE) Mamba-Attention на 550 млрд загальних та 55 млрд активних параметрів. Поєднання шарів Mamba з механізмами уваги зменшує обсяг пам'яті для кешу Key-Value (KV), підтримуючи контекстне вікно у 1 млн токенів.
- Середнє споживання токенів:
6 629 токенівна ітерацію (проти9 156у GLM 5.2 та22 579у Kimi K2.6). - Економія токенів: До 71% менше токенів на ітерацію порівняно з Kimi K2.6 та на 28% менше, ніж у GLM 5.2.
- Успішність у налагодженні (cid016): Досягла 100,0% під час роботи в циклі агента ACE-RTL.
Інтеграція з інструментами EDA
Модель була навчена за допомогою пайплайну генерації синтетичних даних (SDG) на основі публічних репозиторіїв Verilog та специфікацій апаратного забезпечення. Ефективність роботи з довгим контекстом робить її придатною для інтеграції у комерційні САПР (EDA) від Cadence, Siemens та Synopsys.
✓ Коли використовувати
- Створення автономних агентів для проектування апаратного забезпечення та кодування на Verilog
- Запуск ітеративних циклів налагодження коду з довгим контекстом при обмеженнях пам'яті KV-кешу
- Інтеграція генерації коду з комерційними САПР (EDA) для симуляції
✕ Коли НЕ варто
- Стандартна веб-розробка, де краще підходять універсальні LLM
- Автодоповнення коду в реальному часі з низькою затримкою, де потрібні малі щільні моделі
Що зробити сьогодні
- Оцінити гібридні моделі Mamba-Attention MoE для агентних циклів зворотного зв'язку з великим контекстом.
- Протестувати спеціалізовані завдання генерації коду за допомогою ітеративних циклів генерації та тестування.
Джерела