Anthropic Claude Mythos Preview знаходить криптографічні вразливості та запускає CryptanalysisBench
Anthropic продемонструвала, що Claude Mythos Preview здатен автономно знаходити математичні дефекти в базових криптографічних алгоритмах. Модель удвічі зменшила стійкість ключів постквантового кандидата HAWK за 60 годин та прискорила атаки на вкорочений Advanced Encryption Standard до 800 разів. Anthropic також випустила бенчмарк CryptanalysisBench у співпраці з академічними інститутами.
Вплив: Високий
Чому це важливо
Ви можете оцінити міркування AI-агентів у складних математичних і криптографічних завданнях за допомогою CryptanalysisBench або адаптувати багатоагентні середовища Python і Sage для автоматизованого аудиту коду.
TL;DR
- 01Багатоагентні обв'язки, що поєднують LLM з інструментами типу SageMath, здатні здійснювати складний символьний математичний аналіз.
- 02Постквантові криптографічні кандидати, як-от HAWK, потребують більших запасів міцності через автоматизацію криптоаналізу штучним інтелектом.
- 03CryptanalysisBench надає стандартизований бенчмарк для вимірювання можливостей передових моделей у криптографічних завданнях.
Ключові факти
- Час обчислення атаки на HAWK
- 60 годин
- Прискорення атаки на AES
- 200x - 800x
- Вартість API на один результат
- ~$100,000
- Назва бенчмарку
- CryptanalysisBench
Автономний криптоаналіз у багатоагентних середовищах
Anthropic поєднала Claude Mythos Preview із багатоагентною обв'язкою, натхненною Claude Code. Система координувала робочих агентів у пісочниці з доступом до Python, SageMath та криптографічної літератури. Працюючи напівавтономно, модель проводила огляд літератури, виконувала математичні міркування та будувала автоматизовані пайплайни перевірки.
Вплив на HAWK та Advanced Encryption Standard
- Постквантові підписи HAWK: За 60 годин Mythos виявив нетривіальний автоморфізм ґратки, зменшивши ефективну довжину ключа вдвічі, що вимагає подвоєння ключів для збереження захисту.
- Вкорочений AES: Mythos усунув крок угадування в існуючих векторах атак, прискоривши виконання в 200–800 разів.
- Вартість дослідження: Розробка кожного вектора атаки коштувала приблизно $100,000 у витратах на API за однотижневий період тестування.
Реліз бенчмарку
Для оцінки можливостей моделей у математичному та криптоаналітичному міркуванні Anthropic випустила CryptanalysisBench разом із дослідниками з ETH Zurich, Тель-Авівського університету та Університету Хайфи.
Спробуй за 2 хвилини
# Evaluate agent reasoning on CryptanalysisBench
git clone https://github.com/cryptanalysisbench/benchmark.git
cd benchmark && pip install -r requirements.txt
python run_eval.py --model claude-3-5-sonnet-20241022 --tools sage,pythonbash
✓ Коли використовувати
- Оцінка можливостей передових LLM у складній символьній логіці та формальній верифікації.
- Проектування багатоагентних пісочничних обв'язок зі спеціалізованими інструментами Python та Sage.
✕ Коли НЕ варто
- Паніки щодо негайної вразливості продакшен-систем на RSA або повному AES-256.
- Очікування, що звичайні чат-промпти розв'яжуть вищу математику без обв'язки з інструментами.
Що зробити сьогодні
- Перевірте специфікації постквантових схем підпису та розміри ключів у запланованих впровадженнях.
- Ознайомтеся з CryptanalysisBench, якщо розробляєте спеціалізовані математичні або безпекові агентні обв'язки.
Що каже спільнота
“In this case it's not actually that big a result, it's an incremental improvement on a series of previous results... improving the Derbez, Foque, Jean attack from EUROCRYPT 2013.”
“Keep in mind for Anthropic the goal for them isn't necessarily to solve a problem but to demonstrate/measure the innate capabilities of their model.”
Джерела