Нативний Bedrock Codex без явного керування кешем спричиняє високі витрати на запис
Розробники, які використовують нативний OpenAI Codex CLI через Amazon Bedrock Mantle для GPT-5.6 Sol, повідомляють про високі витрати через відсутність явних елементів керування кешем промптів. Телеметрія показує, що запис у кеш становить майже 85% усіх витрат.

Вплив: Високий
Чому це важливо
Перевірте телеметрію AWS Bedrock CloudWatch, щоб переконатися, що сесії кодингу не перезаписують весь контекст промпта на кожному кроці.
TL;DR
- 01Нативний Bedrock Codex наразі не має явного керування кешем промптів для GPT-5.6 Sol.
- 02Запис у кеш може становити до 85% усіх витрат на LLM API в агентурних сесіях.
- 03Відстежуйте телеметрію на наявність нульових cached_input_tokens, щоб виявити зациклення перезапису.
Ключові факти
- Частка витрат на запис кешу
- ~85% від витрат на модель
- Токени у тестовій сесії
- 6.709M токенів запису / 0 кешованих
- Середні витрати на запис
- ~88K токенів на запит
Проблема явного кешування промптів на AWS Bedrock
Під час виконання агентурних сценаріїв з використанням нативного Codex CLI через провайдер aws-bedrock запити до API Bedrock Mantle не можуть увімкнути режим явного кешування для gpt-5.6-sol. У результаті довгі системні інструкції та описи інструментів постійно перезаписуються в кеш замість повторного використання.
Телеметрія використання та вплив на вартість
- Дані за період з 5 по 8 серпня показують, що запис у кеш склав 85% від оцінених витрат.
- Тестова сесія зафіксувала 76 запитів до Sol, які витратили 6.709M токенів запису в кеш і 0 кешованих токенів.
- Середній накладний обсяг запису в кеш склав приблизно 88K токенів на запит.
Необхідні зміни в конфігурації
Оскільки налаштування провайдера Bedrock у config.toml підтримують лише транспорт і авторизацію, розробники не можуть вручну змінити тіло запиту. Вирішення потребує додавання серіалізації prompt_cache_options та полів prompt_cache_breakpoint у Codex.
Спробуй за 2 хвилини
# Current config.toml lacks explicit request body prompt_cache_options
[model_providers.aws-bedrock]
region = "us-east-1"
model = "gpt-5.6-sol"toml
✓ Коли використовувати
- Під час проведення тривалих агентурних сесій кодингу через Codex CLI на інфраструктурі AWS Bedrock.
- Під час аудиту раптових стрибків рахунків за AWS Bedrock LLM.
✕ Коли НЕ варто
- Під час запуску Codex через прямі API OpenAI, де кешування спрацьовує автоматично.
- Дл коротких одноразових запитів без великих системних промптів.
Що зробити сьогодні
- Перевірте метрики CloudWatch на наявність високих cache_write_input_tokens та нульових cached_input_tokens.
- Стежте за оновленнями у тикеті #37674 у репозиторії OpenAI Codex щодо впровадження explicit prompt_cache_options.
Що каже спільнота
“"causing" -> "costing", right?”
“I feel like this is the kind of substantial change to your product that you would need to tell your customers about. It would be simply disrespectful to your customers to not disclose this upfront.”
Джерела