Бенчмарк комп'ютерного зору OpenAI GPT-5.6 Sol: підказки та баланс швидкості й вартості
Команда Roboflow протестувала нову модель OpenAI GPT-5.6 Sol, зафіксувавши значний стрибок у виявленні об'єктів та аналізі макетів документів. Проте для стабільності потрібні абсолютні coordinates XYXY та зменшення роздільної здатності зображень понад 2000x2000 пікселів.

Вплив: Середній
Чому це важливо
Ви можете негайно оптимізувати свої пайплайни комп'ютерного зору, запитуючи абсолютні піксельні координати XYXY та зменшуючи великі зображення перед викликом API.
TL;DR
- 01Вказуйте у промптах для GPT-5.6 вихідні дані в абсолютних піксельних координатах XYXY.
- 02Масштабуйте або обрізайте зображення розміром понад 2000x2000 пікселів перед надсиланням в API.
- 03Обирайте GPT-5.6 Luna або Gemini 3.5 Flash для масової детекції з метою економії бюджету.
Ключові факти
- Точність детекції Sol mAP@50
- 46.2 (проти 13.8 у GPT-5.5)
- Точність підрахунку Sol
- 73.0%
- Середня затримка на зображення
- 10 с (Sol), 6 с (Terra), 5 с (Luna)
- Оціночна вартість зображення
- $0.025 (Sol), $0.01 (Terra), <$0.005 (Luna)
Точність комп'ютерного зору та результати бенчмарку
Тестування Roboflow показало суттєве покращення мультимодальних можливостей GPT-5.6 Sol порівняно з GPT-5.5:
- Детекція об'єктів: Sol досягла 46.2 mAP@50 проти 13.8 у GPT-5.5. Моделі Terra (44.7) та Luna (43.3) продемонстрували близькі результати.
- Точність підрахунку: Sol досягла 73.0%, успішно рахуючи об'єкти на щільних зображеннях та в обмежених зонах.
- OCR та екстракція: Sol набрала 90.7% подібності при суцільному розпізнаванні тексту, хоча цільове витягування даних знизилося до 82.5%.
Практичні нюанси: координати та роздільна здатність
Для досягнення максимальної точності промпти слід адаптувати під архітектуру OpenAI:
1. Абсолютні координати XYXY: Sol вимагає виводу обмежувальних рамок у піксельних координатах XYXY. Використання нормалізованих координат зменшує точність детекції на 15 пунктів mAP. 2. Масштабування зображень: Зображення понад 2000 x 2000 пікселів викликають галюцинації сітки при низьких налаштуваннях reasoning effort. Попереднє зменшення або обрізання кадрів перед відправкою в API усуває цей збій. 3. Вартість і затримка: Sol виконує запит за 10 секунд за ціною $0.025 за кадр. Terra працює за 6 секунд ($0.01), а Luna — за 5 секунд (<$0.005).
Спробуй за 2 хвилини
{
"model": "gpt-5.6-sol",
"reasoning_effort": "high",
"messages": [
{
"role": "user",
"content": "Detect all items. Return bounding boxes strictly in absolute XYXY image pixel coordinates."
}
]
}json
✓ Коли використовувати
- Аналіз складних структур документів, включаючи заголовки, таблиці та підписи.
- Розпізнавання тексту зі складних реальних сцен (вивіски, трансляції, етикетки).
✕ Коли НЕ варто
- Пакетна обробка великих обсягів даних, де вартість має бути нижчою за $0.01 за кадр.
- Передача незменшених зображень понад 2000x2000 без встановлення високого рівня reasoning effort.
Що зробити сьогодні
- Оновіть системні промпти для візуальних агентів на GPT-5.6, вказавши вимогу щодо абсолютних координат XYXY.
- Додайте етап попередньої обробки для зменшення роздільної здатності зображень понад 2000x2000 пікселів.
Що каже спільнота
“I would love more vision benchmarks! Once I asked the model to inspect a completely black picture and it hallucinated a nice wooden kitchen wall.”
“Ironically, the pill counting example selected to showcase 'the best vision model' can be easily solved with OpenCV template matching, a technology created 25 years ago.”
Джерела