Перейти до вмісту
ГоловнаНовиниКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Моделі й дослідження/
  4. Бенчмарк комп'ютерного зору OpenAI GPT-5.6 Sol: підказки та баланс швидкості й вартості
Моделі й дослідження

Бенчмарк комп'ютерного зору OpenAI GPT-5.6 Sol: підказки та баланс швидкості й вартості

Команда Roboflow протестувала нову модель OpenAI GPT-5.6 Sol, зафіксувавши значний стрибок у виявленні об'єктів та аналізі макетів документів. Проте для стабільності потрібні абсолютні coordinates XYXY та зменшення роздільної здатності зображень понад 2000x2000 пікселів.

17 серпня 2026 р.· 5 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 17 серпня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Бенчмарк комп'ютерного зору OpenAI GPT-5.6 Sol: підказки та баланс швидкості й вартості

Вплив: Середній

Чому це важливо

Ви можете негайно оптимізувати свої пайплайни комп'ютерного зору, запитуючи абсолютні піксельні координати XYXY та зменшуючи великі зображення перед викликом API.

TL;DR

  • 01Вказуйте у промптах для GPT-5.6 вихідні дані в абсолютних піксельних координатах XYXY.
  • 02Масштабуйте або обрізайте зображення розміром понад 2000x2000 пікселів перед надсиланням в API.
  • 03Обирайте GPT-5.6 Luna або Gemini 3.5 Flash для масової детекції з метою економії бюджету.

Ключові факти

Точність детекції Sol mAP@50
46.2 (проти 13.8 у GPT-5.5)
Точність підрахунку Sol
73.0%
Середня затримка на зображення
10 с (Sol), 6 с (Terra), 5 с (Luna)
Оціночна вартість зображення
$0.025 (Sol), $0.01 (Terra), <$0.005 (Luna)

Точність комп'ютерного зору та результати бенчмарку

Тестування Roboflow показало суттєве покращення мультимодальних можливостей GPT-5.6 Sol порівняно з GPT-5.5:

  • Детекція об'єктів: Sol досягла 46.2 mAP@50 проти 13.8 у GPT-5.5. Моделі Terra (44.7) та Luna (43.3) продемонстрували близькі результати.
  • Точність підрахунку: Sol досягла 73.0%, успішно рахуючи об'єкти на щільних зображеннях та в обмежених зонах.
  • OCR та екстракція: Sol набрала 90.7% подібності при суцільному розпізнаванні тексту, хоча цільове витягування даних знизилося до 82.5%.

Практичні нюанси: координати та роздільна здатність

Для досягнення максимальної точності промпти слід адаптувати під архітектуру OpenAI:

1. Абсолютні координати XYXY: Sol вимагає виводу обмежувальних рамок у піксельних координатах XYXY. Використання нормалізованих координат зменшує точність детекції на 15 пунктів mAP. 2. Масштабування зображень: Зображення понад 2000 x 2000 пікселів викликають галюцинації сітки при низьких налаштуваннях reasoning effort. Попереднє зменшення або обрізання кадрів перед відправкою в API усуває цей збій. 3. Вартість і затримка: Sol виконує запит за 10 секунд за ціною $0.025 за кадр. Terra працює за 6 секунд ($0.01), а Luna — за 5 секунд (<$0.005).

Спробуй за 2 хвилини

{
  "model": "gpt-5.6-sol",
  "reasoning_effort": "high",
  "messages": [
    {
      "role": "user",
      "content": "Detect all items. Return bounding boxes strictly in absolute XYXY image pixel coordinates."
    }
  ]
}

json

✓ Коли використовувати

  • Аналіз складних структур документів, включаючи заголовки, таблиці та підписи.
  • Розпізнавання тексту зі складних реальних сцен (вивіски, трансляції, етикетки).

✕ Коли НЕ варто

  • Пакетна обробка великих обсягів даних, де вартість має бути нижчою за $0.01 за кадр.
  • Передача незменшених зображень понад 2000x2000 без встановлення високого рівня reasoning effort.

Що зробити сьогодні

  • →Оновіть системні промпти для візуальних агентів на GPT-5.6, вказавши вимогу щодо абсолютних координат XYXY.
  • →Додайте етап попередньої обробки для зменшення роздільної здатності зображень понад 2000x2000 пікселів.

Що каже спільнота

  • “I would love more vision benchmarks! Once I asked the model to inspect a completely black picture and it hallucinated a nice wooden kitchen wall.”

    — prathje на Hacker News

  • “Ironically, the pill counting example selected to showcase 'the best vision model' can be easily solved with OpenCV template matching, a technology created 25 years ago.”

    — mv4 на Hacker News

#OpenAI#GPT-5.6 Sol#Gemini 3.5 Flash#Claude Fable 5

Джерела

  • GPT 5.6 Sol is the best vision model OpenAI ever released - Roboflow Blog
  • Vision Leaderboard Pareto Arena
  • Hacker News Discussion on GPT 5.6 Sol
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаAmp запускає Orbs для автономного виконання ШІ-агентів у хмаріНаступна новина →Alibaba випускає мультимодальну модель Qwen3.8-27B під ліцензією Apache 2.0

Схожі матеріали

  • Моделі й дослідженняЗастарілі моделі Claude уразливі до багатокрокових промпт-ін'єкцій на сторонніх API
  • Моделі й дослідженняТаємнича модель Ox Alpha з'явилася на OpenRouter, випереджаючи Fable 5 та GPT-5.6 Sol
  • Моделі й дослідженняВідкрита модель Ornith-1.5 на 397B MoE випущена під ліцензією MIT
  • Моделі й дослідженняCanonical підтримує нейросимвольне ШІ-дослідження для автоматизації перекладу C на Rust

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.