GPT-5.6 Sol: OpenAI наконец подтянула компьютерное зрение

· Искусственный интеллект
Команда Roboflow прогнала новую линейку моделей OpenAI через собственный бенчмарк для визуальных задач. Модель Sol стала лучшей по «зрению» за всю историю компании, хотя до лидеров рынка ещё не дотягивает.

cover.svg

На прошлой неделе OpenAI представила линейку GPT-5.6 с моделями Sol, Terra и Luna, сделав акцент на «компьютерном использовании» — навигации агентов по десктопным приложениям и работе с 3D-визуализациями. Всё это опирается на качество визуального восприятия, поэтому команда Roboflow прогнала новинки через свой готовящийся к выходу бенчмарк для мультимодальных моделей. Он охватывает детекцию объектов, подсчёт, OCR и извлечение данных.

Детекция и подсчёт

Самый заметный скачок — в обнаружении объектов. Прежняя GPT-5.5 набирала лишь 13,8 mAP@50, тогда как Sol дошла до 46,2; Terra и Luna идут рядом (44,7 и 43,3). Из откровенно слабого места детекция превратилась в практически применимую функцию. Sol уверенно разбирает структуру документов — заголовки, абзацы, таблицы, изображения и подписи — и неплохо справляется с плотными сценами вроде россыпи таблеток или яиц, где однотипные объекты легко пропустить или посчитать дважды.

Есть и курьёзы: на изображениях примерно от 2000×2000 пикселей Sol иногда расставляет рамки в случайных местах, выстраивая их ровными рядами, никак не связанными с реальными объектами. В OpenAI подтвердили, что при низком «уровне рассуждений» модель на крупных картинках теряет стабильность; помогает либо повышение reasoning effort (ценой токенов и задержек), либо предварительное уменьшение изображения.

Подсчёт объектов вырос по всей линейке: Sol дала 73,0% против 64,9% у GPT-5.5. Даже самая дешёвая Luna обошла прежний уровень OpenAI. Sol смогла пересчитать перекрывающиеся металлические скобы и учитывала пробоины только в заданных зонах мишени, демонстрируя понимание не только «что считать», но и «где».

OCR и цена вопроса

А вот распознавание текста осталось на прежнем уровне — 90,7% против 91,2% у GPT-5.5, а в точечном извлечении данных Sol даже уступила предшественнице. Модель хорошо читает рукописные заметки и надписи на изогнутой поверхности грязной шины, но спотыкается на мелком вертикальном тексте с бликами — например, на дате годности с блистера.

Прогресс дался ценой ресурсов. Sol тратит около 10 секунд на изображение и примерно 2,5 цента — это вторая по дороговизне модель после Claude Fable 5. Terra и Luna быстрее и дешевле. При этом Gemini 3.5 Flash обходится в 0,8 цента и, по данным авторов, по-прежнему лидирует в детекции и подсчёте, оставаясь выгоднее для массовых задач.

Общий вывод: OpenAI всерьёз занялась зрением и заметно приблизилась к лидерам, но до безоговорочного первенства ещё далеко.


Источник: Hacker News

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.