GPT-5.6 Sol: OpenAI наконец подтянула компьютерное зрение
На прошлой неделе OpenAI представила линейку GPT-5.6 с моделями Sol, Terra и Luna, сделав акцент на «компьютерном использовании» — навигации агентов по десктопным приложениям и работе с 3D-визуализациями. Всё это опирается на качество визуального восприятия, поэтому команда Roboflow прогнала новинки через свой готовящийся к выходу бенчмарк для мультимодальных моделей. Он охватывает детекцию объектов, подсчёт, OCR и извлечение данных.
Детекция и подсчёт
Самый заметный скачок — в обнаружении объектов. Прежняя GPT-5.5 набирала лишь 13,8 mAP@50, тогда как Sol дошла до 46,2; Terra и Luna идут рядом (44,7 и 43,3). Из откровенно слабого места детекция превратилась в практически применимую функцию. Sol уверенно разбирает структуру документов — заголовки, абзацы, таблицы, изображения и подписи — и неплохо справляется с плотными сценами вроде россыпи таблеток или яиц, где однотипные объекты легко пропустить или посчитать дважды.
Есть и курьёзы: на изображениях примерно от 2000×2000 пикселей Sol иногда расставляет рамки в случайных местах, выстраивая их ровными рядами, никак не связанными с реальными объектами. В OpenAI подтвердили, что при низком «уровне рассуждений» модель на крупных картинках теряет стабильность; помогает либо повышение reasoning effort (ценой токенов и задержек), либо предварительное уменьшение изображения.
Подсчёт объектов вырос по всей линейке: Sol дала 73,0% против 64,9% у GPT-5.5. Даже самая дешёвая Luna обошла прежний уровень OpenAI. Sol смогла пересчитать перекрывающиеся металлические скобы и учитывала пробоины только в заданных зонах мишени, демонстрируя понимание не только «что считать», но и «где».
OCR и цена вопроса
А вот распознавание текста осталось на прежнем уровне — 90,7% против 91,2% у GPT-5.5, а в точечном извлечении данных Sol даже уступила предшественнице. Модель хорошо читает рукописные заметки и надписи на изогнутой поверхности грязной шины, но спотыкается на мелком вертикальном тексте с бликами — например, на дате годности с блистера.
Прогресс дался ценой ресурсов. Sol тратит около 10 секунд на изображение и примерно 2,5 цента — это вторая по дороговизне модель после Claude Fable 5. Terra и Luna быстрее и дешевле. При этом Gemini 3.5 Flash обходится в 0,8 цента и, по данным авторов, по-прежнему лидирует в детекции и подсчёте, оставаясь выгоднее для массовых задач.
Общий вывод: OpenAI всерьёз занялась зрением и заметно приблизилась к лидерам, но до безоговорочного первенства ещё далеко.
Источник: Hacker News
Комментарии
Войдите, чтобы комментировать.