Почему еда, нарисованная нейросетью, выглядит несъедобно

· Искусственный интеллект
Рестораны и бренды всё чаще рекламируют блюда картинками из нейросетей — и получают червеобразную лапшу, мороженое из бетона и бургеры, собранные будто из камней. The Verge разобрался, почему так выходит.

cover.svg

Кафе, рестораны и торговые марки всё активнее заказывают рекламные изображения еды у генеративных нейросетей — и мир захлёстывает поток аппетитного на вид мусора. В подборке The Verge — креветки, похожие на пончики, сэндвич-рубены будто из морских глубин, лапша-черви, тестяные завитки-макароны и волокнистая курица. Есть и мороженое, напоминающее растрескавшийся бетон, и бургеры, словно вылепленные из камня. И повсюду — комки, отверстия, бесконечные отверстия.

Где ломается генерация

Большинство ведущих генераторов работают через диффузию: модель стартует с экрана чистого шума и постепенно его убирает, восстанавливая картинку. Как объяснил профессор Оксфорда Крис Расселл, сначала проступают грубые структуры, а тонкие детали текстуры добавляются в самом конце. Если базовая форма объекта оказалась неверной уже на ранней стадии, поверх неё наслаиваются яркие детали — тот же сбой, что порождает человека с шестью пальцами.

Отдельная беда — тонкие, вытянутые, где-то обрывающиеся структуры. По словам поведенческого учёного Джованбаттисты Калифано из Неаполя, лапша, нити и усики — именно та геометрия, на которой диффузионные модели спотыкаются: начав рисовать нечто подобное, сеть не понимает, где остановиться и к чему это крепить. Так же плохо она удерживает в границах повторяющиеся текстуры вроде пузырьков и семян — отсюда навязчивая «лапшистость» и скопления дырок, способные вызвать трипофобию.

Машина не знает, что такое сэндвич

Главная причина глубже: нейросеть не понимает, что рисует. Она статистически усвоила, как обычно выглядят бутерброд, лапша или буррито, но не почему они так выглядят и как ведут себя в реальном мире. Профессор из Цюриха Роланд Майер отмечает, что генерация «воспроизводит вид без знания о мире» и идеально имитирует внешность фотографии, но не профессиональные приёмы фотографа — именно это и тревожит.

Обучающие данные усугубляют картину. Фуд-фотография стилизована: резкие контрасты, глянцевый свет, преувеличенные формы, а иногда снимают вовсе не еду. К тому же, замечает Саймон Колтон из Лондона, скучное красное яблоко в сеть никто не выкладывает, зато странные, мемные изображения расходятся широко. А обучение моделей на выходных данных других моделей ведёт к «коллапсу» — визуальной деградации и нарастающему однообразию.

Почему нас передёргивает

Финальный штрих — человеческое восприятие. Учёные считают, что отвращение развилось как защита от паразитов, патогенов и токсинов, поэтому к неправильной еде мы особенно чувствительны. Червеобразные усики напоминают паразитов, скопления дырок — заражение, неестественные цвета — порчу. ИИ-еда бьёт по этим триггерам разом: она похожа на еду, но мозг знает лучше — и мы инстинктивно отшатываемся.


Источник: The Verge

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.