Использование изображений, созданных искусственным интеллектом, в рекламе еды ресторанами, кафе и брендами приводит к отталкивающим результатам: креветкам в форме пончиков, напоминающей червей лапше, похожей на нити курице, бургерам, напоминающим камни, и буррито, покрытым отверстиями. Искажения на этих изображениях выявляют технические ограничения систем искусственного интеллекта при создании визуального контента и проблемы в обучающих данных.
Большинство ведущих генераторов изображений используют диффузионные модели. Эти системы начинают с чистого шума и создают изображение, постепенно уменьшая уровень шума: сначала формируется грубая структура, затем добавляются мелкие детали. По словам Chris Russell из University of Oxford, если на раннем этапе модель неправильно формирует базовую форму объекта, впоследствии она может добавить детали живой ткани поверх ошибочной структуры. Это можно сравнить с изображением человека с шестью пальцами.
Giovanbattista Califano из University of Naples Federico II отмечает, что диффузионные модели плохо справляются с созданием тонких, непрерывных структур, которые заканчиваются в одной точке. Поэтому лапша, волокна и извилистые отростки могут перемещаться в неправильные места; повторяющиеся текстуры, такие как пузырьки и семена, также могут выходить за пределы логичных границ. Чрезмерно похожие на лапшу формы и скопления отверстий на изображениях могут вызывать страх отверстий, известный как трипофобия.
По мнению экспертов, искусственный интеллект на самом деле не знает, что такое сэндвич, лапша или буррито. Он лишь статистически изучает, как эти объекты обычно выглядят в интернете, но не понимает их функций и поведения в физическом мире. Roland Meyer из University of Zurich говорит, что системы имитируют внешний вид фотографии, но не понимают контекст, лежащий в основе эстетики профессиональной фотографии. Поэтому мороженое может выглядеть как бетон, а бургер — как камень.
Данные для обучения также могут усугублять проблему. Яркий свет, насыщенные цвета и преувеличенные формы на фотографиях еды иногда передаются модели вместе с нереалистично выглядящими продуктами. Simon Colton из Queen Mary University of London отмечает, что странный и вирусный контент привлекает в интернете больше внимания, чем обычные изображения. Кроме того, обучение новых моделей на контенте, созданном искусственным интеллектом, может приводить к визуальным искажениям и сходству изображений в результате «model collapse».
Неоднозначные команды, увеличение изображений с низким разрешением и недостаточные системные инструкции делают ошибки более заметными. Люди же быстро замечают аномалии в еде из-за чувства отвращения, которое сформировалось как защитная реакция на угрозы, связанные с паразитами, заражением и порчей продуктов. Поэтому еда, созданная искусственным интеллектом, выглядит не только нереалистично, но и интуитивно неправильно.
Почему это важно
Эта проблема показывает, что созданная с помощью искусственного интеллекта реклама еды — это не просто вопрос эстетического выбора: искажения форм на изображении могут напрямую влиять на то, сочтёт ли зритель продукт аппетитным и заслуживающим доверия. Для ресторанов, кафе и брендов это означает необходимость проверять результаты работы модели человеком, поскольку она объединяет лишь похожие изображения, не понимая физического строения объекта. В особенности такие детали, как лапша, волокна, пузырьки и отверстия, не только делают технические ошибки заметными, но и могут вызывать у некоторых зрителей реакцию отвращения. Повторное попадание странных изображений и изображений, созданных искусственным интеллектом, в обучающие данные оставляет открытым вопрос о том, будут ли искажения воспроизводиться вновь.