Генеративният изкуствен интелект се използва за проектиране на менюта в ресторантите, но генерираните изображения на храната могат да изглеждат неестествени за посетителите и да причинят дискомфорт. Относно това пише TechCrunch. Такива илюстрации често се характеризират с прекомерна симетрия, гладкост и идеални форми на продуктите.

Главният технологичен директор на Reality Defender Алекс Лайл обясни, че генераторите на изображения възпроизвеждат установени визуални модели, но не винаги отчитат основните принципи на външния вид на храната. Това може да доведе до неестествено заоблени топки сладолед или скариди с деформирани опашки.

Защо изображенията стават монотонни?

Големите езикови и дифузионни модели, които са в основата на чатботовете и генераторите на изображения като ChatGPT и Midjourney, се обучават върху големи набори от данни и откриват модели. Ако от модела се изисква да създаде меню за ресторант за бързо хранене, той може да се ръководи от стиловете на популярни вериги като Wendy’s, Burger King или McDonald’s.

Менютата и рекламите за храна вече използват подобна естетика, правейки ястията да изглеждат възможно най-привлекателни. Лайл отбелязва, че чрез данни от обучението много от тези резултати наподобяват менютата на Chili’s от 2015 г. Според Елон Лий Рейни, директор на центъра Imagining the Digital Future, оптимизирането на моделите за „приятен“ и ненатрапчив резултат може да допринесе за визуална еднородност.

Последици от многократните редакции

Потребител на X, който е известен с псевдонима Labtec, показа експеримент, в който меню, създадено в ChatGPT, е редактирано 100 пъти. След многобройни редакции, изображенията на храната изглеждат все по-малко като действителните ястия; TechCrunch съобщава, че експериментът е повторен и са получени подобни резултати.

Лайл нарече това влошаване чрез конвергенция: то намалява качеството на резултатите, но не е същото като колапс на модела. Колапс може да възникне, когато моделите се обучават върху твърде много от собственото им генерирано съдържание. В меню, повтарящите се промени в малки детайли, като цени или имена на артикули, могат постепенно да направят илюстрациите по-гладки и заоблени.

Изследователи от университета Дуйсбург-Есен в Германия откриха ефект на „зловеща долина“ при генерираните от изкуствен интелект изображения на храна: изображения, които изглеждат почти реални, са по-склонни да предизвикат отвращение и тревожност, отколкото тези, които са очевидно изкуствени. Рейн също така отбелязва, че хората често интуитивно забелязват разликата между реалното изображение и това, генерирано от изкуствен интелект, дори и да не могат ясно да я обяснят.

Припомнете си, че OpenAI представи ChatGPT Images 2.0, който представлява революция в генерацията на текст върху изображения. Според описанието, това е модел, който за първи път сред масовите изкуствени интелекти правилно изобразява текстовете в изображенията.