当你第一次遇到这种情况时,可能会觉得自己疯了。你走进一家咖啡馆,看到菜单上有各种百吉饼三明治,但每张插图看起来异常完美,精确对称且异常光滑,让人直觉感到哪里不对劲。你可能会怀疑自己多疑,但其实你并没有失去理智。生成式AI菜单已经进入餐饮业,这些模型基于狭窄且“讨喜”的审美训练,即使你无法明确说出原因,也会让人感觉怪异。
有时,这些插图假得离谱,比如一份奶酪融化得泡泡状的卷饼,看起来更像先锋艺术而非午餐。更多时候,它们看起来非常普通,只有当你仔细观察时,才会察觉哪里不对劲。
“这几乎就像一个外星人在尝试做披萨,却不理解其核心原理,”Reality Defender的首席技术官Alex Lisle告诉TechCrunch。(Reality Defender是一家专注于AI检测和内容验证工具的初创公司,这类业务的存在部分原因就是因为类似的问题。)
Lisle指出,这些模型的构建方式可以解释为何插图呈现出如此特定的审美——每个冰淇淋球都完美圆润,虾看起来像是经过基因改造,竟然在吃自己的尾巴,形成了新的“洛夫克拉夫特式食物恐怖”。
大型语言模型(LLM)和扩散模型——正是这些AI模型让ChatGPT和Midjourney等看似无所不知的聊天机器人和图像生成器成为可能——它们通过海量数据进行训练,识别数据集中的模式,从而预测用户的需求,比如“帮我做一个汉堡店的菜单”。
“很多生成的内容看起来就像2015年Chili’s餐厅的菜单,这是有原因的,”Lisle说,“那正是这些模型所依赖的训练语料库。”

新的训练数据对AI模型开发公司至关重要——亚马逊甚至被发现会扫描珍稀书籍并将其纳入训练数据,随后销毁这些书籍。不可避免地,一些AI生成的内容会渗入这些庞大的数据集中。但当AI模型过度依赖自身生成的内容时,就会面临“模型崩溃”的风险。
“模型崩溃几乎像疯牛病……当你把一个模型的输出再次输入给它自己时,最终会因近亲繁殖过度而导致整个模型崩溃,”Lisle解释道,“我们现在看到的是趋同现象,这不一定是模型崩溃。”
趋同稍微温和一些,会降低AI输出的质量,但不会让模型完全失效。

如果有人让AI生成一个快餐店的菜单,模型很可能会参考Wendy’s、Burger King、McDonald’s或其他知名连锁店的菜单。这些菜单本身就风格相似,因此AI生成的结果也会模仿这种风格,如果这些AI生成的菜单再次进入训练数据,便会进一步强化这种风格。
不过,菜单和食品广告的图片总是比真实食物看起来更诱人,就像麦当劳广告中的巨无霸,每一层都由道具设计师精心摆放以达到最佳视觉效果。这种效果在AI生成的图像中可能更加明显。
“数据集的优化目标是讨喜,或者说不冒犯人,因此这就导致了同质化,”埃隆大学数字未来中心主任Lee Rainie告诉TechCrunch,“AI在图像和语言方面的表现就是去除棱角。”
在更局部的层面上,当你用AI图像生成器制作菜单并多次编辑时,这种图像的平滑化现象尤为明显。在X平台上,一位用户Labtec展示了用ChatGPT制作菜单后反复编辑100次,食物图像变得越来越不像真实的过程。(我们复现了这个实验,结果相似。)
“最终结果让我感到不舒服,”Labtec写道。
餐厅很可能正遭遇这一问题,不断修改AI生成的菜单,调整价格或菜品名称。每次编辑后,食物图像似乎都变得更加圆润和平滑。
“人们对AI生成内容和真实内容有一种难以言喻的敏感度,”Rainie说,“这种感觉很难用语言表达,但人们一眼就能分辨出来,这也是为什么早期关于餐厅使用AI菜单的反弹如此强烈的原因之一。”
我们对这些AI菜单产生反感是有科学依据的。德国杜伊斯堡-埃森大学的研究人员发现,AI生成的食物图像存在“恐怖谷”效应——那些看起来几乎真实的食物图像比明显假冒的图像更容易引发厌恶和不适。这种不适感在AI的文化背景下更为强烈。
如果人们对这些图像反应如此负面,那么餐厅停止尝试使用AI菜单或许是明智之举。但导致我们看到完美烤制汉堡胚的问题,远不止餐桌上的视觉体验。
“眼见为实、耳闻为真一直是我们的信条,甚至我们的法庭系统也完全依赖录音供词和录像证据作为黄金标准,”Lisle说,“但现在情况已经改变,无论好坏,世界已经发生了根本性转变。”


