Skip to content

Your AI Slop Bores Me vs ChatGPT:为什么人类的回答更胜一筹

当人类假装成AI会怎样?比任何语言模型都更有趣、更古怪、更真诚的回答。

12 min read

设定是这样的:在 Your AI Slop Bores Me 中,一个人收到一个提示,然后必须回答它。其他玩家要猜这个回答是来自人类还是AI。关键是人类在试图听起来像AI,这就制造了一种美妙的混乱,人们以最有趣的方式不经意地暴露了自己的人性。

我想做个实验。拿几个提示,展示 ChatGPT 实际会生成什么,然后展示真人在慌张中试图听起来像机器人时给出的那种回答。差别……很有启发性。

提示1:"给一台烤面包机写一份约会档案"

ChatGPT 的回答:

"嘿!我是一台时尚的不锈钢烤面包机,正在寻找我的完美面包片。我喜欢温暖的早晨、金黄色的肤色和把气氛升温。我有两个槽位,所以总有更多的空间。如果你喜欢热辣的,就右滑吧!提醒:我有时候会有点焦,但我总是带来温暖。"

中规中矩。可以预见。你能想到的每一个双关都在里面了。"把气氛升温"——好吧。"如果你喜欢热辣的就右滑"——行吧。读起来像一张委员会写的贺卡。没什么问题。也没什么惊喜。

游戏中人类的回答:

"单身。两个槽位,哪个都不打算认真。如果你让我一个人待太久我会把你的面包烤焦,但说实话那是你的问题。我的前任是个贝果,结局很不好——卡住了,事情变得很难看,有人把我的插头拔了。我现在在做心理治疗(微波炉后面那个插座)。找一个不介意面包屑的人。"

看到区别了吗?人类的回答有一个故事背景。有一段跟贝果的糟糕分手。有心理治疗。有一个具体的细节——"微波炉后面那个插座"——没有任何语言模型会生成这个,因为它的那种古怪的具体只有当你真的看过厨房电器后面那团乱线的时候才说得出来。

人类还以一种 ChatGPT 不会的方式全力投入。ChatGPT 保持轻松和双关。人类走向了一个更阴暗、更真诚的地方——而且正因为如此更好笑。

提示2:"向一个5岁的孩子解释量子物理"

ChatGPT 的回答:

"想象你有一个魔法球。当你不看它的时候,它可以是任何颜色——红色、蓝色、绿色,同时是所有颜色!但当你看它的那一刻,它就只选择一种颜色。宇宙中非常非常小的东西差不多就是这样运作的。它们可以同时处于多种状态,但当我们测量它们时,它们就'选择'了一种。挺酷的,对吧?"

这还行。这是你在 Google 第一页就能找到的解释。它用了"想象"这个词。它以"挺酷的,对吧?"结尾,这是 ChatGPT 版本的话筒落地。它足够准确。但这也是每个AI对这个问题给出的完全相同的解释,因为它们都是在同样的简化类比上训练出来的。

游戏中人类的回答:

"好吧,你知道妈妈问你晚饭想吃什么,你说'鸡块和披萨都要'然后她说你必须选一个的时候吗?量子物理就是如果你在她真正把盘子端上来之前都不用选会怎样。在盘子出现之前,它既是鸡块又是披萨。Schrodinger 有一只猫但说实话晚餐这个比喻更容易懂。我也不完全理解,孩子。没人完全理解。物理学家也在猜。"

人类的回答更凌乱。它引用了一个任何家长都真正经历过的现实场景。它拼错了 Schrodinger(没有变音符,算了)。它承认无知——"我也不完全理解"——这种真诚是 ChatGPT 绝不允许自己表现出来的。而最后那句——"物理学家也在猜"——既好笑,又可以说比 ChatGPT 那个整洁的小类比更准确。

提示3:"人生的意义是什么?"

ChatGPT 的回答:

"人生的意义是一个非常个人化的问题,历史上哲学家、神学家和思想家们一直在探索。有些人通过关系和爱找到意义,有些人通过创造性追求或帮助他人。存在主义者如 Sartre 认为生命没有固有的意义,要靠我们每个人自己去创造。最终,人生的意义可能就是任何带给你满足感、连接感和目标感的东西。"

这是 ChatGPT 历史上最 ChatGPT 的回答。它模棱两可。它列出各种观点但不承诺任何一个。它为了可信度提了一下 Sartre。它以一个温暖的、模糊的陈述结尾,这个陈述适用于任何事物。你可以把"人生的意义"替换成"你最喜欢的披萨配料",结构照样成立:"最终,你最喜欢的披萨配料可能就是任何带给你满足感的东西。"

游戏中人类的回答:

"42,显然。但说真的?我觉得是那些小事。昨天我的狗把头枕在我脚上睡着了,我一个小时没动,因为不想吵醒它。我的腿完全麻了。毫不后悔。如果这不是人生的意义,我不知道什么是了。其他所有东西——事业、金钱、遗产——人们之所以编造出那些,是因为陪一只睡着的狗坐着感觉太简单了,不像是答案。"

《银河系搭车指南》的引用是一个非常人类的操作。不是因为AI不会引用它(如果被提示,它会),而是因为人类随口一提就过去了,就像你跟一个显然懂这个梗的朋友聊天那样。然后是一个具体的个人轶事——那只狗、麻了的腿、拒绝移动。这个细节要么是真实的,要么是当场令人信服地编造的,无论哪种都比对哲学立场的综述更有说服力。

结尾的观点——事业和遗产是人们"编造出来的"——是一个真正的立场。它是可以争论的。有些人会不同意。ChatGPT 永远不会这么说,因为 ChatGPT 不会采取可能疏远部分受众的立场。

为什么人类的回答更胜一筹

在观看了数十轮游戏之后,模式已经非常明显。人类的回答之所以胜出,是因为:

人类有真正的观点。 他们会说某个东西很蠢。他们会选边站。他们会提出一个自己都不能完全为之辩护的主张。ChatGPT 把每个问题都当作一份需要承认所有利益相关方的联合国决议来对待。

人类会犯真正的错误。 拼写错误、半成品的想法、没有完全落地的离题。这些不是缺陷——它们是一个真实大脑在实时运转的信号。AI泔水的光滑反而让它显得不太可信,就像一个牙齿太白的二手车销售员。

人类会变得古怪。 做心理治疗的烤面包机。睡着的狗。前任贝果。这些细节来自某个真实的地方——来自真正的厨房、真正的下午和真正凌乱的人类生活。AI只能重新混合它见过的东西。人类能产生真正全新的荒谬,因为他们是从生活经验中提取的,而不是训练数据。

人类可以刻薄、讽刺和自嘲。 AI被训练得有用且无害,这意味着它也被训练得平淡无味。当游戏中的一个人说"我也不完全理解"时,那种自嘲比 ChatGPT 权威但空洞的概述既更有趣也更有共鸣。

自己试试看

理解这种差距的最好方式不是阅读相关内容。而是亲身体验。跟几个朋友一起玩 Your AI Slop Bores Me,三轮之内你就无法再认真对待 ChatGPT 的输出了。不是因为它错了,而是因为它无聊。因为它在该坚定的时候模棱两可。因为它在该凌乱的时候过于光鲜。因为它听起来像所有人,所以听起来像没有人。

你那个古怪的、有缺陷的、有观点的、偶尔犯错的人类大脑,比这个星球上最强大的语言模型更有趣。这个游戏只是让这一点变得显而易见。