半人马与赛博格:758 名咨询顾问的对照实验

沃顿商学院 Mollick 团队与 BCG 合作,把 758 名顾问随机分成用 AI 和不用 AI 两组,做 18 项真实咨询任务。用 AI 的那组每一项指标都赢。但在一道故意设计成 AI 会答错的题上,用 AI 的人正确率反而从 84% 掉到 60–70%。

2026/08/06约 10 分钟HiBridge 编译
译文本文是英文原文的中文翻译,原作者与原文链接如下。
原作者
Ethan Mollick
原文标题
Centaurs and Cyborgs on the Jagged Frontier
原发布平台
One Useful Thing
原发布日期
2023/09/16

译者说明:本文译自沃顿商学院教授 Ethan Mollick 的博客 One Useful Thing,原文发表于 2023 年 9 月 16 日。 实验用的是当时的 GPT-4。模型换代不影响本文的结论——「参差的前沿」「半人马」「赛博格」这三个说法后来成了这个领域的通用词汇, 而这项实验至今仍是唯一一项在真实咨询公司里做的、预注册的大规模对照实验。原文见文末链接。

很多人一直在问:AI 对未来的工作到底算不算一件大事。我们有一篇新论文,它强烈地暗示答案是

过去几个月里,我是一个社会科学家团队的一员,与波士顿咨询公司(BCG)合作,把他们的办公室变成了这个 AI 笼罩的时代里、关于专业工作的未来的最大规模预注册实验。我们的第一篇工作论文今天发布了。论文里有大量重要而有用的细节,但先说结论:在 18 项精心挑选、真实反映一家顶级咨询公司日常工作的任务上,使用 GPT-4 的顾问表现全面优于不使用的顾问。在每一个维度上。在我们测量的每一种方式上。

使用 AI 的顾问平均多完成 12.2% 的任务完成速度快 25.1%产出质量高 40%。这是非常大的影响。

现在,让我们加上那些细节。

首先要知道,这项工作是跨学科的,包含多种实验和数百次访谈,由一个很棒的团队完成,成员包括哈佛的社会科学家 Fabrizio Dell’Acqua、Edward McFowland III 和 Karim Lakhani;华威商学院的 Hila Lifshitz-Assaf 和 MIT 的 Katherine Kellogg(再加上我自己)。BCG 一侧由 Saran Rajendran、Lisa Krayer 和 François Candelon 执行,动用了全公司 7% 的咨询力量(758 名顾问)

参差的前沿之内

AI 很怪。 没有人真正知道最先进的大语言模型的能力全貌,没有人真正知道使用它们的最佳方式,也没有人知道它们会在什么条件下失败。没有说明书。 在有些任务上 AI 强得惊人,在另一些任务上它会彻底失败,或者以一种不易察觉的方式失败。除非你大量使用 AI,否则你分不清哪个是哪个。

其结果就是我们所说的 AI 的**「参差的前沿」(Jagged Frontier)**。

想象一座城堡的围墙,有些塔楼和城垛向外突入乡野,另一些则向城堡中心回缩。那道墙就是 AI 的能力边界,离中心越远,任务越难。墙内的一切 AI 都能做,墙外的一切对 AI 都很难。

问题在于这道墙是看不见的。 所以有些任务看上去离中心的距离一样、因而看上去同样难——比如「写一首十四行诗」和「写一首正好 50 个词的诗」——实际上却分别落在墙的两侧。AI 写十四行诗很棒,但因为它是以 token 而不是以词来理解世界的,它写出的诗总是多于或少于 50 个词。同样,有些出人意料的任务(比如创意生成)对 AI 很容易,而另一些看上去机器该很擅长的任务(比如基础算术)对大语言模型却是挑战。

为了检验 AI 对知识工作的真实影响,我们让数百名顾问参与,随机决定他们是否被允许使用 AI。允许使用的那组拿到的是 GPT-4——和 169 个国家的所有人都能免费用到的、或者每月付 20 美元给 OpenAI 就能用到的,是同一个模型。没有特别的微调,没有特别的提示词,就是通过 API 调用的 GPT-4。

然后我们做了大量预测试和问卷来建立基线,并要求顾问为一家虚构的鞋类公司完成各种工作——这些工作是 BCG 团队挑选出来、能够准确代表顾问日常所做之事的。其中有创意类任务(「为一个未被充分服务的市场或运动项目,提出至少 10 个新款鞋的创意」)、分析类任务(「按用户对鞋类行业市场做细分」)、写作与营销类任务(「为你的产品起草一份新闻稿的营销文案」)和说服类任务(「写一封鼓舞人心的备忘录给员工,说明为什么你的产品会胜过竞品」)。我们甚至找了一位鞋业公司高管确认这些工作是否真实——确实是

结果符合我们的理论:使用 AI 的顾问明显做得更好,无论我们是否事先给他们做了简短的 AI 介绍。这一点在每一项测量上都成立——完成任务所需时间、总共完成的任务数量(我们给了整体时限)、产出质量。质量的评分我们同时用了人类评分者和 AI 评分者,两者的评分彼此吻合(这本身就是一个有意思的发现)。

它是一台「拉平器」

我们还发现了另一件有意思的事,这个效应在其他 AI 研究中也越来越明显:它起到了技能拉平器的作用。

在实验开始时评估得分最差的那批顾问,在用上 AI 之后表现跃升最大,提升 43%。顶尖顾问也有提升,但幅度小得多。

看着这些结果,我认为还没有足够多的人在认真思考:当一项技术把所有工人都抬到表现的最高梯队,那意味着什么。这可能就像过去矿工挖岩石的好坏很重要——直到蒸汽铲被发明出来,挖掘能力的差异就不再重要了。AI 还没到那个改变程度,但技能拉平会产生很大影响

参差的前沿之外

但故事还没完。BCG 还设计了一项任务,这一项经过精心挑选,确保 AI 无法得出正确答案

这并不容易。正如我们在论文里写的:「由于 AI 的能力出人意料地强,很难在这个实验中设计出一项落在 AI 前沿之外、且具备高人力资本的人类在做本职工作时能持续胜过 AI 的任务。」但我们找到了一项利用 AI 盲区的任务,它会给出一个错误但极具说服力的答案,而人类能够解开这个问题。

结果:在没有 AI 帮助时,人类顾问的正确率是 84%。而当顾问使用了 AI,他们做得更差——正确率只有 60–70%。

发生了什么?

在另一篇论文里,Fabrizio Dell’Acqua 说明了为什么过度依赖 AI 会适得其反。在一项实验中,他发现使用高质量 AI 的招聘人员变得懒惰、粗心,自身判断力下降。他们错过了一些出色的申请者,做出的决策比使用低质量 AI 或完全不用 AI 的招聘人员更糟。当 AI 非常好时,人类就没有理由努力工作和保持注意力了。他们让 AI 接管,而不是把它当工具用。他把这叫做**「在方向盘前睡着」(falling asleep at the wheel)**,它会损害人的学习、技能发展和生产力。

在我们的实验里,我们同样发现顾问在方向盘前睡着了——用 AI 的那些人,答案的准确度反而不如不被允许用 AI 的人(不过他们把结果写出来的水平仍然更好)。

如果你不知道前沿在哪里,AI 的那种权威口吻是有欺骗性的。

半人马与赛博格

但也有很多顾问在前沿之内和之外的任务上都做对了,既拿到了 AI 的好处又避开了它的坏处。关键似乎在于采用了两种路径之一:成为半人马(Centaur),或者成为赛博格(Cyborg)

半人马式的工作在人与机器之间有一条清晰的界线,就像神话中半人马的人类上身与马身之间那条清晰的界线。半人马做的是策略性的分工,在 AI 任务和人类任务之间切换,根据各自的强项和能力来分配职责。我在借助 AI 做分析时,常常以半人马的方式进行:我来决定用什么统计方法,然后让 AI 去生成图表。在我们 BCG 的研究里,半人马型的人会自己做那些他们最擅长的工作,然后把落在参差前沿之内的任务交给 AI。

另一方面,赛博格把机器与人融为一体,两者深度交织。 赛博格不只是委派任务;他们把自己的努力与 AI 缠绕在一起,在参差的前沿上来回穿梭。任务的碎片被交给 AI,比如起一个句子的头让 AI 补完——赛博格于是发现自己在与 AI 并肩工作。这就是我建议在写作中使用 AI 的方式。

在参差的前沿上起舞

我们的论文,连同其他学者一系列出色的工作,都表明:无论关于 AI 本质与未来的哲学和技术争论如何,它已经是对我们实际工作方式的一个强力扰动。而且这不是一项要五年后才改变世界、需要大量投资和巨头资源的炒作技术——它就在这里,现在。

精英顾问用来给工作加速的工具,和读到这篇文章的每一个人能拿到的工具,是完全一样的。

除了这句话可能引起的焦虑之外,也值得注意 AI 的其他缺点。人真的会在使用 AI 时进入自动驾驶,在方向盘前睡着,没能注意到 AI 的错误。 而且和其他研究一样,我们也发现 AI 的产出虽然质量高于人类,但整体上有点同质、有点千篇一律

这正是为什么赛博格和半人马很重要——它们让人类能够与 AI 协作,产出比人类单独或 AI 单独都更多样、更正确、更好的结果。而要成为其中之一并不难。只要在工作任务上用得足够多,你就会开始看见那道参差前沿的形状,开始明白 AI 在哪里好得吓人,又在哪里力有不逮。

在我看来,问题已经不再是 AI 是否会重塑工作,而是我们希望那意味着什么


译后附记:这项研究和你的工作是什么关系

这是全站里唯一一篇研究对象就是你的文章。758 名顾问,18 项任务,鞋类公司的市场细分、新闻稿、员工备忘录——这就是这一行的日常。

三条可以直接用起来的:

发现 你该怎么办
差异最大的是基线最弱的人(+43%) 团队里最该先配 AI 的不是资深顾问,是新人
看不见的前沿 别按「这事儿难不难」来判断 AI 行不行。判断的唯一办法是试,并且记住哪些试过不行
方向盘前睡着(84% → 60–70%) 越是 AI 答得流畅自信的地方,越要留一道人工核验。尤其是数字和因果判断

那道「参差的前沿」还有一个实际含义:它是会移动的。今天试过不行的,半年后可能就行了。所以「AI 不能做 X」这句话应该带上日期。


出处

本文译自 Ethan Mollick 的 One Useful Thing,原文 Centaurs and Cyborgs on the Jagged Frontier, 发表于 2023 年 9 月 16 日。译文与译后附记由 HiBridge 撰写。