一个人加 AI,等于两个人:宝洁 776 人的对照实验

哈佛与宝洁合作的随机对照试验。结论有点反直觉——一个人配上 AI,表现和一个两人小组一样好;而且专业分工的边界消失了,研发的人开始写出商业视角的方案。

2025/03/22约 8 分钟HiBridge 编译
译文本文是英文原文的中文翻译,原作者与原文链接如下。
原作者
Ethan Mollick
原文标题
The Cybernetic Teammate
原发布平台
One Useful Thing
原发布日期
2025/03/22

译者说明:本文译自 Ethan Mollick 的博客 One Useful Thing,原文发表于 2025 年 3 月 22 日。 实验使用 GPT-4 与 GPT-4o。作者在文中明确指出这可能是效果的下限(模型比当时更强、参与者不熟练、聊天机器人本身不是为团队协作设计的)。

在过去几年里,我们已经知道 AI 能提升个体知识工作者的生产力——从咨询顾问到律师到程序员都是如此。但大多数知识工作并不是纯粹的个人活动,它发生在小组和团队里。而团队不只是一群人的集合——它提供了个人通常无法获得的关键好处,包括更好的表现、专业知识的共享,以及社会连接。

那么,当 AI 充当队友时,会发生什么?

去年夏天,我们在消费品巨头宝洁公司(Procter & Gamble)对 776 名专业人士做了一次预注册的随机对照试验,来回答这个问题。

实验是怎么做的

我们希望这个实验是对真实世界 AI 使用的检验,所以在宝洁的配合下,我们复现了宝洁真实的产品开发流程。我们举办了为期一天的工作坊,来自欧洲和美国的专业人士需要为他们真正所属的业务单元开发产品创意、包装、零售策略等——业务单元包括婴儿护理、女性护理、剃须和口腔护理。产出最好创意的团队会把方案提交给管理层审批,所以是有真实利害关系的

参与者分为两类专业人士:商业专家技术研发专家。他们通常经验非常丰富,光在宝洁就有 10 年以上的工作经历。

我们随机组建了由每个专业各一人构成的团队。一半给了 GPT-4 或 GPT-4o,一半没有。 我们还随机挑了两类专家中的一部分让他们单独工作,同样给其中一半 AI 权限。所有被分到 AI 组的人都接受了一次培训,并拿到一套可以直接用或修改的提示词。

这个设计让我们能够分别以及组合地分离出 AI 和团队协作各自的效应。我们在多个维度上测量结果:方案质量(每份方案至少由两位专家评审判定)、耗时,以及参与者的情绪反应。

发现一:一个人加 AI ≈ 一个团队

在没有 AI 的情况下,团队的表现显著优于个人,高出 0.24 个标准差(这让每一位强调团队价值的老师和管理者松了口气)。

但惊喜出现在 AI 组:使用 AI 的个人,表现和没有 AI 的团队一样好,相对基线提升 0.37 个标准差。 这表明 AI 有效地复制了拥有一位人类队友所带来的表现收益——一个人加 AI,可以匹敌过去需要两人协作才能达到的水平。

有 AI 的团队整体表现最好,提升 0.39 个标准差,不过「有 AI 的个人」和「有 AI 的团队」之间的差异在统计上并不显著

但当我们看那些真正出色的方案——质量排在前 10% 的——时,发现了一个有意思的模式:使用 AI 的团队显著更可能产出这种顶级方案。 这说明让人类团队一起攻一个问题,其价值超出了单独与 AI 协作的价值。

两个 AI 组的工作速度也快得多,比非 AI 组节省了 12–16% 的时间,同时产出的方案明显更长、更详细。

发现二:专业边界消失了

在没有 AI 的情况下,我们看到人们解决问题的方式有清晰的专业竖井:研发专家一贯提出技术导向的方案,商业专家则提出市场导向的想法。当这两类专家在没有 AI 的团队里协作时,他们通过跨职能的合作产出了更均衡的方案(团队协作再次获胜)。

但这是 AI 造成巨大差异的另一个地方。当配上 AI,研发人员和商业人员——无论在团队里还是单独工作——都产出了同时整合技术与商业视角的均衡方案。在有 AI 辅助的条件下,专家之间的区别几乎消失了。

这个效应在对产品开发不太熟悉的员工身上尤其明显。没有 AI 时,这些经验较少的员工即使在团队里表现也相对较差。但有了 AI 辅助,他们的表现突然可以和包含资深成员的团队相当。AI 有效地帮人跨越了职能知识的鸿沟,让他们的思考和创造超出自己的专业训练,也让业余者表现得更像专家。

发现三:用 AI 的人情绪更好

一个特别令人意外的发现,是 AI 如何影响工作的情绪体验

技术变革,尤其是 AI,常常被与工作满意度下降和压力上升联系在一起。但我们的结果显示了相反的情况,至少在这个案例中是这样。

使用 AI 的人报告了显著更高水平的正面情绪(兴奋、有劲、热情),相比不用 AI 工作的人。他们也报告了更低水平的负面情绪,比如焦虑和挫败。使用 AI 单独工作的个人,其情绪体验与在人类团队中工作的人相当,甚至更好。

局限

虽然我们做的是预注册的随机对照试验,这类研究总是有需要说明的地方。比如,更大的团队在与 AI 协作时可能呈现非常不同的结果;更长周期的项目里 AI 的价值也可能不同。

我们的结果也可能代表一个下限:所有这些实验都是用 GPT-4 或 GPT-4o 做的,它们不如今天可用的模型强;参与者没有多少提示词经验,所以可能没有拿到应有的收益;而且聊天机器人本来就不是为团队协作设计的

为什么这件事重要

组织一直主要把 AI 看作又一个生产力工具,像一个更好的计算器或电子表格。这在最初是说得通的,但随着模型越来越好,也随着最近的数据发现用户最常把 AI 用于批判性思考和复杂问题求解而不只是常规生产力任务,这个视角已经越来越局限。

只盯着 AI 效率收益的公司,不仅会发现员工不愿分享自己的 AI 心得(因为怕让自己变得多余),还会错过更大格局地思考工作未来的机会。

要成功使用 AI,组织需要更换他们的类比。我们的发现表明,AI 有时候更像一个队友,而不是一个工具。它虽然不是人类,却复制了团队协作的核心好处——更好的表现、专业知识的共享,以及正面的情绪体验。

这个「队友视角」应该让组织换一种方式思考 AI。它意味着需要重新考虑团队结构、培训项目,甚至是专业之间的传统边界。它也让专业知识民主化,让更多员工能够对专门性的任务做出有意义的贡献,并可能开辟新的职业路径。

最令人兴奋的含义也许是:AI 不只是把现有任务自动化,它改变了我们思考工作本身的方式。


译后附记:对研究咨询团队意味着什么

这项研究的场景——一天的工作坊、跨职能两人组、真实业务单元的产品创意与零售策略——和很多咨询项目的启动会几乎是一回事。三条直接的推论:

① 「配几个人」这个问题的答案变了。 过去一个议题至少配两个人才有交叉视角。现在一个人加 AI 就能拿到大致相当的产出。这不是说可以裁人,而是说同样的人力可以并行覆盖更多议题

② 最该配 AI 的是资历浅的人。BCG 那项实验 的「技能拉平」是同一个方向:新人的提升幅度最大。

③ 但真正的好方案还是要靠人组队。 前 10% 的方案里,有 AI 的团队显著更多。所以正确的读法不是「用 AI 代替协作」,而是「用 AI 让每个人的起点更高,然后再让人碰在一起」。


出处

本文译自 Ethan Mollick 的 One Useful Thing,原文 The Cybernetic Teammate, 发表于 2025 年 3 月 22 日。译文与译后附记由 HiBridge 撰写。