什么时候该把活儿交给 AI:一个可以算的判断

Mollick 给了三个变量——自己做要多久、AI 一次做成的概率、你请求加等待加检查要多久。算清楚就知道该不该交出去。更重要的是后半段:写交付说明这件事,咨询行业本来就在做。

2026/01/27约 9 分钟HiBridge 编译
译文本文是英文原文的中文翻译,原作者与原文链接如下。
原作者
Ethan Mollick
原文标题
Management as AI superpower
原发布平台
One Useful Thing
原发布日期
2026/01/27

译者说明:本文译自 Ethan Mollick 的博客 One Useful Thing,原文发表于 2026 年 1 月 27 日。 文中提到的 GDPval 是 OpenAI 发布的、用真实职业任务对比人类专家与 AI 的评测。

我刚在宾夕法尼亚大学上完一门实验性的课,我要求学生在四天内从零做出一家创业公司。班上大多数人在读高管 MBA,也就是说他们一边上课一边还在当医生、经理,或者大小公司的领导。几乎没有人写过代码。 我把 Claude Code 和 Google Antigravity 介绍给他们,要求他们用这些工具做出一个能跑的原型。但光有原型不算创业公司,所以他们还用 ChatGPT、Claude 和 Gemini 来加速创意生成、市场调研、竞争定位、路演和财务建模。

我很好奇他们在这么短时间里能走多远。结果是:他们走得很远。

我教创业课已经十五年,见过数千个创业点子(其中一些后来长成了大公司),所以我对一班聪明的 MBA 学生能做到什么程度有很好的判断。我估计,我在两天里看到的东西,比 AI 出现之前学生花一整个学期做出来的,在通往真实创业公司的路上要远一个数量级。

大多数原型不只是示意界面,而是真的有一个核心功能能跑。创意比平时更多样、更有意思。市场与客户分析很有洞察。

还有一件事:多数早期创业公司都需要转向(pivot),随着对市场需求和技术可能性的了解而改变方向。由于转向的成本降低了,探索各种可能性变得容易得多,不会被锁死,甚至可以同时探索多个创业方向——你只要告诉 AI 你想要什么。

我很想说这个成果是我教得好,但我们其实还没有一套关于如何使用所有这些工具的好框架,学生基本是自己摸索出来的。有帮助的是他们具备一些管理能力和专业知识,因为事实证明成功的关键恰恰是上一段最后那半句:告诉 AI 你想要什么

随着 AI 越来越能完成那些人类要花好几个小时的任务,而评估这些结果本身也越来越耗时,「善于委派」的价值就上升了。但什么时候该委派给 AI?

委派的方程

我们其实有答案,只是有点复杂。考虑三个因素:

第一,因为存在 AI 能力的参差前沿,在复杂任务上你无法可靠地预知 AI 会擅长还是不擅长什么。

第二,无论 AI 做得好还是差,它一定很快。它在几分钟内产出的东西,人要做好几个小时。

第三,它相对于专业人士的工资很便宜,而且它不介意你生成多个版本再把大部分丢掉。

这三点意味着,是否委派给 AI 取决于三个变量:

变量 含义
人类基线时间 这件事你自己做要花多久
成功概率 AI 单次尝试就产出达到你标准的成果的可能性
AI 流程时间 你提出要求、等待、并评估它的产出所需的时间

一个有用的心智模型是:你在拿「做完整件事」(人类基线时间)与「支付这笔开销」(AI 流程时间,可能要付好几次直到拿到能用的东西)做权衡。成功概率越高,你需要支付 AI 流程时间的次数越少,把事情交出去就越划算。

举例:一件事你自己做要一小时,AI 几分钟就能做完,但检查答案要三十分钟。这种情况下,只有当成功概率非常高时你才该交给 AI——否则你花在生成和检查草稿上的时间会超过自己动手。但如果人类基线时间是 10 小时,那么花几个小时和 AI 打交道就是值得的,前提是 AI 能被调教到做出称职的活儿。

用 GDPval 的数字算一遍

我们知道这个方程成立,因为去年夏天 OpenAI 发布了关于 AI 与真实工作的一篇重要论文——GDPval。它让金融、医疗、政府等不同领域的资深人类专家与最新的 AI 对决,再由另一组专家当评委。

  • 人类基线时间:专家平均要 7 小时完成这些工作
  • AI 流程时间:AI 只要几分钟,但专家需要一小时来核查这些工作,当然写提示词也要时间
  • 成功概率:GDPval 刚出来时,评委多数情况下判人类胜出;但随着 GPT-5.2 发布,平衡发生了变化——GPT-5.2 Thinking 和 Pro 平均有 72% 的情况打平或胜过人类专家

现在可以算:一件 7 小时的活儿,假设 72% 的成功概率和 1 小时的评估时间。如果你每件事都先花时间写提示词、花一小时评估答案、答案不行再自己做,那么平均能省下 3 小时。AI 失败的那些任务会更慢(你白白花了写提示词和审阅的时间),但 AI 成功的那些会快得多。

但我们还能用管理学的技巧,把这个方程进一步扭向对我们有利的一侧。

委派就是新的提示词工程

有三件事能让委派给 AI 更划算——提高成功概率、降低 AI 流程时间:

  1. 给出更好的指令,设定清晰的目标,让 AI 有更高的概率一次做对
  2. 提升评估与反馈的能力,这样需要的尝试次数更少
  3. 让「判断 AI 做得好不好」这件事本身更省时间

所有这三个因素都会被专业知识放大——专家知道该下什么指令,更能看出哪里出了问题,也更擅长纠正它。

如果你不需要什么特别具体的东西,今天的模型已经强到能自己想办法解决问题。比如我发现 Claude Code 能用一句提示词生成一整个 1980 年代风格的冒险游戏:「创建一个完全原创的老派 Sierra 风格冒险游戏,要有 EGA 风格的画面。用你的图像 agent 生成图片,给我一个文字解析器。所有谜题要有趣且可解。把游戏做完(玩起来 10–15 分钟),不要问任何问题。做得惊艳而愉快。」就这样,AI 做出了一切,包括美术。

这确实惊人,但这份惊人被放大了,因为我并不需要任何具体的东西——我只要一个冒险游戏,AI 可以自由发挥。

但真实的工作、真实的委派,意味着你心里有一个具体的产出。 这就是事情变棘手的地方。你要怎么把你的意图传达给 AI,让它既能用「判断力」解决问题,又能交出你想要的那个产出?

每个行业都早就发明了解决它的表格

这个问题远在 AI 之前就存在,而且普遍到每个领域都发明了自己的文书来解决它:

  • 软件开发者写产品需求文档(PRD)
  • 电影导演交出分镜清单
  • 建筑师写设计意图文件
  • 海军陆战队用五段式命令(形势、任务、执行、行政、指挥)
  • 咨询顾问用详细的交付物说明来界定项目范围

所有这些文件都能出色地充当这个 agent 时代的 AI 提示词(AI 一次能处理很多页的指令)。你之所以能用这么多种格式来指挥 AI,是因为它们本质上是同一件事:试图把一个人脑子里的东西,变成另一方的行动。

当你看真正好的委派文档里包含什么,会发现内容惊人地一致:

  • 我们想达成什么,为什么?
  • 被委派的权限边界在哪里?
  • 「做完了」长什么样?
  • 我需要哪些具体产出?
  • 我需要哪些中间产出来跟进你的进展?
  • 你在告诉我「完成了」之前,应该自查哪些东西

如果这些都被明确写下来,AI 和人一样,都更可能干得好。

而在琢磨如何把这些指令给到 AI 的过程中,你基本上就是在重新发明管理

管理 agent

我觉得有意思的是,一些顶级 AI 实验室里最知名的软件开发者都提到,他们的工作正从「主要在编程」变成「主要在管理 AI agent」。编程一直有非常规整的结构,产出可清晰验证(代码要么能跑要么不能),所以它是 AI 工具最早成熟的领域之一,因而也是第一个感受到这种变化的职业。它不会是最后一个。

作为商学院教授,我认为很多人已经具备——或者能学会——与 AI agent 协作所需要的技能:它们就是管理学 101 的技能。如果你能说清楚你要什么、能给出有效的反馈、能设计出评估工作的方式,那你就能与 agent 协作。

在很多方面,至少在你的专业领域内,这比琢磨聪明的提示词要容易得多,因为它更像在和人共事。

同时,管理一直假定稀缺:你委派是因为你不能什么都自己做,因为人才有限且昂贵。AI 改变了这个等式。现在「人才」变得充裕而廉价。稀缺的是「知道该要什么」。

这就是为什么我的学生做得这么好。他们不是 AI 专家。但他们花了多年时间学习如何在自己的专业领域里界定问题、定义交付物、识别一份财务模型或医疗报告哪里不对劲。他们从课程和工作中辛苦挣来的框架,变成了他们的提示词。那些常被贬为「软」的技能,反倒成了硬的那一批。

我不确切知道当每个人都成为管理者、手下有一支不知疲倦的 agent 队伍时,工作会是什么样。但我猜想,能够胜出的人会是那些知道「好」长什么样,并且能把它讲得足够清楚,清楚到连 AI 都能交付出来的人。

我的学生用四天想明白了这件事。不是因为他们是 AI 原住民,而是因为他们本来就会管理


译后附记:你的项目范围书就是提示词

原文里那句「咨询顾问用详细的交付物说明来界定项目范围」值得单独拎出来。

你已经会写这类文件了。 SOW、项目建议书、简报模板、访谈提纲、编码本——这些都是「把我脑子里的东西变成别人的行动」。原文的意思是:把它们原样贴给 AI,效果好过你临时想的那句提示词。

一个可以直接照着改的委派模板:

可复制的提示词
【目标】这份东西是给谁看的、要让他们做什么决定
【范围】要覆盖什么,明确不覆盖什么
【完成标准】满足哪几条才算做完
【最终产出】格式、长度、结构
【中间产出】你做到一半时先给我看什么
【自查清单】交给我之前,你自己先核对这几条:
  - 每个数字有没有标出处
  - 有没有把相关性写成了因果
  - 有没有出现材料里没有的机构名或人名

复制为纯文本,换行与缩进原样保留,可直接粘贴进对话框。

最后一栏——自查清单——是回报最高的一段。它把「你评估产出的时间」这一项直接压下来,也就是原文方程里的 AI 流程时间。


出处

本文译自 Ethan Mollick 的 One Useful Thing,原文 Management as AI superpower, 发表于 2026 年 1 月 27 日。译文与译后附记由 HiBridge 撰写。