什么时候该把活儿交给 AI:一个可以算的判断
Mollick 给了三个变量——自己做要多久、AI 一次做成的概率、你请求加等待加检查要多久。算清楚就知道该不该交出去。更重要的是后半段:写交付说明这件事,咨询行业本来就在做。
- 原作者
- Ethan Mollick
- 原文标题
- Management as AI superpower
- 原发布平台
- One Useful Thing
- 原发布日期
- 2026/01/27
译者说明:本文译自 Ethan Mollick 的博客 One Useful Thing,原文发表于 2026 年 1 月 27 日。 文中提到的 GDPval 是 OpenAI 发布的、用真实职业任务对比人类专家与 AI 的评测。
我刚在宾夕法尼亚大学上完一门实验性的课,我要求学生在四天内从零做出一家创业公司。班上大多数人在读高管 MBA,也就是说他们一边上课一边还在当医生、经理,或者大小公司的领导。几乎没有人写过代码。 我把 Claude Code 和 Google Antigravity 介绍给他们,要求他们用这些工具做出一个能跑的原型。但光有原型不算创业公司,所以他们还用 ChatGPT、Claude 和 Gemini 来加速创意生成、市场调研、竞争定位、路演和财务建模。
我很好奇他们在这么短时间里能走多远。结果是:他们走得很远。
我教创业课已经十五年,见过数千个创业点子(其中一些后来长成了大公司),所以我对一班聪明的 MBA 学生能做到什么程度有很好的判断。我估计,我在两天里看到的东西,比 AI 出现之前学生花一整个学期做出来的,在通往真实创业公司的路上要远一个数量级。
大多数原型不只是示意界面,而是真的有一个核心功能能跑。创意比平时更多样、更有意思。市场与客户分析很有洞察。
还有一件事:多数早期创业公司都需要转向(pivot),随着对市场需求和技术可能性的了解而改变方向。由于转向的成本降低了,探索各种可能性变得容易得多,不会被锁死,甚至可以同时探索多个创业方向——你只要告诉 AI 你想要什么。
我很想说这个成果是我教得好,但我们其实还没有一套关于如何使用所有这些工具的好框架,学生基本是自己摸索出来的。有帮助的是他们具备一些管理能力和专业知识,因为事实证明成功的关键恰恰是上一段最后那半句:告诉 AI 你想要什么。
随着 AI 越来越能完成那些人类要花好几个小时的任务,而评估这些结果本身也越来越耗时,「善于委派」的价值就上升了。但什么时候该委派给 AI?
委派的方程
我们其实有答案,只是有点复杂。考虑三个因素:
第一,因为存在 AI 能力的参差前沿,在复杂任务上你无法可靠地预知 AI 会擅长还是不擅长什么。
第二,无论 AI 做得好还是差,它一定很快。它在几分钟内产出的东西,人要做好几个小时。
第三,它相对于专业人士的工资很便宜,而且它不介意你生成多个版本再把大部分丢掉。
这三点意味着,是否委派给 AI 取决于三个变量:
| 变量 | 含义 |
|---|---|
| 人类基线时间 | 这件事你自己做要花多久 |
| 成功概率 | AI 单次尝试就产出达到你标准的成果的可能性 |
| AI 流程时间 | 你提出要求、等待、并评估它的产出所需的时间 |
一个有用的心智模型是:你在拿「做完整件事」(人类基线时间)与「支付这笔开销」(AI 流程时间,可能要付好几次直到拿到能用的东西)做权衡。成功概率越高,你需要支付 AI 流程时间的次数越少,把事情交出去就越划算。
举例:一件事你自己做要一小时,AI 几分钟就能做完,但检查答案要三十分钟。这种情况下,只有当成功概率非常高时你才该交给 AI——否则你花在生成和检查草稿上的时间会超过自己动手。但如果人类基线时间是 10 小时,那么花几个小时和 AI 打交道就是值得的,前提是 AI 能被调教到做出称职的活儿。
用 GDPval 的数字算一遍
我们知道这个方程成立,因为去年夏天 OpenAI 发布了关于 AI 与真实工作的一篇重要论文——GDPval。它让金融、医疗、政府等不同领域的资深人类专家与最新的 AI 对决,再由另一组专家当评委。
- 人类基线时间:专家平均要 7 小时完成这些工作
- AI 流程时间:AI 只要几分钟,但专家需要一小时来核查这些工作,当然写提示词也要时间
- 成功概率:GDPval 刚出来时,评委多数情况下判人类胜出;但随着 GPT-5.2 发布,平衡发生了变化——GPT-5.2 Thinking 和 Pro 平均有 72% 的情况打平或胜过人类专家
现在可以算:一件 7 小时的活儿,假设 72% 的成功概率和 1 小时的评估时间。如果你每件事都先花时间写提示词、花一小时评估答案、答案不行再自己做,那么平均能省下 3 小时。AI 失败的那些任务会更慢(你白白花了写提示词和审阅的时间),但 AI 成功的那些会快得多。
但我们还能用管理学的技巧,把这个方程进一步扭向对我们有利的一侧。
委派就是新的提示词工程
有三件事能让委派给 AI 更划算——提高成功概率、降低 AI 流程时间:
- 给出更好的指令,设定清晰的目标,让 AI 有更高的概率一次做对
- 提升评估与反馈的能力,这样需要的尝试次数更少
- 让「判断 AI 做得好不好」这件事本身更省时间
所有这三个因素都会被专业知识放大——专家知道该下什么指令,更能看出哪里出了问题,也更擅长纠正它。
如果你不需要什么特别具体的东西,今天的模型已经强到能自己想办法解决问题。比如我发现 Claude Code 能用一句提示词生成一整个 1980 年代风格的冒险游戏:「创建一个完全原创的老派 Sierra 风格冒险游戏,要有 EGA 风格的画面。用你的图像 agent 生成图片,给我一个文字解析器。所有谜题要有趣且可解。把游戏做完(玩起来 10–15 分钟),不要问任何问题。做得惊艳而愉快。」就这样,AI 做出了一切,包括美术。
这确实惊人,但这份惊人被放大了,因为我并不需要任何具体的东西——我只要一个冒险游戏,AI 可以自由发挥。
但真实的工作、真实的委派,意味着你心里有一个具体的产出。 这就是事情变棘手的地方。你要怎么把你的意图传达给 AI,让它既能用「判断力」解决问题,又能交出你想要的那个产出?
每个行业都早就发明了解决它的表格
这个问题远在 AI 之前就存在,而且普遍到每个领域都发明了自己的文书来解决它:
- 软件开发者写产品需求文档(PRD)
- 电影导演交出分镜清单
- 建筑师写设计意图文件
- 海军陆战队用五段式命令(形势、任务、执行、行政、指挥)
- 咨询顾问用详细的交付物说明来界定项目范围
所有这些文件都能出色地充当这个 agent 时代的 AI 提示词(AI 一次能处理很多页的指令)。你之所以能用这么多种格式来指挥 AI,是因为它们本质上是同一件事:试图把一个人脑子里的东西,变成另一方的行动。
当你看真正好的委派文档里包含什么,会发现内容惊人地一致:
- 我们想达成什么,为什么?
- 被委派的权限边界在哪里?
- 「做完了」长什么样?
- 我需要哪些具体产出?
- 我需要哪些中间产出来跟进你的进展?
- 你在告诉我「完成了」之前,应该自查哪些东西?
如果这些都被明确写下来,AI 和人一样,都更可能干得好。
而在琢磨如何把这些指令给到 AI 的过程中,你基本上就是在重新发明管理。
管理 agent
我觉得有意思的是,一些顶级 AI 实验室里最知名的软件开发者都提到,他们的工作正从「主要在编程」变成「主要在管理 AI agent」。编程一直有非常规整的结构,产出可清晰验证(代码要么能跑要么不能),所以它是 AI 工具最早成熟的领域之一,因而也是第一个感受到这种变化的职业。它不会是最后一个。
作为商学院教授,我认为很多人已经具备——或者能学会——与 AI agent 协作所需要的技能:它们就是管理学 101 的技能。如果你能说清楚你要什么、能给出有效的反馈、能设计出评估工作的方式,那你就能与 agent 协作。
在很多方面,至少在你的专业领域内,这比琢磨聪明的提示词要容易得多,因为它更像在和人共事。
同时,管理一直假定稀缺:你委派是因为你不能什么都自己做,因为人才有限且昂贵。AI 改变了这个等式。现在「人才」变得充裕而廉价。稀缺的是「知道该要什么」。
这就是为什么我的学生做得这么好。他们不是 AI 专家。但他们花了多年时间学习如何在自己的专业领域里界定问题、定义交付物、识别一份财务模型或医疗报告哪里不对劲。他们从课程和工作中辛苦挣来的框架,变成了他们的提示词。那些常被贬为「软」的技能,反倒成了硬的那一批。
我不确切知道当每个人都成为管理者、手下有一支不知疲倦的 agent 队伍时,工作会是什么样。但我猜想,能够胜出的人会是那些知道「好」长什么样,并且能把它讲得足够清楚,清楚到连 AI 都能交付出来的人。
我的学生用四天想明白了这件事。不是因为他们是 AI 原住民,而是因为他们本来就会管理。
译后附记:你的项目范围书就是提示词
原文里那句「咨询顾问用详细的交付物说明来界定项目范围」值得单独拎出来。
你已经会写这类文件了。 SOW、项目建议书、简报模板、访谈提纲、编码本——这些都是「把我脑子里的东西变成别人的行动」。原文的意思是:把它们原样贴给 AI,效果好过你临时想的那句提示词。
一个可以直接照着改的委派模板:
【目标】这份东西是给谁看的、要让他们做什么决定 【范围】要覆盖什么,明确不覆盖什么 【完成标准】满足哪几条才算做完 【最终产出】格式、长度、结构 【中间产出】你做到一半时先给我看什么 【自查清单】交给我之前,你自己先核对这几条: - 每个数字有没有标出处 - 有没有把相关性写成了因果 - 有没有出现材料里没有的机构名或人名
复制为纯文本,换行与缩进原样保留,可直接粘贴进对话框。
最后一栏——自查清单——是回报最高的一段。它把「你评估产出的时间」这一项直接压下来,也就是原文方程里的 AI 流程时间。
出处
本文译自 Ethan Mollick 的 One Useful Thing,原文 Management as AI superpower, 发表于 2026 年 1 月 27 日。译文与译后附记由 HiBridge 撰写。