四大里有三家因为 AI 编的引用撤回了报告
德勤退款、安永下架、毕马威撤稿——都是同一个原因:报告里的引用是 AI 编的,没人核。这不是一个理论风险,这是这一行过去十二个月里真实发生过三次的事故。文末是一份交付前的核查清单。
写这篇的理由:站里其他文章讲怎么把活儿干得更快。这一篇讲怎么不把公司赔进去。 文中所有事实都附了出处链接,可以逐条点开核对——这本身就是这篇文章的方法示范。
三起事故
德勤:给澳大利亚政府的 237 页报告,退了钱
2025 年 7 月,德勤向澳大利亚就业与职场关系部交付了一份 237 页的报告,审查其福利合规框架。合同金额 29 万澳元。
同年 8 月底,悉尼大学研究健康与福利法的研究者 Chris Rudge 发现了问题并向媒体反映:报告里有编造的学术引用、不存在的研究论文,以及安在一位联邦法院法官头上的假引语。还有一位悉尼大学教授的名字被挂在了一本她从未写过、且不属于她研究领域的书上。
9 月 26 日,德勤发布了修订版。德勤披露报告的撰写用到了 Azure OpenAI,并表示「这些更新完全不影响报告的实质内容、结论与建议」。德勤最终同意退还合同的最后一期款项。
毕马威:客户自己站出来说「我们没这么干过」
2025 年 10 月,毕马威发布报告《Redefining excellence in the age of agentic AI》。
报告里描述了多家机构的 AI 应用情况。问题是:瑞银(UBS)、英国国民保健署(NHS)、瑞士联邦铁路、伦敦交通局,全都表示报告中关于他们的说法要么是假的,要么具有误导性。
AI 检测机构 GPTZero 认定这些错误源自 AI 幻觉。换句话说:一家四大用 AI 写了一份关于 AI 的报告,而没有做核查。
2026 年 6 月,毕马威撤下该报告并展开内部调查。其声明是:
「我们要求所有员工遵守我们关于负责任使用 AI 的指引,包括由人工监督来验证内容、核实独立来源。」
安永加拿大:27 条引用里 16 条是编的
这一起最触目惊心,因为有精确的数字。
安永加拿大发布了一份名为《Points of Attack: Uncovering Cyber Threats and Fraud in Loyalty Systems》的研究,用于为其网络安全业务做市场推广。
2026 年 5 月 14 日,GPTZero 发布检测结果:
| 检测项 | 结果 |
|---|---|
| 引用总数 | 27 条 |
| 编造的引用 | 16 条(59%) |
| AI 生成占比 | 72% |
| 失效或内容对不上的脚注 | 半打以上 |
其中最有代表性的一处:报告引用了一份根本不存在的麦肯锡报告,用它来支撑全球未兑换忠诚度积分的规模。
而报告内部的数字本身也对不上:一处写全球忠诚度计划市场规模 2,000 亿美元,另一处写全球未兑换积分 也是 2,000 亿美元。
两个本该完全不同的量,撞出了同一个数——这本身就是编造的痕迹。 一个真做过测算的人不会写出这种巧合;一个在补全句子的模型会。
安永随后下架该研究,并表示正在审查这份研究为何得以发布。
不只是咨询公司
如果你觉得这是咨询行业特有的松懈,学术界的数据更难看。
GPTZero 用他们的引用核查工具扫了两批学术论文:
| 会议 | 扫描量 | 含编造引用的论文 | 发布 |
|---|---|---|---|
| ICLR 2026 投稿 | 300 篇(总投稿约 2 万篇) | 50 篇 | 2025-12-05 |
| NeurIPS 2025 已录用论文 | 4,841 篇(共 5,290 篇) | 53 篇,100+ 处 | 2026-01-21 |
ICLR 那批里最值得注意的一句:每一篇被标记出问题的论文,此前都已经过 3–5 位同行专家评审,没有一个人发现。其中若干篇的平均评分是 8/10——按 GPTZero 的说法,若无干预「几乎肯定会被发表」。
GPTZero 把这种现象叫做 “vibe citing”:乍看之下准确无误,一细究就散架。
编造引用有三种典型形态,值得记住:
- 完全虚构的作者与编号——比如作者写成「John Doe 和 Jane Smith」,配一个假的 arXiv 编号
- 真作者配错元数据——真实存在的作者,被安上错误的标题、期刊、年份或页码。这一类最危险,因为搜作者名能搜到人。
- 占位符没被替换——「Firstname Lastname」、「arXiv:2305.XXXX」、「待更新」
为什么最可能翻车的恰恰是最像样的那部分
有一个反直觉的地方值得说清楚。
编造的引用不是模型偷懒的产物,它恰恰是模型「努力满足你要求」的产物。你说「给这个论断加一条权威来源」,模型知道这类论断通常配什么样的来源——一份麦肯锡报告、一位某领域教授的著作——于是它生成了一条形态完全正确的引用。作者是真的领域内学者,期刊是真存在的期刊,格式挑不出毛病。只有这条引用本身不存在。
这就是半人马与赛博格那篇讲的「在方向盘前睡着」:AI 越是答得流畅、格式越是规整,人越不去查。 BCG 那项实验里,用了 AI 的顾问在一道 AI 会答错的题上,正确率从 84% 掉到 60–70%——不是因为他们变笨了,而是因为答案看起来太像对的了。
交付前的核查清单
下面这份可以直接贴进你的交付流程。它不解决全部问题,但上面三起事故如果做了这几条,一起都不会发生。
第一层:让它自己先招
把这份稿子里所有的引用、数据和事实性陈述列成一张表,每行包含: | 出现位置 | 原句 | 类型(引用/数字/事实陈述) | 来源 | 我的确信度 | 规则: - 「来源」一栏必须是我提供的材料里能找到的具体位置(页码/文件名/段落), 或者一个可点开的 URL。**不要写「行业共识」「普遍认为」这类。** - 凡是你**不是从我给的材料里读到**、而是从自己的知识里写出来的, 确信度一栏写「未经核实」,不要写高。 - 如果某条来源你无法给出具体位置,就直接标「无来源」。 **标「无来源」不是失败,漏标才是。**
复制为纯文本,换行与缩进原样保留,可直接粘贴进对话框。
为什么先做这一步:你要核查的不是整篇稿子,是这张表。把核查范围从一万字压到二十行。
第二层:人工核,按风险排序
按这个顺序核,时间不够就从上往下核到哪儿算哪儿:
| 优先级 | 核什么 | 为什么排这个位置 |
|---|---|---|
| 1 | 所有外部机构的报告引用(麦肯锡、Gartner、各协会) | 安永就栽在这里。这类最容易编,也最容易被客户查 |
| 2 | 具体到个位数的数字(「增长 27.3%」) | 越精确的数字越像真的,也越容易是编的 |
| 3 | 具名的人和他说的话 | 德勤那起里有安在法官头上的假引语。这是法律风险,不只是错误 |
| 4 | 关于客户和第三方机构的描述 | 毕马威那起是被瑞银、NHS 亲自否认的。被描述的人会看到 |
| 5 | 页码、卷号、DOI | 最不容易被发现,但一旦被抓就最难解释 |
核的方法很朴素:把标题原文粘进搜索框。 搜不到就是搜不到。不要因为「这个来源看起来很合理」就放过。
第三层:两条硬规矩
① 链接必须点开过。 不是「看起来对」,是点开过、看到那句话在那一页上。GPTZero 在安永那份里发现半打以上脚注指向失效页面或页面上根本没有被引用的内容——这些只要点一下就会露馅。
② 交付物里不出现你没读过的来源。 如果一条引用你无法在一分钟内找到原文,删掉这个论断,或者换一个你能证实的论据。 一条查不到的引用带来的风险,远大于它支撑的那句话带来的价值。
最后一句
毕马威的声明里那半句写得其实很准:
「包括由人工监督来验证内容、核实独立来源。」
这句话没有错。问题在于,它是在报告被撤下之后说的。
这一行卖的是判断力。一条编造的引用摧毁的不是那一页,是客户对整份交付物的信任——他会开始想,还有多少是编的。
配套阅读:引用功能:让每一句结论都能指回原文、这份研究说的是因果,还是只是相关?、让它上网查资料:四种方式。
出处
本文为原创整理,事实来源如下,均可点开核对:
- 德勤:Fortune, 2025-10-07
- 毕马威:TechCrunch, 2026-06-13
- 安永加拿大:Consulting.ca, 2026-05-19
- NeurIPS 2025 检测:GPTZero, 2026-01-21
- ICLR 2026 检测:GPTZero, 2025-12-05