用 Claude 做文档摘要

Anthropic 官方 Cookbook。从基础摘要到引导式、领域定制与元摘要,含长文档处理和一套评估思路。原文以法律文件为例,方法适用于任何冗长的专业文档。

2026/08/05约 9 分钟HiBridge 编译
译文本文是英文原文的中文翻译,原作者与原文链接如下。
原作者
Anthropic
原文标题
Summarization with Claude
原发布平台
Anthropic Claude Cookbooks
原发布日期
2026/08/05

译者说明:本文译自 Anthropic 官方 Claude Cookbooks 的摘要指南。原文为 Jupyter Notebook,以法律文件(转租协议)为例,含完整的 Python 代码与评估流程;此处翻译全部说明性内容与方法,代码细节请见原文。

用 Claude 做文档摘要

引言

摘要是自然语言处理中的一项关键任务:把大量文本压缩成更短、更易消化的形式,同时保留关键信息。在今天这个信息过载的世界里,快速从冗长文档中提取并综合要点的能力,在各行各业都极有价值。

本指南聚焦于用 Claude 做摘要,尤其以法律文件为例。法律文件往往冗长、读起来乏味——特别是当其中充斥着小字条款和法律术语时。我们会探讨如何有效地摘要这类文档、如何评估摘要质量,以及如何系统性地改进摘要表现。

涵盖的关键内容:

  • 为摘要任务写出有效的提示词
  • 从文档中提取特定的元数据
  • 处理超出常规 token 限制的长文档
  • 用自动化方法评估摘要质量
  • 迭代改进摘要表现
  • 优化摘要工作流的通用建议

先说说「评估」这件事

评估摘要质量是出了名的难。 与许多其他自然语言处理任务不同,摘要评估往往缺乏清晰、客观的指标。这个过程可能高度主观——不同的读者看重摘要的不同方面。

传统的经验性方法(如 ROUGE 分数)虽然有用,但在捕捉连贯性、事实准确性、相关性这类微妙维度上有局限。而且,「最好的摘要」会随着具体用途、目标受众、期望的详略程度而变化。

尽管有这些困难,本指南仍探索了若干可用的方法,结合自动化指标、正则表达式和任务特定的标准。我们认为,最有效的方式往往是针对手头具体摘要任务、量身组合多种技术


基础摘要

先用 Claude 写一个简单的摘要函数。

这看起来很基础,但其实已经用上了 Claude 的几个重要功能。值得注意的一点是 assistant 角色与停止序列(stop sequences)的使用:assistant 的前置内容让 Claude 在 <summary> 之后直接续写摘要,而停止序列 </summary> 则告诉 Claude 到此停止生成。这个模式在本指南中会反复使用。

这个基础做法能给出简单的摘要,但它可能捕捉不到法律或财务文档所需的全部细节。而且你会注意到:重复运行时,输出没有标准化的格式。我们得到的是一段基础摘要,缺少可解析的结构。

这让摘要更难阅读、更难信任(我们怎么知道它没漏掉什么?),因而在真实场景中更难使用。

多示例摘要(Multi-Shot)

能这么快地摘要大部头文档已经很酷了,但我们可以做得更好。在提示词里加入几个示例,看看能否改善输出、并让输出带上一点结构。

注意,这里并没有真正改变请求的格式,只是追加了两样东西:

一、告诉模型「不要开场白」(do not preamble)。

当你想把模型输出约束成「只要答案」、去掉那种对话式的开场时,这通常是个好主意。在提示词里没有其他「指令」的时候,这一点尤其重要。

二、追加 3 个已摘要文档的示例。

这叫少样本(few-shot)或多样本(multi-shot)学习,能帮助模型理解我们想要什么。

结果很有意思:我们并没有显式规定格式,但输出的格式与我们提供的示例保持一致。


进阶技巧

引导式摘要(Guided Summarization)

引导式摘要是指为模型显式定义一个框架,让它在摘要任务中遵循。

这完全可以通过提示词实现:调整提示词的细节,引导 Claude 更详细或更简略、包含更多或更少的专业术语、给出更高或更低层级的概括。对法律文件,我们可以引导摘要聚焦于特定方面。

注:同样的格式化输出,很可能也能通过上面讲的「示例」方式达成。

领域定制的引导式摘要

上面那套引导式提示词可以用于任何类型的文档,但针对特定文档类型做定制会让它强大得多

例如,如果我们知道处理的是转租协议,就可以引导模型聚焦于该类文档最相关的法律术语和概念。这在你有明确用途、且清楚知道最需要提取哪些字段时最有价值。

元摘要:涵盖多份文档的上下文

如果我们有大量关于同一个客户的文档怎么办?可以用分块(chunking)方法处理。

这个技术把文档拆成更小、可管理的块,分别处理每一块,然后把各块的摘要合并成整体的元摘要

它在两种情况下特别有用:想要摘要大量文档,或者想要摘要一份非常长的单一文档


摘要索引文档:一种进阶的 RAG 方法

「摘要索引文档」是检索增强生成(RAG)的一种进阶做法,在文档层面运作

相比传统 RAG 技术,这个方法在处理大型文档、或对检索精度要求很高的场景下有若干优势。

它怎么工作

  1. 文档摘要:为语料库中的每一份文档生成简洁的摘要
  2. 上下文窗口优化:确保所有摘要能装进模型的上下文窗口
  3. 相关性打分:让模型对每份摘要与当前问题的相关性排序
  4. 重排序(可选):进一步精炼并压缩排名靠前的结果
  5. 回答问题

优势

  • 检索排序更高效,比传统 RAG 方法消耗更少的上下文
  • 在特定任务上表现更好:能稳定地把正确的文档排在第一位
  • 检索结果更优:重排序有助于压缩结果,确保呈现给模型的信息最简洁、最相关

评估

如引言所说,评估摘要质量是件难事。因为摘要一份文档有很多种方式,不同的摘要可能同样有效。取决于具体用途,摘要的不同侧面重要性也不同。

用 Jupyter Notebook 起步做提示词工程很不错,但随着数据集变大、提示词变多,需要借助能随你规模扩展的工具。原文中使用了开源的大模型评估工具 Promptfoo。

迭代改进

深入看评估结果,总还有改进空间。这就是提示词工程中「迭代」的部分。可以采取的步骤:

  1. 分析评估结果,找出强项与弱项。 比如某个「包含性」检查频繁失败,很可能是因为有些文档本就不含 XML 标签中要求的信息——那么该改进的是这条评估标准本身
  2. 针对具体问题精炼提示词(比如改善简洁度或完整性)。多样本是一个非常好的起步方案,应该与其他进阶技巧结合使用
  3. 对长文档尝试不同的分块策略
  4. 微调 temperature 和 max_tokens 参数
  5. 加入后处理步骤来提升摘要质量

结论与最佳实践

构建一套完美的摘要系统与评估框架是一门手艺:需要综合运用多种方法才能成功。

摘要是一个非常主观的话题,但我们仍然找到了可行的评估方式,并对结果感到踏实。

另外永远记住一点:

你不是在拿结果对标 100% 的准确率。你对标的是「这件复杂的事你自己能做到多好」。

结合 Claude 展现出的速度和效率,你会开始意识到这套方法论的真正价值所在——它让你把时间花在真正需要判断的地方。

六条最佳实践

  1. 写清晰、具体的提示词。 用「不要开场白」这类要求来约束输出
  2. 至少给 2 个示例
  3. 对领域专属的文档,使用引导式摘要
  4. 对长文档,实施有效的进阶策略
  5. 定期评估并优化你的方法
  6. 考虑 AI 生成摘要的伦理影响与局限

译后附记

原文以法律文件为例,但这套方法几乎原封不动地适用于研究咨询的日常:客户给的历史报告、行业白皮书、政策文件、竞品的公开材料。

三条对研究工作最直接的:

一、「不要开场白」加上示例,等于建立了交付格式标准。 团队里每个人做出来的摘要格式一致,这本身就是可观的效率。

二、元摘要(分块 + 合并)是处理「一个客户几十份材料」的正解。 不要试图一次塞进去。

三、最后那句话值得贴在墙上:对标的不是完美,是你自己做能做到多好。 一份 80 页的报告,你自己读完做摘要要三小时且同样会漏东西——这才是真正的基准线。