Turn 20 PDFs into a citable, traceable corpus

Every claim links back to a page number — built for cross-checked work.

2026/07/026 min readEdited by HiBridge
TranslationThis entry is a Chinese translation of an English original. Author and link below.
Author
Anthropic
Title
Turn 20 PDFs into a citable, traceable corpus
Published in
Anthropic
Published on
2026/07/02

The article body is in Chinese. Original English source is linked above.

咨询项目里最常见的返工,是交付前被问「这个数据哪来的」而答不上来。资料读完了、结论写出来了,但引用链断在中间

这套流程的目标只有一个:任何一条结论,都能在三次点击内回到原文的具体页码。

流程

  1. 统一入库前先加标识 每份 PDF 在导入时就固定一个短代号(如 R01R20),后续所有引用都用这个代号,不用文件名——文件名会变,代号不会。

  2. 要求模型输出时强制带定位 每条摘录必须附 代号 + 页码。没有定位的摘录一律视为无效,要求重出。

  3. 建立一次交叉核查 把所有摘录汇总后,抽查 10% 回原文验证。错误率高于 10% 就说明流程有问题,不要继续往下做。

检查点

  • 模型给出页码但页码不存在,是常见的幻觉形式,抽查必须做
  • 代号一旦定下不要改,否则前面所有引用失效