Turn 20 PDFs into a citable, traceable corpus
Every claim links back to a page number — built for cross-checked work.
2026/07/026 min readEdited by HiBridge
TranslationThis entry is a Chinese translation of an English original. Author and link below.
- Author
- Anthropic
- Title
- Turn 20 PDFs into a citable, traceable corpus
- Published in
- Anthropic
- Published on
- 2026/07/02
The article body is in Chinese. Original English source is linked above.
咨询项目里最常见的返工,是交付前被问「这个数据哪来的」而答不上来。资料读完了、结论写出来了,但引用链断在中间。
这套流程的目标只有一个:任何一条结论,都能在三次点击内回到原文的具体页码。
流程
-
统一入库前先加标识 每份 PDF 在导入时就固定一个短代号(如
R01–R20),后续所有引用都用这个代号,不用文件名——文件名会变,代号不会。 -
要求模型输出时强制带定位 每条摘录必须附
代号 + 页码。没有定位的摘录一律视为无效,要求重出。 -
建立一次交叉核查 把所有摘录汇总后,抽查 10% 回原文验证。错误率高于 10% 就说明流程有问题,不要继续往下做。
检查点
- 模型给出页码但页码不存在,是常见的幻觉形式,抽查必须做
- 代号一旦定下不要改,否则前面所有引用失效