译者说明:译自 OpenAI 官方 Cookbook。原文是可运行的 notebook,此处翻译全部说明性内容,接口名与参数原样保留。 这一篇对做访谈和做会议纪要的人价值最高,尤其是最后那几条限制——它们不是技术细节,是合规和责任的边界。
关于日期:Cookbook 是持续更新的仓库,页面上没有发布日期。本文的日期取自 OpenAI 官方 Cookbook 索引(
registry.yaml)里为这一篇登记的日期,也就是这份内容第一次被生产出来的时间。
整条链路
原文描述的是一套会后处理的完整流水线,六层:
- 收音频 —— 一段录音,外加(可选的)几段已知说话人的样本片段
- 跑批 —— 校验输入、把样本编码好、调接口
- 分离说话人 —— 调用带分离能力的转录接口
- 整理成稿 —— 把接口的输出整理成统一的结构,每一段有一个稳定的编号
- 提炼 —— 抽出摘要、已定的事、待办、风险、未决问题,以及一封跟进邮件
- 护栏与人工复核 —— 脱敏、核对引用、必要时过一遍内容审核
第 4 步那个「稳定的编号」是后面所有事的地基,下面会讲到。
分离说话人到底带来了什么
不给样本的话,它只能标成「说话人 0」「说话人 1」这种。给了已知说话人的样本,它才能对上名字。
原文说得很实在:
分清说话人,是为了让后面所有的东西有结构。
具体是三件事:
- 待办能归到人头上 —— 是谁答应的
- 风险能引用客户的原话 —— 而不是转述
- 跟进邮件不会张冠李戴
第三条对做访谈的人尤其要紧。一份把 A 的观点安到 B 头上的纪要,比没有纪要更糟——它会被当成事实往下传。
让它没法瞎编的那个设计
这是全篇最值得学的一处。
原文的输出结构里,强制要求每一条结论都带上「证据引用」:引用哪一段(用那个稳定的编号)、原话是什么。
然后在护栏那一步,逐条去核对:这句引用的原话,真的在它说的那一段里吗?
对不上的,直接判定不合格。
这等于把「不许瞎编」从一句嘱咐,变成了一道能自动检查的关卡。
(站上有一篇讲同一个问题的:编造的引文。)
几条必须知道的限制
原文列的这几条,都不是可以「以后再说」的技术细节:
① 脱敏那段代码只是示意。 它只遮基本的邮箱和电话格式。姓名、地址、以及受监管的数据,需要经过政策审核的专门工具。 别把它当成合规方案。
② 说话人的样本片段是敏感数据。 原文的措辞是「按接近生物特征的数据对待」:片段要短(2–10 秒)、单人、并且尽量少留存。
③ 说话人的对应关系不会跨会议记住。 每一次新录音都要重新提交样本。
④ 文件大小有上限,长录音要注意超时设置。
⑤ 原始的转录返回默认不要存。 而且如果结果要写进客户管理系统或者工单系统,风险中高或者证据缺失的,必须过人工复核这一关。
为什么这几条限制值得单独读一遍
因为它们说的其实是同一件事:
这条链路处理的是别人的声音和别人说过的话,而这两样都不是你的。
技术上能做到,和你有没有资格这么做、需不需要告知对方、留存多久,是几个分开的问题。原文把这几条写在正文里而不是免责声明里,这个处理本身就值得学。
做定性研究的人对这件事应该最敏感——对受访者的承诺,是这一行的地基。