Whisper 的 prompt 参数:用它锁住人名和品牌的拼写

OpenAI 官方 Cookbook。转录 API 有个 prompt 参数,但它和给 GPT 写提示词完全是两回事——它跟随的是风格,不是指令。而且只认最后 224 个 token。

2026/08/06约 6 分钟HiBridge 编译
译文本文是英文原文的中文翻译,原作者与原文链接如下。
原作者
OpenAI
原文标题
Whisper prompting guide
原发布平台
OpenAI Cookbook
原发布日期
2026/08/06

译者说明:本文译自 OpenAI 官方 Cookbook。原文为 Jupyter Notebook,含可运行代码与音频示例;此处翻译全部说明性内容。

Whisper 提示词指南

OpenAI 的音频转录 API 有一个可选参数叫 prompt

这个参数的本意是帮助拼接多个音频片段:把上一段的转录稿通过 prompt 提交进去,Whisper 模型就能利用这个上下文更好地理解语音,并保持一致的书写风格。

但提示词不必是真实的前段转录稿。 你可以提交虚构的提示词,来引导模型使用特定的拼写或风格。

本文分享两种用虚构提示词引导输出的技术:

  • 转录稿生成:用 GPT 把指令转换成虚构的转录稿,供 Whisper 模仿
  • 拼写指南:告诉模型人名、产品名、公司名该怎么拼

这些技术并不是特别可靠,但在某些情况下很有用。

和给 GPT 写提示词的区别

给 Whisper 写提示词,和给 GPT 写提示词不是一回事。

举例来说,如果你提交一条类似「用 Markdown 格式排列表」的指令,模型不会照做——因为它跟随的是提示词的风格,而不是其中包含的任何指令

此外,提示词限制在 224 个 token 以内。如果提示词超过 224 个 token,只有最后 224 个 token 会被考虑;之前的全部被静默忽略。

要得到好结果,请精心构造能体现你所需风格的示例

转录稿会跟随提示词的风格

原文用一段播客做基线测试:在无提示词的转录里,「President Biden」是首字母大写的。

试着用提示词让它写成小写的 “president biden”——先传一个小写的 president biden 作为提示词,看 Whisper 会不会匹配这个风格。

要注意,当提示词很短时,Whisper 跟随其风格的可靠性较低。较长的提示词在引导 Whisper 时可能更可靠。

换成更长的提示词再试一次,效果更好。

另外值得注意的是,对于那些罕见的、不像正常转录稿的古怪风格,Whisper 不太会跟随。

传入名称,防止拼写错误

Whisper 可能会把不常见的专有名词转录错——比如产品名、公司名、人名。

用提示词可以纠正这些拼写。

原文用一段满是产品名的音频做演示:把产品名和公司名作为一份术语表传进提示词,让 Whisper 遵循。

接着换到另一段专门录制的音频(关于一场古怪的烧烤):

虽然 Whisper 的转录是准确的,但它不得不猜测各种拼写。例如,它假设两位朋友的名字拼作 Amy 和 Sean,而实际上是 Aimee 和 Shawn

传入正确拼写之后:

成功了!

原文接着用更容易产生歧义的词做了同样的测试。

可以用 GPT 生成虚构提示词

生成虚构提示词的一个可行工具就是 GPT:给它指令,让它生成较长的虚构转录稿,再用这些稿子去提示 Whisper。

一条重要边界

Whisper 提示词最适合用来指定那些原本存在歧义的风格

提示词不会覆盖模型对音频本身的理解。 例如,如果说话人并没有浓重的南方口音,提示词不会让转录稿变成那样。


译后附记:研究访谈怎么用

这篇和转录访谈时模型为什么会把品牌名听成别的是配套的——那篇讲机制和通用做法,这篇是它在 Whisper 上的具体实现

核心用法:一份拼写表

转录深访之前,先准备好这次会出现的专有名词:

Aimee, Shawn, 品牌甲, 品牌乙, XJ-200, 华东大区, 私域运营

把它作为 prompt 传进去。Whisper 会照着这个拼写走。

三条要记住的差异

一、它跟随风格,不执行指令。

❌ 「请把品牌名都拼写正确」——这句话本身没用,它不会读懂这是一条指令 ✅ 直接把正确的拼写写出来,让它模仿

二、224 token 的硬限制,超出部分静默丢弃。

这条很坑:你不会收到任何报错,只是前面的内容被无声地忽略了。

推论:把最重要的词放在最后。 如果术语表太长,按重要性排序,最关键的那几个放在末尾。

三、短提示词不可靠,长的更稳。

只传三个词可能引导不动。把术语表写成一段自然的句子,效果通常比裸列几个词好:

本次访谈涉及 Aimee 与 Shawn 两位受访者,讨论了品牌甲的 XJ-200 型号
在华东大区的私域运营情况。

这样既在 224 token 内,又给了足够的语境。

一个务实的流程

  1. 访谈前:从提纲和客户资料里摘出专有名词,写成一段话
  2. 转录时:作为 prompt 传入
  3. 转录后:把这段话里的每个词在转录稿里搜一遍,确认拼写一致
  4. 仍然要抽查——提示词不会覆盖它对音频的理解,听不清的地方它还是会猜

第 3 步只需要一分钟,但它是这套做法唯一的验证环节。没有这一步,你不知道提示词有没有起作用。