用录像做研究:焦点小组、用户测试、工作坊便利贴
Google 官方 Cookbook。在视频里搜特定事件并带回时间码、把满墙便利贴转成表格、梳理用户测试录像的关键动作。以及一个必须知道的限制:默认每秒只取一帧。
- 原作者
- 原文标题
- Video understanding with Gemini
- 原发布平台
- Google Gemini Cookbook
- 原发布日期
- 2026/08/06
译者说明:本文译自 Google 官方 Gemini Cookbook 的视频理解指南,并综合了同一仓库中视频摘要示例里的关键限制说明。原文为 Colab notebook,此处翻译说明性内容与提示词。
用 Gemini 理解视频
Gemini 从一开始就是多模态模型,能够借助长上下文窗口分析各类媒介。
本文展示几种视频分析的做法,每一种都有对应的提示词。
一、在视频里搜索
让模型在录像里找出特定事件,并带回时间码。
原文用的提示词:
For each scene in this video, generate captions that describe the scene along with any spoken text placed in quotation marks. Place each caption into an object with the timecode of the caption in the video.
复制为纯文本,换行与缩进原样保留,可直接粘贴进对话框。
中文对照:
为这段视频中的每一个场景生成说明文字,描述该场景, 并把其中的口头表述放在引号里。 把每条说明放进一个对象中,附上它在视频中的时间码。
复制为纯文本,换行与缩进原样保留,可直接粘贴进对话框。
这里用的提示词相当通用,但如果你按自己的需要定制,可以得到更好的结果(比如明确指定只找某一类目标)。
原文提到,AI Studio 上的演示展示了如何对这个输出做后处理——点击时间码就能直接跳到视频的对应位置。
二、提取并组织文字
模型不仅能读出视频里的文字,还能有条理地把它们整理出来,甚至基于内容做进一步推理。
原文的例子是一面贴满便利贴的墙:
Transcribe the sticky notes, organize them and put it in a table. Can you come up with a few additional user stories of your own?
复制为纯文本,换行与缩进原样保留,可直接粘贴进对话框。
把这些便利贴转录出来,整理好,放进一张表格里。 你能再补充几条你自己想到的用户故事吗?
复制为纯文本,换行与缩进原样保留,可直接粘贴进对话框。
三、结构化真实世界的信息
模型不只能读文字,还能对现实中的物体做推理和结构化。原文的例子是一批带手写价签和备注的陶器:
Give me a table of my items and notes
复制为纯文本,换行与缩进原样保留,可直接粘贴进对话框。
如你所见,Gemini 能够把每一条备注和对应的物件准确对上,包括最后那一条。
四、分析屏幕录像,找出关键时刻
你也可以用模型来分析屏幕录像。假设你在做用户研究,观察人们如何使用你的产品,于是你手上积累了大量屏幕录像,需要人工一段段去梳理。
只用一个提示词,模型就能把视频里的所有操作描述出来。
五、分析 YouTube 视频
除了自己的视频,你也可以让 Gemini 直接获取并分析 YouTube 上的视频。
六、摘要
Generate a paragraph that summarizes this video. Keep it to 3 to 5 sentences with corresponding timestamps.
复制为纯文本,换行与缩进原样保留,可直接粘贴进对话框。
生成一段总结这个视频的文字。控制在 3 到 5 句,并附上对应的时间戳。
复制为纯文本,换行与缩进原样保留,可直接粘贴进对话框。
⚠️ 一个必须知道的限制
Gemini API 每秒只取视频的一帧。这可能导致模型看不到全部发生的事情,尤其是那些只出现了几分之一秒的内容。
这一条决定了哪些分析可靠、哪些不可靠。
好消息是可以调整。 原文提到 API 允许定义预处理步骤:
你可以使用剪辑区间(定义时间偏移以聚焦视频的特定部分)和自定义 FPS(定义分析视频时考虑多少帧)。
注:视频元数据功能(剪辑区间与 FPS 配置)在部分较新的接口形态中尚未提供,具体以官方文档为准。
译后附记:定性研究里怎么用
这一篇是所有 Cookbook 里与定性研究贴得最近的一篇。四个直接对应的场景:
场景一:工作坊的便利贴墙
这是最省力气的一个。共创工作坊结束,墙上一两百张便利贴,按惯例要有人拍照回去逐张录入。
拍一段视频,一个提示词,直接出表格。
把视频里所有便利贴的内容转录出来,整理成表格: | 区域/分组 | 便利贴原文 | 我的归类建议 | 要求: - 保留原始措辞,不要润色,不要合并相似项 - 看不清的写 [不清楚],不要猜 - 归类建议单独放一列,不要和原文混在一起
复制为纯文本,换行与缩进原样保留,可直接粘贴进对话框。
「不要合并相似项」这条很重要。 两张看起来相似的便利贴,可能来自不同的人、代表不同的强度——合并了就丢失了分布信息。
场景二:用户测试的屏幕录像
原文点名了这个场景。一场可用性测试录了 45 分钟,你要找的是「他在哪里卡住了」。
梳理这段用户测试录像,按时间顺序输出: | 时间码 | 用户的操作 | 是否出现犹豫/反复/退回 | 口头表述(原话) | 重点标出:停顿超过 5 秒、同一操作重复两次以上、明显走了回头路的位置。
复制为纯文本,换行与缩进原样保留,可直接粘贴进对话框。
时间码是关键产出。 它让你可以只回看那几个卡点,而不是重看 45 分钟。
场景三:焦点小组录像
这里要特别注意那个每秒一帧的限制。
- ✅ 可靠:谁在什么时候说了什么、讨论的话题流转、明显的肢体动作
- ⚠️ 不可靠:微表情、瞬间的皱眉、一闪而过的犹豫
默认帧率下,非语言信号会被大量漏掉。 如果你的分析依赖这些,要么调高 FPS,要么这部分还是人来看。
一个务实的分法:用模型做「话题地图 + 时间码」,人只看模型标出来的那几段。
场景四:竞品的产品视频、发布会
公开的产品演示、发布会录像,让它带时间码地摘出来,比自己看快得多。
三条使用纪律
一、时间码是你的锚。 凡是要写进报告的观察,都应该能指回视频的某个时间点。要求它输出时间码,比要求它输出结论重要。
二、原话和归类要分开。 让它在同一张表里既给原话又给判断,但放在不同列。你随时能看到它的判断建立在哪句话上。
三、涉及受访者影像的合规先过一遍。 焦点小组和用户测试录像里有可识别的个人影像,把它传给第三方服务之前,先确认知情同意书的范围和公司的数据处理规定覆盖得住。这一步不是技术问题,但它在技术之前。