让它上网查资料:四种方式,各管一段
搜公开信息、读一个已知网址、进需要登录的数据库、把 PDF 转成可检索的文字——这是四件不同的事,走的是四条不同的路。用错了就会卡住。
「让 AI 帮我上网查」听起来是一件事,实际上是四件,各自的机制和边界完全不同。
分不清的典型后果:你让它去查一个需要登录才能看的行业数据库,它兜了半天回来说找不到——不是它不会,是你让它走了错的那条路。
一个问题就能分流
这件事,需不需要进「你登录过的网站」?
| 情况 | 用哪条路 |
|---|---|
| 只是搜索、找信息、读一个公开网页 | 内置搜索与抓取 |
| 要进你登录的系统操作(行业数据库、客户门户、后台) | 浏览器控制 |
| 手上已经有文件,要转成能检索的文字 | 文件转换工具 |
| 需要某个专门服务的能力 | 对应的外接工具 |
一、内置搜索与抓取(零配置,最常用)
Claude Code 自带两个能力,不启动任何浏览器:
- 搜索——搜全网、找信息出处
- 抓取——拉取一个已知网址的正文内容
这是最轻、最快的一条路。日常的桌面研究——找行业报告、核实一个数据的出处、读一篇公开的白皮书——绝大多数都走这里。
它的边界:拿不到需要登录的内容,也拿不到重度依赖 JS 渲染的页面。
用它的时候,加一句话
查一下 <主题> 的公开资料。 要求: - 每条结论标出来源网址和发布日期 - 优先官方与一手来源,避免二手转述和聚合站 - 找不到可靠来源的,明确说找不到,不要用常识补
复制为纯文本,换行与缩进原样保留,可直接粘贴进对话框。
「标出发布日期」这条对研究工作特别重要。 这个领域的信息半衰期很短,一篇两年前的文章可能每个字都过时了,而它读起来和昨天发的没有区别。
二、浏览器控制(带登录态)
真的开一个浏览器,点击、填表、读页面、截图。
这条路解决的核心问题是「登录态」。 行业数据库、客户的内部门户、需要 SSO 的系统——这些内容内置抓取拿不到,因为它没有你的身份。
工作方式大致是:
- 用一个独立的浏览器配置,和你日常浏览器的数据分开——它只看得到你在这个配置里登录过的东西
- 有头模式:弹出可见的窗口,你能实时看着它每一步在干什么
- 登录态留存:你在那个窗口里手动登一次(含两步验证),之后跨会话复用,直到网站让会话过期
⚠️ 两点要注意。
一、这条路需要额外配置(通过 MCP 接入浏览器自动化能力),门槛比前一条高。
二、账号安全的边界要自己划清楚。 让它进你登录过的系统,等于把那个系统的操作权限交出去一段时间。用在只读的查询上是合理的;涉及提交、付款、删除的操作,应该自己来。
一个务实的用法
不必让它全程自动。你自己登录并导航到目标页面,然后让它读——这样既拿到了登录态背后的内容,又保留了你对操作路径的控制。
三、文件转换
把 PDF、Word、网页转成 Markdown 文字。
这个用途在研究工作里出现的频率被低估了。典型场景:
- 客户给了二十份 PDF 格式的历史报告,你要能全文检索
- 一份行业年鉴,要提取其中的表格
- 一批网页存档,要变成可以喂给模型的纯文本
转成文字之后,后续所有工作都便宜得多——检索、批量处理、交叉比对,都不用再反复解析原文件。
图表密集的 PDF 有更好的处理方式,见处理图表与幻灯片里的叙述法。
四、外接工具(MCP)
专用能力通过 MCP(一种标准的工具接入方式)挂载。文件转换本身就是其中一类,此外还有各种服务的官方接入。
判断标准很简单:如果某件事你要反复做、而且有一个专门的服务在做它,那大概率有对应的 MCP 可接。反之,偶尔做一次的事情,不值得为它配一套工具。
常见的三个误判
一、以为它「联网」就等于能看任何网页。
需要登录的、有反爬的、重度 JS 渲染的,内置抓取都拿不到。遇到「它说打不开」的时候,先想想这个页面你自己不登录能不能看。
二、让它搜,却不要求标注来源。
不要求的话,它会给你一段流畅的综述,其中哪句有据、哪句是模型自己补的,你分不出来。做研究,来源比结论重要。
三、忘了信息的时效。
它检索到的和它训练时记住的,会混在同一段回答里,而且语气一样自信。凡是涉及「现在是什么情况」的问题,都要求它标出日期和链接。
一个可以直接用的检索提示词
帮我调研 <主题>,用于 <具体用途,比如:给客户的行业背景章节>。 请按这个结构输出: 1. 核心结论(3–5 条,每条后面标 [来源编号]) 2. 来源清单:编号 | 标题 | 发布方 | 发布日期 | 网址 3. 存疑的地方:哪些结论只有单一来源、或来源之间互相矛盾 规则: - 只用你实际检索到的内容,不要用训练时的记忆补充 - 一手来源优先于媒体转述 - 发布日期早于 <你的时间下限> 的,标注「可能过时」 - 找不到可靠来源的问题,直接说找不到
复制为纯文本,换行与缩进原样保留,可直接粘贴进对话框。
第 3 条是这份提示词里最值钱的部分。「哪些结论只有单一来源」直接告诉你接下来该亲自去核哪几条——而这正是把一次 AI 检索变成可交付研究的那一步。