我们做了一批对外的页面:目录站收录、平台资料页、自己站上的内容。
然后花了很久才弄明白:「这个页面有没有用」这个问题,其实是三个问题。
三个层次
| 层 | 问的是 | 怎么查 |
|---|---|---|
| ① 存在 | 人打开能不能看到 | 直接打开 |
| ② 被索引 | 搜索引擎知不知道它 | 站点收录查询 |
| ③ 机器读得懂 | 抓取器能不能拿到正文 | 抓原始 HTML 看看正文在不在 |
这三层的原因和对策完全不同。 混在一起查,会在错的方向上花掉很多天。
我们踩过的三个坑
① 页面能打开,但抓取器拿不到正文。
有些站点的正文是打开之后再加载出来的。人用浏览器看没问题,用抓取工具去拿,拿到的是一个空壳。
排查线上文案的时候踩过这个:用浏览器逐页看,看到的是有内容的;而搜索引擎和 AI 看到的是空的。
② 页面被标记为「不要索引」,而我们不知道。
在一个平台上发布了内容,页面能打开、外观正常。但页面头部有一个标记,明确告诉搜索引擎不要收录它。
这个标记在浏览器里完全看不出来。要看源码才知道。
③ 后台状态说的不是我们以为的那件事。
这一条最贵。一个目录站的后台显示「处理中」,我们就一直等。
等了八天之后才发现:页面早就公开可访问了。
后台的状态字段说的是「你的请求处理到哪一步了」,不是「买家现在能看到什么」。
这两件事可以完全脱节。 而我们一直在看错的那个。
定下来的检查顺序
后来核对任何一个对外页面,都按这个顺序走:
第一步:直接打开。 能看到吗?
第二步:查收录。 搜索引擎知道它吗?
第三步:抓原始内容。 正文在不在返回的内容里?有没有「不要索引」的标记?
第四步(最容易漏):以第一到三步为准,不看后台状态。
那条最贵的教训
「我的检查没找到」不等于「东西不存在」。
有一次我们判断某个页面没被收录,理由是「我们的检测方法没查到」。
后来被一张截图纠正了——它在。是我们的查法有问题。
这条的一般形式是:一个否定的结论,比肯定的结论需要更强的证据。
说「它在」,找到一个例子就够了。 说「它不在」,你得证明你的查法能查到——而这一步几乎总是被跳过。
怎么补这个漏
用一个已知正常的对象做对照组。
想确认「我的检测方法能不能查到收录」,先拿一个你确定被收录了的页面去查一遍。查得到,你的方法才可信;查不到,说明是方法有问题,不是那个页面有问题。
对照组是排查里最便宜、也最值钱的一个动作。 它通常只多花两分钟,却能挡住整整一类的错误结论。