判断采集是否遗漏,不能只看收录总数,而要用“已知页面样本”去反查:从站内地图、内链和日志中抽取一批应当被采集的网址,逐个检查它们是否出现在目标搜索引擎的索引结果中。若样本中持续出现未被收录的网址,且排除robots、状态码、canonical等基础问题,就可以判断采集存在遗漏。下面这份清单按“要查什么、怎么查、结果说明什么”组织,时间和人手有限时可按顺序执行。
要查什么:你站点里哪些页面是真正希望被搜索引擎采集的。
怎么查:从XML站点地图中随机抽取30–50条网址,再叠加首页和栏目页中内链指向的详情页。两类来源都要取,因为站点地图代表你主动提交的范围,内链代表搜索引擎能自然爬到的范围。
结果说明什么:如果站点地图里的网址大量未被收录,而内链中的网址收录正常,问题更可能出在地图提交或地图本身的质量上;如果两类都遗漏,问题更可能在站点整体可抓取性,而不是提交渠道。
要查什么:样本中的每条网址是否真的进入了索引。
怎么查:对每条样本做两种查询。一是用site:加完整URL查询,看是否返回该页面;二是直接搜索页面标题或一段独特正文,看能否命中。两种方式结果不一致时,以精确URL查询为准,标题搜索容易受同质内容干扰。
结果说明什么:精确URL查询无结果,基本可判定该网址未被采集;有结果但标题或摘要明显错乱,说明已采集但解析异常,属于另一类问题,不要混入遗漏统计。样本遗漏比例较高时,才值得继续往下排查。
要查什么:搜索引擎的抓取行为是否覆盖了这些网址。
怎么查:在服务器日志中筛选目标搜索引擎的User-Agent,统计样本网址被请求的次数和返回状态码。重点看三类:从未被请求、被请求但返回非200、被请求且返回200。
结果说明什么:从未被请求,说明链接发现或抓取预算存在问题;被请求但返回非200,说明是站点响应问题导致采集失败;返回200却仍未收录,说明抓取成功但索引阶段被过滤,需要检查内容质量和重复度。这一步能把“采集遗漏”拆成可处理的具体环节。
要查什么:是否存在明确禁止或误导采集的配置。
怎么查:逐项检查样本页面的robots meta、X-Robots-Tag响应头、canonical标签指向、以及robots.txt是否误屏蔽了目录。canonical指向其他网址时,该页面即使被抓取也可能不被单独收录。
结果说明什么:任何一项命中,都足以解释该页面的遗漏,应先修复再重新观察。只有这些硬性设置全部正常,遗漏才更可能源于内容或链接层面的软性原因。
要查什么:遗漏是否集中在某类页面或某个目录。
怎么查:把样本按目录、模板、发布时间分组,统计各组的遗漏比例。站内统计和第三方估算流量的口径不同,只能用来观察趋势,不能用来反推具体某条网址是否被采集。
结果说明什么:如果遗漏集中在同一模板或同一批新页面,问题更可能是模板输出或抓取优先级;如果分散在各处,则应回到抓取日志和硬性设置继续排查。时间和人手有限时,优先处理遗漏比例最高且属于核心业务的那一组页面。
下一步:从上面五步中选出遗漏比例最高的一组样本,先修复硬性设置问题,再针对“抓了没收录”的页面补充独特内容或调整内链,隔一段时间后用同样的样本复查,确认遗漏是否收窄。