判断采集是否遗漏,核心不是看采集总量,而是做一次可复核的对照:用站点自己承认存在的URL集合,去比对采集结果里实际出现的URL集合,再对差集逐条判定是“真遗漏”“不该采”还是“口径不同”。下面用一个明确标为假设的例子说明步骤。
假设某站点有10个内容页,其中8个已发布、2个是草稿。做网站SEO检测时,先把“应被采集的URL”列成清单:这8个已发布页的规范地址。再把采集结果导出成另一份URL清单。两份清单都只保留去掉参数后的规范形式,然后做差集。
这一步的关键是:应采清单必须来自可核对的来源,例如站点地图、栏目列表页、后台已发布列表,而不是凭印象回忆。多人协作时,把这份清单固定成一份文件并注明生成时间,后续返工才有依据。
差集出来以后,不要直接报“遗漏N条”。对每一条候选做一次打开检查,结果通常落在三类里:
常见错误是跳过第二步,把所有差集都当成遗漏去补,结果把不该采的页面也拉进来,交付时反而说不清范围。另一个常见错误是只比数量不比URL:采集了100条、应采也是100条,看起来没漏,但实际是拿10条多余换了10条遗漏。
站内统计、搜索引擎报告和第三方估算流量的口径不同,不能互相替代。判断遗漏时,优先用能直接对照的证据:
如果某条URL在站点地图里有、列表页也有,但采集结果里没有,且单独打开返回成功,这就是一条证据链完整的遗漏。反之,只在第三方估算里看到流量、却找不到对应URL的,不能据此判定遗漏。
要减少返工,交付时把下面几项一起给出,接收方才能复核:
假设的例子里,10条URL中2条是草稿、1条是参数重复,最终真遗漏可能是1条。把这个拆解写清楚,比只报一个总数更有用,也更容易发现是采集规则问题还是清单本身写错了。
下一步:拿你手上最近一次采集结果,按上面的方式先做出应采清单和差集,再对前10条候选逐条判定,确认判定标准在团队内一致后再全量处理。