判断已覆盖范围,不能只看扫描进度条或已抓取数量,而要看工具是否留下了可核对的URL清单、状态码和抓取时间。若扫描中断后工具保留了断点或分批记录,可以按批次续扫并核对遗漏;若只显示一个汇总数字、没有逐条记录,就应把这次结果视为不完整样本,重新规划一次范围更小的扫描,而不是直接用它下结论。
这是决定下一步怎么做的第一个分叉。有逐条记录时,工具通常会为每个URL保留地址、HTTP状态、抓取时间和发现来源。你可以按抓取时间排序,找出中断前最后一批成功处理的URL,再与站点地图、内部链接列表或服务器日志中的URL集合做差集。差集里那些从未出现在记录中的地址,就是需要补扫的范围。
只有汇总数字时,情况不同。比如界面显示“已扫描 12,000 个URL”,但没有列表、没有分批标记,你无法知道这12,000个具体是哪些,也无法判断剩余部分是漏抓还是重复。此时继续点击“续扫”可能从零开始,也可能跳过一部分,结果不可预期。更稳妥的动作是缩小入口范围,例如按目录或子域分批扫描,让每一批都能留下可核对的记录。
无论哪种中断,都可以用以下三类证据交叉判断,而不是依赖单一数字:
把期望集合与实际记录做差集,得到的未覆盖URL才是补扫目标。如果三者互相矛盾,例如日志显示请求过某路径但工具列表里没有,优先怀疑工具在写入记录前中断,而不是该页面不存在。
假设某站点有约 8,000 个可索引URL,一次全站扫描在约 40% 处中断。工具保留了分批记录,最后一批的时间戳集中在中断前两分钟,且能导出这批URL。此时合理动作是:导出已抓取列表,与站点地图做差集,只对差集部分发起一次新的、范围受限的扫描。这样做的结果是补扫量明显小于全站,且新旧记录可以按时间拼接,覆盖判断有据可依。
反过来,如果工具只显示“已扫描 3,200 个页面”且没有列表,那么续扫的起点不确定。此时更合理的动作是放弃这次汇总结果,改为按目录分四到五批重新扫描,每批单独导出。代价是总耗时增加,但换来的是每一批都有明确边界,后续判断不再依赖一个无法追溯的数字。
中断结果并非一律作废。若你的目的只是发现某类问题的存在,而不是统计全站比例,部分覆盖也可能够用。例如你想确认是否存在大量指向404的内部链接,只要已扫描部分覆盖了主要导航和列表页,发现的样本就能提示问题方向。但要注意:这只能说明“存在”,不能说明“占比多少”。
例外条件是:当决策依赖全站比例、收录覆盖率或重复内容规模时,部分扫描不能替代全量结果。此时应补扫或重扫,而不是用已覆盖部分外推。请求量或抓取量归零也不能单独证明扫描已完成或处理正确,它还可能由爬虫限速、服务器拒绝、任务被手动停止或日志未记录等原因造成,需要结合记录与日志判断。
完成这三步后,你对覆盖范围的判断就不再依赖进度条,而是基于可核对的URL集合。后续无论是修复问题还是评估收录,都能明确哪些结论有数据支撑、哪些仍需补扫确认。