判断已覆盖范围,不能只看扫描进度条停在哪里,而要把“已处理清单”“未处理清单”和“可复核的原始记录”三者对齐。若工具在中断时只留下了汇总数字,没有逐页状态,就应把这次扫描视为部分覆盖,先圈定可确认的页面集合,再决定是续扫、重扫还是缩小范围。
全站扫描被中断后,最容易出现的矛盾是:界面显示已处理了大半,但导出结果里只有少量页面带有完整数据。这里通常有两种解释。
第一种解释是“进度统计的是任务队列,不是完成结果”。工具可能先把大量网址放入待处理队列,进度按出队或请求发出计算,而解析、入库、去重发生在后面。中断时,队列消耗了很多,真正落库的结果却不多。
第二种解释是“扫描确实覆盖了大部分页面,但结果被过滤或合并了”。例如重复标题、参数化网址、跳转页、无索引页被折叠,导出时只保留代表页。此时覆盖范围并不小,只是可见结果变少。
这两种解释会导向完全不同的下一步:前者需要补扫或重扫,后者只需要调整导出条件和核对规则。
要区分上面两种情况,优先找四类证据。
一个可操作的判断动作是:从站点地图或站内链接中抽取一批已知存在的网址,与扫描结果逐条比对。若这些已知网址大量缺失,且缺失集中在中断时间点之后,更符合“队列未完成”;若它们大多存在,只是以合并页形式出现,更符合“结果被折叠”。这个比对结果会直接决定下一步是续扫还是改导出规则。
在决定续扫之前,先把当前能确认的范围固定下来。建议至少记录以下字段:网址、最终网址、状态码、抓取时间、是否入库、是否被过滤、过滤原因。若工具支持导出,就导出这些字段;若不支持,就用已知网址抽样建立一个小型对照表。
这里要注明假设:假设站点有可用的站点地图,且站点地图中的网址与线上实际可访问页面基本一致。在这个假设下,用站点地图总量减去已确认入库量,可以估算未覆盖规模。但这个差值只能作为排查线索,不能单独证明哪些页面一定没被处理,因为站点地图本身可能过期,也可能包含已下线页面。
另一个实际动作是检查中断发生前后的批次边界。如果工具按目录、分页或网址前缀分批处理,找到最后一批完整入库的记录,就能把“已覆盖范围”收缩到该批次之前。这样续扫时可以从下一批开始,而不是整站重来。若找不到批次边界,重扫虽然更稳妥,但会消耗更多时间,并可能覆盖掉上一次的部分原始记录,因此应先导出再重扫。
三种处理方式各有适用条件。
如果这次扫描的目的只是为旧内容退出做判断,那么不必追求全站覆盖。先确认哪些栏目、哪些模板、哪些合作关系对应的页面仍需保留,再只扫描保留集合,往往比补齐全站更符合决策需要。反之,如果目的是建立全站基线,就必须补齐逐页状态,否则中断后的汇总数字不足以支撑后续比较。
覆盖范围判断清楚后,下一步会变得具体。若已确认覆盖的是保留页面集合中的大部分,就可以进入内容取舍和链接处理;若已确认覆盖只到某个批次,就应先补扫该批次之后的保留页面;若无法确认覆盖范围,就应把这次结果降级为参考,不用于删除、合并或退出决策。
需要提醒的是,请求量、抓取量或某项统计归零,不能单独证明处理正确。它还可能来自网络中断、权限变化、工具限流、站点屏蔽或任务被手动停止。只有把逐页状态、时间戳和原始响应记录放在一起核对,才能判断已覆盖范围是否足以支撑下一步动作。