扫描中断后,先不要把“已扫到的条数”当成覆盖范围。更可靠的做法是:找到这次扫描的起点、遍历顺序和最后一条成功记录,再判断剩余部分是“从未开始”还是“已经开始但结果不完整”。只有把这两类分开,才能决定是续扫、重扫,还是只补一小段。
常见矛盾是:结果列表看起来已经覆盖了大半站点,但导出文件里的记录数明显偏少。有人据此认为“大部分已经扫完,只差尾部一点”,也有人认为“数据不可信,必须全部重来”。两种判断都可能出错,因为列表展示和实际落盘往往不是同一件事。
一种解释是遍历确实接近尾声,中断只发生在收尾阶段,剩余部分很小。另一种解释是扫描在早期就断了,界面上的结果只是缓存或分批展示,让人产生“已经扫了很多”的错觉。区分这两种情况,不能靠感觉,要靠可核对的顺序证据。
判断覆盖范围的前提,是知道这次扫描按什么顺序推进。常见顺序有三类:按站点地图或链接发现顺序、按栏目层级顺序、按已有内容清单顺序。顺序不同,“最后一条记录”代表的含义完全不同。
实际动作:先记下中断前最后一条成功记录对应的标识(URL、栏目或清单序号),再与扫描开始时的完整输入清单比对。这个动作的结果会直接决定下一步——如果剩余部分是连续的尾部,续扫成本低;如果剩余部分分散,续扫容易漏,重扫更稳。
要区分两种解释,可以交叉看三类证据,而不是只看记录总数。
假设一次扫描输入清单有 1000 条,中断后落盘 600 条,但差集显示缺失的 400 条分散在前、中、后三段,那么“只差尾部”的解释就不成立,续扫会留下大量空洞。反过来,如果缺失的 400 条全部集中在清单末尾,续扫从断点继续是合理的。这里数字只用于说明比较方法,不代表任何工具的实际表现。
三种处理方式各有适用条件,选择依据是上一步的差集分布,而不是中断本身。
选择之后要做一个验证动作:对补扫或续扫的结果,再次与原始输入清单做差集。如果差集为空或只剩已知的无效项,说明覆盖判断成立;如果差集仍然分散,说明顺序假设有问题,应转为重扫。
覆盖范围判断清楚后,才能决定旧内容、旧系统或旧合作关系里哪些部分保留。例如,如果确认某栏目从未被扫描到,就不能因为“整体结果看起来还行”而保留它;如果确认只差少量尾部且已补扫,就可以把已覆盖部分作为下一步筛选的输入。
需要核对具体工具是否支持断点续扫、差集导出或按范围重扫时,应以该工具当前实际提供的说明为准,不同版本和账号类型可能存在差异。判断覆盖范围的方法本身不依赖某一款工具,但执行动作会受工具能力限制。
最终要形成一个可复查的结论:这次扫描覆盖了哪些标识、缺失哪些标识、缺失是连续还是分散、下一步是续扫还是重扫。只有这个结论明确,后续对旧内容的保留或退出才有可靠依据。