网站规模扩大后,最不适合继续手工做的工作,不是“所有重复劳动”,而是那些一旦条目变多、就同时出现漏做、做错且无法复盘的工作。判断标准可以很直接:同一件事需要按页面或按URL重复执行,执行结果需要和页面一一对应,而且遗漏之后要过很久才能从数据里发现。满足这三条,手工做的边际成本会迅速超过一次搭建规则的成本。反过来,只做几次、需要临场判断、或者做错代价很低的事,继续手工反而更省事。
小站阶段,手工改标题、手工加内链、手工提交新页面都能应付,因为总量小、反馈快。规模上去以后,变化的不只是数量,而是“核对成本”。改十个页面的标题,你可以逐个打开确认;改两千个页面,你无法靠眼睛确认每个页面是否都改对了,只能依赖一份可以逐行比对的清单。
可以用一个假设例子说明。假设某站从三百个页面扩到三千个页面,其中一批页面的标题模板需要统一调整。手工做法是导出清单、逐条修改、再抽查。问题在于抽查只能覆盖很小一部分,剩下的错误会留在线上,而且不会立刻表现为流量变化——它可能只是让一部分页面在搜索结果里的展示文本变得重复或残缺。等到你从数据里察觉异常,已经很难判断是哪一次修改引入的。
这类工作的共同特征是:可枚举、可逐条核对、遗漏后反馈延迟。它们才是应该优先从手工转为规则化处理的对象。
第一类是批量页面属性的统一处理,例如标题、描述、规范化标签、分页与参数页的处理规则。前提是这些页面的属性可以由明确的规则推导出来,而不是每页都需要单独措辞。如果一批页面确实各有各的卖点,强行套模板只会让内容变得雷同,这时保留手工改写更合理。
第二类是站内链接的批量增补与修正。当栏目和文章数量变多,手工加内链很容易集中在少数几个页面,形成明显的链接倾斜。规则化处理适合“同一主题下互相引用”这类结构清晰的场景;如果内链需要结合上下文语义判断,仍然应由人来决定锚文本和落点。
第三类是抓取与索引状态的例行核对,例如哪些页面被排除、哪些返回异常、哪些长期没有被访问。手工在后台逐页翻看,在页面数量少时可行,数量上来后只能看到抽样结果。这里需要说明的是,抓取量、索引量或某个统计项下降,并不能单独证明你的处理正确或错误。它还可能来自内容更新节奏变化、站点结构调整、外部链接变动,或者统计口径本身的差异。要区分这些解释,需要把改动时间点和数据变化时间点对齐,而不是只看一条曲线。
不是所有事都该交给规则。以下几类继续手工做,通常比自动化更划算:
保留手工的前提是,这些工作不会随页面数量线性增长。如果某件“需要判断”的事其实每天都在重复同样的判断,那它已经不是判断,而是规则没被写出来。
与其争论该不该自动化,不如先估一次核对成本。具体做法是:挑一件你正在手工重复的工作,记录完成一轮需要多少时间,再估算如果页面数量翻倍,这轮工作需要多少时间,以及你能抽查的比例会降到多少。
这个动作的结果会直接影响下一步。如果估算显示,页面翻倍后你只能抽查不到一成,而且错误要在数周后才可能从数据里显现,那么这项工作就应该优先转为规则化处理,并把节省下来的时间用在需要判断的页面上。如果估算显示,即使规模翻倍,你仍然能逐条确认且耗时可控,那就没有必要为了“自动化”而引入新的维护负担——规则本身也需要维护,规则写错时影响范围往往比手工错误更大。
需要强调的是,这个估算只是用于比较两种做法的相对成本,不构成对任何结果的预期。它帮你决定的是“先处理哪一件”,而不是“做完就一定会怎样”。
把批量工作交给规则,不等于不再看结果。合理的做法是保留一个复核入口:规则处理完成后,抽取一部分页面逐条比对,确认规则按预期生效;同时记录这次改动的时间,方便之后把数据变化和改动对应起来。这样做的价值在于,当出现反常结果时,你有依据区分“是这次改动造成的”还是“另有原因”,而不是凭印象归因。
规模扩大带来的真正压力,不是活变多了,而是每件活的核对方式必须跟着变。先找出那些可枚举、需逐条核对、遗漏后反馈延迟的工作,把它们从手工清单里移出去,把人的注意力留给真正需要判断的部分,这才是规模上去之后应该做的取舍。