假设一个情境:你的站点从几百个页面扩到几千个页面,仍靠人工在百度与360搜索里逐条查收录、逐页改标题、逐条记排名。这时最先出问题的不是效果,而是判断依据变得不可靠。手工能继续做的,是抽样验证和规则判断;不适合继续手工做的,是覆盖全站、需要重复执行且要求一致性的工作。下面按决策顺序说明边界。
网站规模小的时候,你手工查二十个页面的收录,基本能代表全站。规模扩大后,页面分成栏目页、详情页、聚合页、标签页等多种类型,手工抽查往往集中在入口附近,得到的是结构性偏差,不是全站状况。
判断方法很简单:把手工查到的页面按类型分组,看每组数量是否和站点实际比例接近。如果详情页占九成,而你查的二十个里有一半是栏目页,那这批数据不能用来推断详情页的抓取情况。此时可以继续手工做的,是每种类型各抽少量页面,验证模板层面是否存在共性问题,例如某类页面的标题是否被统一截断。
百度与360搜索都区分抓取、索引和展现,这三件事的观察方式不同。规模扩大后,逐条把网址贴进搜索框看是否出现,既慢又容易误判:一条网址没被展示,可能是未收录,也可能是被折叠、被替换成其他结果,或当前查询词不匹配。手工逐条核对无法区分这些原因。
更可行的动作是按目录或模板聚合观察。例如在站点日志或站长平台可用的数据里,按路径前缀分组,看某一类模板的抓取频次是否明显低于其他类型。如果某一类页面长期没有抓取记录,先检查这类页面是否被站内链接有效指向、是否在 robots 规则中被误挡。这个动作的结果会决定下一步:若问题出在链接入口,就补内链;若出在规则误挡,就先改规则再观察,而不是继续扩大人工查询量。
标题、描述、H1、内链锚文本这类元素,规模小的时候逐页手改还能控制。页面数量上去以后,逐页修改会带来两个问题:一是改动不一致,同类页面出现多种写法;二是改完无法回溯,出了问题不知道是哪一批改动造成的。
这时应把工作拆成两层。规则层由模板或数据源统一控制,例如详情页标题统一采用“具体对象 + 属性 + 站点名”的结构,由字段拼接生成。例外层才手工处理,只针对确有特殊需求的少量页面。判断哪些页面该进例外层,可以用一个假设例子说明:假设某类详情页共两千个,其中只有几十个涉及品牌词或易混淆词,那么这两千个页面适合走模板规则,那几十个才值得人工单独确认。这个划分的结果,决定了你后续是维护一套规则,还是维护一份不断变长的例外清单。
人工每天记录若干词的排名,在站点规模扩大后会同时遇到三个障碍:查询位置受个性化影响、记录频率跟不上变化、词量增长后人力无法覆盖。更重要的是,排名波动本身不能直接说明原因,它可能来自对手调整、搜索结果样式变化、自身页面改版,也可能只是查询方式不同。
可以继续手工做的,是少量核心词的定期确认,用来发现异常,而不是用来计算整体趋势。整体趋势应交给可重复的采集方式,按固定词表、固定时间、固定查询条件记录,并同时保留展现与点击数据。如果只有排名记录而没有展现数据,就不能推出“排名下降导致流量下降”这类结论,因为展现量变化也可能来自搜索需求本身的波动。
现实里常常拿不到完整日志,也没有全部站长平台权限。这种情况下仍可执行的最小动作是:选一个页面类型,固定抽样规则,连续观察若干轮,只记录能明确区分的状态,例如“有抓取记录”“无抓取记录”“有索引”“无索引”。不要把这些状态混成一个“好或不好”的分数。
需要说明的是,抓取量或收录量出现下降,不能单独证明你的处理正确或错误。合理的其他解释包括:站点近期新增页面减少、搜索引擎调整了抓取分配、日志统计口径变化、页面被合并或重定向。只有把观察范围限定在同一类页面、同一时间段,并且排除规则改动和结构改动的影响,才谈得上归因。手工做不完的部分,优先交给规则和可重复采集;手工真正不可替代的部分,是定义抽样规则、判断例外情况和解释异常原因。