排除内部流量本身不会“误删真实访问”,真正会导致误删的是过滤规则过宽:把与内部网络共用的出口 IP、办公网段、测试设备标识或登录态一并排除。检查方法不是看总量掉了多少,而是把过滤前后的原始记录按会话逐条对照,确认被排除的每一条都能对应到可核验的内部来源。若做不到这一点,就应缩小规则范围再重跑,而不是接受当前结果。
两种条件对应两种检查路径,选择依据是过滤动作是否留下了可回放的中间产物。
判断自己属于哪种条件,动作很简单:找一份过滤生效前的原始访问记录,确认它是否还能按会话维度取到。如果取不到,就默认进入条件二,后续所有结论都要标注证据强度。
具体做法是固定一个时间窗(例如某个自然日),用同一套会话定义分别跑过滤前和过滤后的结果,把只出现在过滤前、不出现在过滤后的会话挑出来。这一步的结果直接决定下一步:差集越小、特征越集中,说明规则越可能是精准的;差集里出现大量分散来源,说明规则正在吞掉真实访问。
对差集里的会话逐类归因,可以按以下顺序核对:
一个假设的例子:某站点把公司办公网段整段排除,结果发现差集中包含一批来自该网段但访问路径完整、停留时长正常的会话。进一步核对发现,该网段同时被一家外包客服团队使用,他们产生的访问属于真实业务访问。此时正确动作是把排除范围从整段收窄到具体测试设备的标识,而不是继续按网段过滤。收窄后重跑差集,如果这批会话回到统计中且内部测试流量仍被排除,说明规则修正到位;如果内部测试流量也跟着回来了,说明收窄过度,需要再补一层设备标识条件。
当差集无法精确取得时,最容易犯的错是用“总量下降幅度”当作判断依据。总量下降既可能是过滤生效,也可能是采集本身出了问题、日志轮转截断、或统计口径调整。这些原因无法互相区分,因此总量变化不能单独作为证据。
可以核对的旁证包括:
如果旁证只能支持“可能误删”,下一步动作是把过滤规则临时改为只记录不删除,即保留全部原始会话,仅打上“疑似内部”标记。运行一段时间后,人工抽查被标记的会话,确认其中是否混入真实访问。这个动作的产出是一份被误标的会话清单,它比任何总量对比都更能支撑后续决策。
上述检查成立的前提是:你能拿到过滤前后的会话级记录,且时间窗一致。若站点使用了会改变会话切分方式的统计工具,或中途调整过会话超时时间,差集对照会失真,此时应先在固定口径下重跑,再谈排除是否误删。
另一个例外是内部流量与真实流量共用同一出口且无法从技术上区分的情况。此时无论怎么调规则都会误伤一侧,合理做法是接受一定误差,并在报告中注明排除规则的影响范围,而不是追求完全干净的划分。检查的目标是让误差可见、可控,不是让误差归零。
最后要明确:请求量、抓取量或某项统计归零,都不能单独证明排除动作正确。归零可能是规则过宽,也可能是采集中断、日志未落盘或统计任务失败。只有在会话级证据能对应到具体来源时,才能判定排除是否误删了真实访问。