识别样本污染的关键,不是先看汇总指标涨跌,而是先确认每一份样本是否来自同一个版本、同一类入口和同一套统计口径。如果访客被分配到不同版本,而你又把两版数据合并分析,那么个别样本里成立的结论在规模化后出现例外,往往不是策略失效,而是样本里混进了不该比较的对象。此时应优先保留可分层的数据,改写成按版本、入口、设备拆分的对比,只有在无法分层且污染比例高到足以推翻结论时才退出这轮诊断。
访客被分配到不同版本,常见于同一路径下并存两个页面结构、两套模板或两个落地页。搜狗网站诊断里,污染通常有两种来源:一种是分流本身带来的组成差异,另一种是统计口径不一致带来的假差异。
可区分的证据是:把同一版本按入口拆开后,如果差异明显缩小,说明主因是分流;如果拆开后差异仍在,且日志里同一访客出现两条不同版本记录,说明主因是口径或标记错误。第三方估算流量、搜狗报告与站内统计口径不同,不能互相直接换算,也不能单靠某一项指标还原搜索算法。
面对样本污染,处理方式取决于污染是否可分层、污染比例是否影响结论方向。
一个实际动作是:先给每个样本打上版本标签,再统计“标签缺失或冲突”的比例。如果这个比例低,下一步做分层对比;如果比例高,下一步不是调策略,而是先修分流和埋点。这个判断会直接改变后续动作顺序。
识别样本污染时,不要只盯一个指标。可以用一条最小证据链:同一访客标识在日志里是否出现两次不同版本;同一入口在两版中的访问占比是否突变;站内统计与第三方估算的差异是否集中在某一版本。假设某落地页新旧两版并存,旧版从历史入口进入,新版从新入口进入。如果只看总转化率,新版可能更高;但按入口拆开后,两个入口各自内部的版本差异可能很小。这个例子说明:总指标差异可能来自入口组成,而不是版本效果。
需要注意的是,请求量、抓取量或某项统计归零,不能单独证明分流处理正确。它也可能是采集延迟、入口关闭、标记失效或统计片段未触发。把这些合理解释逐一排除后,才能把归零当作支持证据。
规模化后出现例外,往往是因为个别样本成立的条件没有被写下来。建议在诊断记录里明确三条边界:这轮结论只适用于哪个版本、哪个入口、哪个设备范围;哪些样本因无法归属被排除;排除后结论是否仍然成立。如果排除后结论反转,就应改写结论或退出该轮;如果排除后结论不变,才可以把结论带到更大范围验证。搜狗网站诊断中,样本污染不是靠一个开关解决的,而是靠先分层、再取舍、最后写明适用条件来控制的。