先给结论:样本污染通常不是“工具不准”,而是分流、回传或归因口径把不同版本的用户混进了同一分析口径。要识别它,最有效的一步是固定一个分流标识,分别核对“进入版本”与“报告版本”是否一致;如果两者对不上,先修标识,再谈版本效果。
假设你在一小批访客上测试新页面,发现新版本转化更好;当流量放大到全部访客后,差异反而消失,甚至逆转。这里有两种常见解释,需要分开看。
这两种解释的应对方式完全不同:前者要调整版本或限定适用人群,后者要先修分流和回传链路。把污染当成效果差异去优化页面,后续判断会继续偏。
识别污染的核心动作,是让分流系统在访客进入时写入一个版本标识,并让统计工具在事件上报时携带同一个标识。然后在流量统计工具里分别看两件事:
如果进入版本A的访客有相当一部分被报告成B,说明分流标识在页面跳转、缓存或脚本加载过程中丢失或被覆盖。此时先不要比较两版转化率,因为分母已经混了。
一个可执行的检查是:在分流入口和统计上报处各记录一次版本标识,按访客或会话维度对齐。假设某次核对发现,进入版本A的会话中有一部分上报为B,且这些会话集中在同一入口或同一设备类型,那么污染更可能来自该入口的跳转链路,而不是随机误差。下一步应优先修该入口的标识传递,再重新观察。
两类原因会留下不同痕迹,可以用以下证据区分。
注意,某个指标归零或抓取量下降,不能单独证明污染已修复。它也可能是上报延迟、过滤规则变化或流量本身减少。要结合标识一致性一起看。
假设某站点把访客随机分到旧版和新版,分流标识写在URL参数里,统计工具读取该参数归因。上线后发现新版转化率略高,但放大流量后差异消失。核对发现,从某个广告入口进入的访客,URL参数在跳转中被清理,导致这部分访客虽然看到新版,却被统计工具归到旧版。
这时先修该入口的参数保留,再按入口分别核对标识一致性。如果修复后进入版本与报告版本基本对齐,才能重新比较两版效果;如果仍不对齐,说明还有别的跳转或缓存环节在覆盖标识,需要继续查链路,而不是继续加样本。
上述方法适用于你能控制分流标识、并且统计工具能读取该标识的场景。如果分流由第三方平台完成、标识不可见,或者你只能看到聚合报告,就无法用“进入版本对报告版本”直接核对。此时只能退一步:按入口、设备、时间分段观察版本比例是否异常,但这只能提示污染可能存在,不能确认具体环节。
另外,样本污染和真实效果差异可能同时存在。先修污染,不等于版本一定有效;它只是让后续比较的分母变得可信。把这一步做完,再决定是调整版本、限定人群,还是放弃该实验。