先回答结论:当访客被分配到不同版本时,识别样本污染的关键不是看总流量涨跌,而是先确认“分流是否随机、统计口径是否一致、样本是否被重复计入”。如果这三项中任意一项不成立,把版本差异直接归因于改动本身就会误判。此时应优先保留原始分流日志和站内统计口径,再决定是保留、改写还是退出当前对比方案。
访客被分配到不同版本,最容易被忽略的前提是分流机制本身是否随机。如果分配依据是登录状态、来源渠道、设备类型或访问时段,那么不同版本接收到的样本天然不同。此时即使某个版本数据更好,也不能说明改动有效。
一个可执行动作是:在分流代码中记录每个访客被分配到的版本标识,并同时记录其来源、设备、是否新访客。假设某次对比中,A版本白天流量多、B版本夜间流量多,那么两组的停留时长差异可能来自时段,而不是版本。这个动作的结果会直接影响下一步:如果来源或设备分布明显不均,应先调整分流规则,而不是继续扩大样本量。
适用条件是分流逻辑可控且可记录。如果分流由外部平台黑盒完成,无法获取分配依据,那么保留原方案的价值有限,更稳妥的做法是退出该对比,改用同一入口下的前后对照。
第三方估算流量、搜索引擎报告和站内统计的口径并不相同。站内统计通常按页面加载或会话计算,第三方估算可能按模型推算,搜索引擎报告则只覆盖来自搜索的点击。把三者放在同一张对比表里,很容易把口径差异误读成版本差异。
识别样本污染时,应固定一个主口径,例如站内会话数,并只在同一口径内比较版本。若必须参考第三方数据,只能把它当作旁证,不能用来直接计算版本优劣。一个可操作的检查是:分别导出两个版本在同一时间窗口内的会话数、独立访客数和页面浏览数,观察比例是否稳定。如果A版本会话数高但独立访客数低,说明可能存在重复计入或同一访客多次触发,这时应先清洗数据,再判断改动效果。
这一步的结果会影响后续取舍:口径一致且分流随机时,可以继续保留对比;口径混乱时,应改写统计方案,而不是急着下结论。
样本污染不一定表现为数据异常大,也可能表现为两组数据过于接近或某个版本突然归零。请求量、抓取量或某项统计归零,不能单独证明处理正确,它还可能来自埋点失效、缓存命中、分流脚本报错或统计延迟。
可核查的证据链包括:
如果发现同一访客ID跨版本出现,说明分流未隔离,此时应保留原始日志并暂停对比。若只是某个版本归零,先检查埋点和分流脚本,而不是直接判定该版本失败。这个动作的结果是:确认污染来源后,才能决定是修复分流、清洗数据,还是放弃当前对比。
保留适用于分流随机、口径统一、且污染证据仅来自少量可剔除的异常请求。此时可以剔除异常样本后继续观察,但应记录剔除规则,避免事后随意调整。
改写适用于分流逻辑可调整、但当前分配依据与版本效果混淆。例如按来源渠道分流导致两组样本结构不同,可以改为按访客ID哈希分流,并重新记录基线。改写后不能直接沿用旧结论,需要重新积累样本。
退出适用于分流不可控、统计口径无法统一,或污染范围无法界定。此时继续对比只会增加误判风险,更合理的做法是改用同一入口的前后对照,或缩小改动范围,只验证一个可独立观测的信号。
三种取舍没有固定优先级,判断依据是污染是否可隔离、口径是否可统一、以及重新积累样本的成本是否可接受。
识别样本污染的最终目的,是决定下一步能否继续使用当前对比。一个可复核的流程是:先锁定分流日志和站内统计口径,再检查访客是否跨版本、比例是否偏离、异常请求是否集中。若证据显示污染可隔离,就保留并清洗;若分流规则本身导致样本结构不同,就改写分流并重建基线;若污染无法界定,就退出当前对比。
需要强调的是,单个指标归零或某个版本数据偏低,都不能单独证明改动无效。只有把分流、口径和样本重复这三条证据链对齐,才能判断版本差异是否值得继续投入。