先给结论:如果分流是随机的,但某个版本在转化率上的领先只出现在“进入时间集中、来源单一、或设备高度同质”的那一小段样本里,就要把它当作样本污染来排查,而不是直接宣布该版本更优。识别样本污染的关键不是看总转化率差多少,而是看这个差异能否在分层后依然稳定存在。一个会让上述结论失效的反例是:分流本身按用户ID稳定哈希,且各层样本量足够大,此时分层后的波动可能只是正常随机噪声,不能仅凭某一层的反转就判定污染。
样本污染最常见的来源,是分配逻辑本身不独立。你需要先弄清楚访客进入实验时,是被随机数、用户ID、还是某个业务字段(如渠道、地区、登录状态)决定版本的。
动作:导出实验期间每个访客的分配记录,按来源、设备、新老用户三个维度分别统计两版占比。如果某一版在某个维度的占比明显偏离总体,下一步就应把该维度作为分层变量,而不是继续看汇总数字。
汇总转化率会把不同人群的差异混在一起。识别污染的有效做法,是把样本按关键维度切层,再在每层内部比较两版。
假设某次实验汇总显示B版转化率高于A版,但按来源分层后:来自搜索的访客中A版更高,来自推荐的访客中B版更高,而B版恰好分到了更多推荐流量。这时汇总优势很可能来自来源结构,而非版本本身。这个例子是假设,用于说明分层方法,不代表任何真实项目结果。
判断依据可以归为三类:
动作:对每个分层分别计算转化率和样本量,标记出“方向反转且样本充足”的层。如果这样的层只有一个,下一步应检查该层的流量入口是否被单独配置过。
样本污染也可能来自时间。两版并非在同一时间段内获得同等曝光,就会把“时段效应”误当成“版本效应”。
可核查的证据链是:按天或按小时列出两版的曝光量与转化量,看是否存在某一版集中在某几天、而另一版分散在全周期的情况。如果某版的大部分转化来自一次活动或一次推送后的几小时,那么这段样本就不能代表常态。需要注意的是,曝光量或转化量在某个时段归零,不能单独证明分配出了问题,它也可能是投放暂停、页面故障或统计延迟造成的,必须结合分配记录一起看。
动作:把实验周期切成等长的时间片,逐片比较两版。如果差异只在某一个时间片出现,下一步应确认该时间片是否有外部事件介入,再决定是否剔除该段样本重算。
当你用不同工具核对样本时,口径差异会伪装成污染。站内统计通常以会话或用户为单位,第三方估算工具可能以抓取或模型推算为口径,两者对同一段流量的计数本就不会一致。
因此,识别污染时应固定一个口径作为判断基准,例如统一用站内分配记录中的用户ID去重。若第三方数据与站内数据在分层后仍呈现相同的方向反转,污染的可能性才更高;若只有第三方数据出现反转,应先怀疑口径,而不是先改实验。
动作:选定站内去重口径后,重算各层转化率。如果反转消失,说明此前看到的差异来自口径混合,下一步应统一所有报表的统计单位再继续判断。
满足以下条件时,可以认为样本污染不构成主要解释:分配记录在各维度上占比接近,分层后方向一致,时间分布均匀,且换用同口径重算后结论不变。此时两版的差异更可能来自版本本身或正常波动。
反之,只要分配占比明显失衡、或分层后出现方向反转且样本充足,就应先处理污染,再谈优化。下一步动作是:锁定被污染的那一层,确认它是分配逻辑造成还是外部事件造成,然后决定是剔除该层重算,还是修正分流规则后重新积累样本。只有在这一步完成之后,基于转化率差做出的版本取舍才是可信的。