支付宝营销策略对照实验分析报告

数据来源:阿里云天池 Audience Expansion Dataset · 分析工具:Python(pandas + scipy + statsmodels)

1. 实验背景

支付宝计划向用户投放营销广告,有两种新的广告策略可以考虑。为了判断哪种策略效果更好,设计了一组对照实验:

判断"效果好"的标准是广告点击率——看到广告的用户中,有多少人点了进去。点击率越高,说明广告越能吸引用户。

实验持续了 2 天,共覆盖 2,209,870 名用户。

2. 数据说明

2.1 数据来源

数据来自阿里云天池公开数据集 Audience Expansion Dataset,记录了支付宝两组营销策略活动的真实用户行为日志。数据经过匿名化处理,不影响分析结论的适用性。

2.2 字段说明

字段含义取值
用户编号支付宝用户的匿名标识唯一数字编号
是否点击用户当天是否点击了广告1 = 点击,0 = 未点击
策略编号用户被分到哪一组1 = 对照组,2 = 策略一,3 = 策略二
日期是第几天的数据1 = 第一天,2 = 第二天

2.3 数据清洗

原始数据共 2,645,958 条记录,2,410,683 名独立用户。数据清洗分两步:组内去重和跨组用户处理。

第一步:组内去重

问题:实验持续 2 天,同一用户在同一分组中可能两天都有记录。原始数据中有 13,580 个用户×分组组合存在两条记录(占总数的 0.5%),其余 99.5% 的用户只有一天的数据。

处理方式:同一用户在同一分组内有多条记录的,保留最后一天的数据。去重后剩 2,632,378 条。

已知局限:保留最后一天会丢失"第一天点了、第二天没点"的点击记录。这类用户共 96 人,占总用户数的 0.004%,影响可以忽略。下表对比了三种处理方式的结果差异:

处理方式对照组策略一策略二策略二提升幅度
保留最后一天(本报告采用)1.34%1.96%3.07%+1.72 个百分点
保留第一天1.33%1.95%3.05%+1.72 个百分点
任意一天点过即算点1.35%1.97%3.07%+1.73 个百分点

三种方式的最大差距不到 0.02 个百分点,对结论无影响。本报告采用"保留最后一天"。

第二步:跨组用户处理

问题:约 20 万用户(200,813 人)同时出现在多个分组中。例如有的用户既在对照组又在策略一,或者三个分组都有记录。这说明同一用户被多个投放计划覆盖,无法判断到底是哪个策略起了作用,属于污染样本。

处理方式:将 20 万跨组用户全部丢弃,只保留只出现在一个分组的纯独占用户。最终保留 2,209,870 条记录。

为什么丢弃而不是保留一条:跨组用户在所有分组里的点击率都远低于纯独占用户(见下表),说明这批人本身就不太爱点广告。如果把他们塞进策略组,会拉低策略组的点击率,稀释策略的真实效果。

分组跨组用户点击率纯独占用户点击率差距
对照组0.21%1.34%低了 6 倍
策略一0.89%1.96%低了一半
策略二1.69%3.07%低了一半

丢弃前后对比:下表展示了丢弃跨组用户前后,各组点击率的变化:

分组丢弃前人数丢弃前点击率丢弃后人数丢弃后点击率
对照组1,753,8741.34%1,753,8741.34%
策略一340,7021.71%243,8491.96%
策略二316,1072.61%212,1473.07%

对照组前后不变(跨组用户在两种方式下都不计入对照组)。策略一和策略二的点击率明显上升,因为低点击率的跨组用户被移除了。策略二的相对提升从 95% 升至 128%,策略的真实效果更加清晰。

其他检查

2.4 样本量分布

样本量分布

图1:各组样本量分布

组别样本量占比
对照组1,753,87479.4%
策略一243,84911.0%
策略二212,1479.6%
合计2,209,870100%
样本量是否够用?
判断对照实验结果是否可信,首先要看样本量够不够大。三组加起来 221 万人,其中策略二最少也有 21.2 万人。对于点击率这个指标来说,这个样本量远远超过了统计检验所需的最低要求,结论是可靠的。

3. 实验结果:哪种策略点击率更高?

3.1 三组点击率对比

点击率对比

图2:各组广告点击率对比

组别样本量点击人数点击率
对照组1,753,87423,5481.34%
策略一243,8494,7861.96%
策略二212,1476,5073.07%

3.2 两种策略相较对照组的提升

提升幅度对比

图3:两种策略相较对照组的提升幅度

1.34% 对照组点击率
1.96% 策略一点击率(+0.62个百分点)
3.07% 策略二点击率(+1.72个百分点)

从数据来看:

4. 这个差距是真实的还是碰巧的?

看到策略二的点击率更高,一个自然的问题是:这个差距会不会只是碰巧?万一换一批用户,结果就反过来了?

4.1 怎么判断——三步法

判断方法分三步,核心思路是:先假设策略没用,再看实际差距跟正常波动比有多大

第一步:假设策略没用,算"共同的点击率"

假设策略二跟对照组本质上没区别,那两组的"真实点击率"应该是一样的。这个共同的点击率大概是多少?把两组数据合在一起算:两组总点击数 ÷ 总人数。以对照组和策略二为例,合并后点击率约 1.53%。

第二步:算"正常波动有多大"

即使两组真实点击率都是 1.53%,实际统计出来也不会精确等于 1.53%,总会有随机波动。波动幅度跟两个因素有关:人数越多波动越小,点击率越低波动越小。用公式算出来,这个正常波动约 0.028 个百分点。可以理解为"正常的随机抖动幅度"——就像量体温,真实 36.5°C,每次量可能显示 36.4 或 36.6,这个 ±0.1 就是正常抖动。

第三步:看实际差距是正常波动的几倍

实际差距 1.72 个百分点 ÷ 正常波动 0.028 个百分点 ≈ 61 倍。就好比体温计正常抖动 0.1 度,结果量出来差了 6.1 度——不可能是体温计不准,是真发烧了。

根据统计学的规律:实际差距达到 2 倍正常波动,碰巧概率约 5%(行业通用门槛);达到 3 倍,碰巧概率约 0.3%。这次的差距是 61 倍,碰巧概率远小于千分之一,可以确定提升是真实的。

4.2 两组对比的计算过程

对照组 vs 策略一

计算步骤数值说明
对照组1,753,874 人,点击率 1.34%原始数据
策略一243,849 人,点击率 1.96%原始数据
第一步:合并点击率1.42%两组总点击 ÷ 总人数
第二步:正常波动0.026 个百分点人数越多、点击率越低,波动越小
实际差距0.62 个百分点1.96% - 1.34%
第三步:倍数24 倍0.62 ÷ 0.026
碰巧概率远小于 0.001%24 倍远超 3 倍(0.3%)门槛
结论提升是真实的,不是碰巧

对照组 vs 策略二

计算步骤数值说明
对照组1,753,874 人,点击率 1.34%原始数据
策略二212,147 人,点击率 3.07%原始数据
第一步:合并点击率1.53%两组总点击 ÷ 总人数
第二步:正常波动0.028 个百分点人数越多、点击率越低,波动越小
实际差距1.72 个百分点3.07% - 1.34%
第三步:倍数61 倍1.72 ÷ 0.028
碰巧概率远小于 0.001%61 倍远超 3 倍(0.3%)门槛
结论提升是真实的,不是碰巧
检验结论
两种策略相较对照组的提升,实际差距分别是正常波动的 24 倍和 61 倍,远超 3 倍(0.3% 碰巧概率)的判断门槛,可以确定提升是真实的。其中策略二的提升幅度(+1.72个百分点)远大于策略一(+0.62个百分点),是更优的选择。

5. 效果是否稳定?

为了确认实验结果不是某一天的偶然现象,我们看一下两天分别的点击率:

每日点击率对比

图4:各组第1天 vs 第2天点击率

组别第1天点击率第2天点击率波动情况
对照组0.96%1.82%第2天明显升高
策略一2.03%1.89%第2天略有下降
策略二3.36%2.52%第2天有所下降
关键发现
策略二在两天中都保持最高点击率,这个排名没有翻转,说明策略二的优势是稳定的。但各组的点击率在两天之间存在明显波动——对照组第2天点击率几乎是第1天的两倍,而两个策略组第2天都有所下降。这意味着策略二的提升幅度在第2天(+0.70个百分点)比第1天(+2.40个百分点)缩小了不少。

6. 业务结论与建议

结论:建议再观察一周,确认稳定后推广策略二

策略二的广告点击率(3.07%)相较对照组(1.34%)提升了 128%,统计检验确认提升是真实的(碰巧概率不到千分之一),两天中策略二始终保持最高点击率。但第二天三组数据出现明显波动——对照组点击率从 0.96% 大幅升至 1.82%,两个策略组均有下降,策略二的提升幅度从第1天的 2.40 个百分点缩小到第2天的 0.70 个百分点。实验仅持续 2 天,建议再观察一周,如果策略二仍然排名第一,再进行全量推广。