| name | ab-testing |
| description | A/B 测试设计与分析时使用。适用于产品实验、功能验证、转化率优化。融合假设驱动 + 样本量计算 + 置信度判断。 |
A/B 测试(A/B Testing)
适用场景
- 新功能效果验证
- UI/UX 改版对比
- 定价策略测试
- 推荐算法对比
- 落地页优化
核心原则
1. 先有假设再实验
"改变 X 会让 Y 提升 Z%"
2. 样本量要够
不够 = 噪音当信号
3. 跑够时长
至少 1~2 个完整业务周期
4. 看护栏指标
主指标提升但其他恶化 = 不可上
5. 统计显著 ≠ 业务显著
p < 0.05 但效果 0.01% = 无意义
样本量计算
公式因素:
- 基线转化率(p1)
- 最小检测效应(MDE)
- 显著性水平(α = 0.05)
- 统计功效(1-β = 0.8)
工具:
- Evan Miller 样本量计算器
- statsmodels(Python)
- power.prop.test(R)
工作流程
1. 明确假设和目标
2. 选择主指标 + 护栏指标
3. 计算样本量
4. 确定分流方式和时长
5. 启动实验
6. 等待(不提前偷看)
7. 分析结果
8. 做决策(全量 / 放弃 / 迭代)
配套模板
templates/ab-test-template.md — A/B 测试设计 + 结果 + 结论
质量自检
□ 假设明确可证伪
□ 样本量计算
□ 分流无偏(hash)
□ 跑够时长
□ 不提前偷看
□ 看护栏指标
□ 结论可行动
常见坑
- 样本量不够就下结论——噪音
- 提前偷看 p-value——膨胀
- 只看主指标——护栏恶化
- 时长不够——周期效应
- 分流有偏——新用户 vs 老用户不均
与其他 skill 的协作
上游:metric-design → 指标选择
上游:product-manager → 假设来源
下游:analysis-report → 结果纳入报告