with one click
ab-testing
A/B 测试设计与分析时使用。适用于产品实验、功能验证、转化率优化。融合假设驱动 + 样本量计算 + 置信度判断。
Install with Codex or Claude Copy this prompt, paste it into Codex, Claude, or another assistant, and let it review the skill page and install it for you.
Menu
A/B 测试设计与分析时使用。适用于产品实验、功能验证、转化率优化。融合假设驱动 + 样本量计算 + 置信度判断。
Install with Codex or Claude Copy this prompt, paste it into Codex, Claude, or another assistant, and let it review the skill page and install it for you.
Based on SOC occupation classification
设计 API 认证鉴权和权限矩阵时使用。适用于多角色系统、租户隔离、字段级权限。优先使用 OAuth 2.0 / JWT + RBAC + 资源归属检查。
设计具体 API 端点时使用。适用于资源建模后的下一步、列端点清单、HTTP 方法和状态码选择。优先使用 RFC 7231 HTTP 语义 + GitHub REST 命名规范。
设计 API 错误码和错误结构时使用。适用于错误响应规范、调用方错误处理、调试可观测。优先使用 RFC 7807 Problem Details + 业务错误码 + 调用方处理建议。
设计幂等接口和重试策略时使用。适用于支付、扣减、订单、关键写操作。优先使用 Idempotency-Key + 业务去重键 + 并发冲突处理(ETag/版本号)。
输出 OpenAPI 契约和 Mock 服务时使用。适用于 API 设计的最后一步、给前端/后端/QA 的交付。优先使用 OpenAPI 3.1 + Mock 数据覆盖所有路径 + 详细的下游交接清单。
设计列表接口的分页、筛选、排序、搜索时使用。适用于所有列表 API。优先使用 cursor 分页(大数据)或 offset 分页(小数据)+ 统一筛选/排序规范。
| name | ab-testing |
| description | A/B 测试设计与分析时使用。适用于产品实验、功能验证、转化率优化。融合假设驱动 + 样本量计算 + 置信度判断。 |
1. 先有假设再实验
"改变 X 会让 Y 提升 Z%"
2. 样本量要够
不够 = 噪音当信号
3. 跑够时长
至少 1~2 个完整业务周期
4. 看护栏指标
主指标提升但其他恶化 = 不可上
5. 统计显著 ≠ 业务显著
p < 0.05 但效果 0.01% = 无意义
公式因素:
- 基线转化率(p1)
- 最小检测效应(MDE)
- 显著性水平(α = 0.05)
- 统计功效(1-β = 0.8)
工具:
- Evan Miller 样本量计算器
- statsmodels(Python)
- power.prop.test(R)
1. 明确假设和目标
2. 选择主指标 + 护栏指标
3. 计算样本量
4. 确定分流方式和时长
5. 启动实验
6. 等待(不提前偷看)
7. 分析结果
8. 做决策(全量 / 放弃 / 迭代)
templates/ab-test-template.md — A/B 测试设计 + 结果 + 结论□ 假设明确可证伪
□ 样本量计算
□ 分流无偏(hash)
□ 跑够时长
□ 不提前偷看
□ 看护栏指标
□ 结论可行动
上游:metric-design → 指标选择
上游:product-manager → 假设来源
下游:analysis-report → 结果纳入报告