skillhub-041-ab-test-analysis
3.4 KiB
3.4 KiB
name: ab-test-analysis description: "分析 A/B 测试结果,包含统计显著性、样本量验证、置信区间以及「发布/延长/停止」建议。在评估实验结论、检验测试是否达到显著性水平、解读分流量数据、或决定是否发布变体时使用。"
A/B 测试分析
以严谨的统计方法评估 A/B 测试结果,并将发现转化为清晰的产品决策。
上下文
您正在分析 $ARGUMENTS 的 A/B 测试结果。
如果用户提供了数据文件(CSV、Excel 或分析平台导出文件),请直接读取并分析。必要时生成 Python 脚本进行统计计算。
操作指南
-
理解实验:
- 假设是什么?
- 变更了什么(变体)?
- 核心指标是什么?是否有护栏指标?
- 测试运行了多长时间?
- 流量分配比例是多少?
-
验证测试设置:
- 样本量:样本量是否足够检测预期的效应量?
- 使用公式:n = (Z²α/2 × 2 × p × (1-p)) / MDE²
- 若测试统计功效不足(<80%),请标注
- 测试时长:测试是否至少运行了 1-2 个完整的业务周期?
- 随机化:是否存在样本比例失衡(SRM)的证据?
- 新颖性/优先效应:是否有足够的时间消除初始行为变化带来的影响?
- 样本量:样本量是否足够检测预期的效应量?
-
计算统计显著性:
- 对照组和变体组的转化率
- 相对提升:(变体组 - 对照组) / 对照组 × 100
- p 值:使用双尾 z 检验或卡方检验
- 置信区间:差异值的 95% 置信区间
- 统计显著性:p < 0.05 是否成立?
- 实际显著性:该提升对业务是否具有实际意义?
如果用户提供了原始数据,请生成并运行 Python 脚本进行计算。
-
检查护栏指标:
- 是否有任何护栏指标(收入、互动量、页面加载时间)出现恶化?
- 核心指标胜出但护栏指标恶化,可能并非真正的胜利。
-
解读结果:
结果 建议 显著正向提升,护栏指标无异常 发布——全量上线至 100% 显著正向提升,但护栏指标有顾虑 深入调查——在上线前充分权衡利弊 不显著,但呈正向趋势 延长测试——需要更多数据或更大的效应量 不显著,结果持平 停止测试——未检测到有意义的差异 显著负向提升 不要发布——回退至对照组,分析原因 -
提供分析总结:
## A/B 测试结果:[测试名称] **假设**:[我们的预期] **测试时长**:[X 天] | **样本量**:[N 对照组 / M 变体组] | 指标 | 对照组 | 变体组 | 提升 | p 值 | 显著? | |---|---|---|---|---|---| | [核心指标] | X% | Y% | +Z% | 0.0X | 是/否 | | [护栏指标] | ... | ... | ... | ... | ... | **建议**:[发布 / 延长 / 停止 / 深入调查] **理由**:[原因] **后续步骤**:[下一步行动]
请逐步思考。保存为 Markdown 文件。如果提供了原始数据,请生成用于计算的 Python 脚本。