项目文件夹

文件
2026-07-13 21:35:51 +08:00

3.4 KiB


name: ab-test-analysis description: "分析 A/B 测试结果,包含统计显著性、样本量验证、置信区间以及「发布/延长/停止」建议。在评估实验结论、检验测试是否达到显著性水平、解读分流量数据、或决定是否发布变体时使用。"

A/B 测试分析

以严谨的统计方法评估 A/B 测试结果,并将发现转化为清晰的产品决策。

上下文

您正在分析 $ARGUMENTS 的 A/B 测试结果。

如果用户提供了数据文件(CSV、Excel 或分析平台导出文件),请直接读取并分析。必要时生成 Python 脚本进行统计计算。

操作指南

  1. 理解实验

    • 假设是什么?
    • 变更了什么(变体)?
    • 核心指标是什么?是否有护栏指标?
    • 测试运行了多长时间?
    • 流量分配比例是多少?
  2. 验证测试设置

    • 样本量:样本量是否足够检测预期的效应量?
      • 使用公式:n = (Z²α/2 × 2 × p × (1-p)) / MDE²
      • 若测试统计功效不足(<80%),请标注
    • 测试时长:测试是否至少运行了 1-2 个完整的业务周期?
    • 随机化:是否存在样本比例失衡(SRM)的证据?
    • 新颖性/优先效应:是否有足够的时间消除初始行为变化带来的影响?
  3. 计算统计显著性

    • 对照组和变体组的转化率
    • 相对提升:(变体组 - 对照组) / 对照组 × 100
    • p 值:使用双尾 z 检验或卡方检验
    • 置信区间:差异值的 95% 置信区间
    • 统计显著性p < 0.05 是否成立?
    • 实际显著性:该提升对业务是否具有实际意义?

    如果用户提供了原始数据,请生成并运行 Python 脚本进行计算。

  4. 检查护栏指标

    • 是否有任何护栏指标(收入、互动量、页面加载时间)出现恶化?
    • 核心指标胜出但护栏指标恶化,可能并非真正的胜利。
  5. 解读结果

    结果 建议
    显著正向提升,护栏指标无异常 发布——全量上线至 100%
    显著正向提升,但护栏指标有顾虑 深入调查——在上线前充分权衡利弊
    不显著,但呈正向趋势 延长测试——需要更多数据或更大的效应量
    不显著,结果持平 停止测试——未检测到有意义的差异
    显著负向提升 不要发布——回退至对照组,分析原因
  6. 提供分析总结

    ## A/B 测试结果:[测试名称]
    
    **假设**:[我们的预期]
    **测试时长**[X 天] | **样本量**[N 对照组 / M 变体组]
    
    | 指标 | 对照组 | 变体组 | 提升 | p 值 | 显著? |
    |---|---|---|---|---|---|
    | [核心指标] | X% | Y% | +Z% | 0.0X | 是/否 |
    | [护栏指标] | ... | ... | ... | ... | ... |
    
    **建议**[发布 / 延长 / 停止 / 深入调查]
    **理由**:[原因]
    **后续步骤**:[下一步行动]
    

请逐步思考。保存为 Markdown 文件。如果提供了原始数据,请生成用于计算的 Python 脚本。


延伸阅读