--- name: ab-test-analysis description: "分析 A/B 测试结果,包含统计显著性、样本量验证、置信区间以及「发布/延长/停止」建议。在评估实验结论、检验测试是否达到显著性水平、解读分流量数据、或决定是否发布变体时使用。" ## A/B 测试分析 以严谨的统计方法评估 A/B 测试结果,并将发现转化为清晰的产品决策。 ### 上下文 您正在分析 **$ARGUMENTS** 的 A/B 测试结果。 如果用户提供了数据文件(CSV、Excel 或分析平台导出文件),请直接读取并分析。必要时生成 Python 脚本进行统计计算。 ### 操作指南 1. **理解实验**: - 假设是什么? - 变更了什么(变体)? - 核心指标是什么?是否有护栏指标? - 测试运行了多长时间? - 流量分配比例是多少? 2. **验证测试设置**: - **样本量**:样本量是否足够检测预期的效应量? - 使用公式:n = (Z²α/2 × 2 × p × (1-p)) / MDE² - 若测试统计功效不足(<80%),请标注 - **测试时长**:测试是否至少运行了 1-2 个完整的业务周期? - **随机化**:是否存在样本比例失衡(SRM)的证据? - **新颖性/优先效应**:是否有足够的时间消除初始行为变化带来的影响? 3. **计算统计显著性**: - 对照组和变体组的**转化率** - **相对提升**:(变体组 - 对照组) / 对照组 × 100 - **p 值**:使用双尾 z 检验或卡方检验 - **置信区间**:差异值的 95% 置信区间 - **统计显著性**:p < 0.05 是否成立? - **实际显著性**:该提升对业务是否具有实际意义? 如果用户提供了原始数据,请生成并运行 Python 脚本进行计算。 4. **检查护栏指标**: - 是否有任何护栏指标(收入、互动量、页面加载时间)出现恶化? - 核心指标胜出但护栏指标恶化,可能并非真正的胜利。 5. **解读结果**: | 结果 | 建议 | |---|---| | 显著正向提升,护栏指标无异常 | **发布**——全量上线至 100% | | 显著正向提升,但护栏指标有顾虑 | **深入调查**——在上线前充分权衡利弊 | | 不显著,但呈正向趋势 | **延长测试**——需要更多数据或更大的效应量 | | 不显著,结果持平 | **停止测试**——未检测到有意义的差异 | | 显著负向提升 | **不要发布**——回退至对照组,分析原因 | 6. **提供分析总结**: ``` ## A/B 测试结果:[测试名称] **假设**:[我们的预期] **测试时长**:[X 天] | **样本量**:[N 对照组 / M 变体组] | 指标 | 对照组 | 变体组 | 提升 | p 值 | 显著? | |---|---|---|---|---|---| | [核心指标] | X% | Y% | +Z% | 0.0X | 是/否 | | [护栏指标] | ... | ... | ... | ... | ... | **建议**:[发布 / 延长 / 停止 / 深入调查] **理由**:[原因] **后续步骤**:[下一步行动] ``` 请逐步思考。保存为 Markdown 文件。如果提供了原始数据,请生成用于计算的 Python 脚本。 --- ### 延伸阅读 - [A/B 测试入门 + 实例](https://www.productcompass.pm/p/ab-testing-101-for-pms) - [测试产品创意:终极验证实验库](https://www.productcompass.pm/p/the-ultimate-experiments-library) - [你是否在追踪正确的指标?](https://www.productcompass.pm/p/are-you-tracking-the-right-metrics)