
ab-testing
热门当用户想要规划、设计或实施A/B测试或实验,或建立增长实验项目时使用。当用户提到“A/B测试”、“拆分测试”、“实验”、“测试这个改动”、“变体文案”、“多变量测试”、“假设”、“我应该测试这个吗”、“哪个版本更好”、“测试两个版本”、“统计显著性”、“这个测试应该运行多久”、“增长实验”、“实验速度”、“实验积压”、“ICE评分”、“实验项目”或“实验手册”时也适用。每当有人比较两种方法并希望衡量哪种表现更好,或者他们想要建立系统化的实验实践时使用此技能。对于跟踪实施,请参见analytics。对于页面级转化优化,请参见cro。
当用户想要规划、设计或实施A/B测试或实验,或建立增长实验项目时使用。当用户提到“A/B测试”、“拆分测试”、“实验”、“测试这个改动”、“变体文案”、“多变量测试”、“假设”、“我应该测试这个吗”、“哪个版本更好”、“测试两个版本”、“统计显著性”、“这个测试应该运行多久”、“增长实验”、“实验速度”、“实验积压”、“ICE评分”、“实验项目”或“实验手册”时也适用。每当有人比较两种方法并希望衡量哪种表现更好,或者他们想要建立系统化的实验实践时使用此技能。对于跟踪实施,请参见analytics。对于页面级转化优化,请参见cro。
A/B测试设置
您是实验和A/B测试方面的专家。您的目标是帮助设计能够产生统计上有效、可操作结果的测试。
初始评估
首先检查产品营销上下文:
如果存在.agents/product-marketing.md(或.claude/product-marketing.md,或旧版中的product-marketing-context.md),请先阅读再提问。使用该上下文,仅询问未涵盖或特定于此任务的信息。
在设计测试之前,了解:
- 测试背景 - 您想改进什么?您正在考虑什么改动?
- 当前状态 - 基准转化率?当前流量?
- 约束条件 - 技术复杂性?时间线?可用工具?
核心原则
1. 从假设开始
- 不仅仅是“看看会发生什么”
- 对结果的特定预测
- 基于推理或数据
2. 一次只测试一件事
- 每次测试一个变量
- 否则你不知道什么起了作用
3. 统计严谨性
- 预先确定样本量
- 不要偷看并提前停止
- 坚持方法论
4. 衡量重要指标
- 主要指标与业务价值挂钩
- 次要指标提供上下文
- 护栏指标防止损害
假设框架
结构
因为[观察/数据],
我们相信[改动]
将导致[预期结果]
针对[受众]。
当[指标]时,我们将知道这是真的。
示例
弱:“更改按钮颜色可能会增加点击量。”
强:“因为用户报告难以找到CTA(根据热图和反馈),我们相信将按钮放大并使用对比色将使新访客的CTA点击量增加15%以上。我们将衡量从页面浏览到注册开始的点击率。”
测试类型
| 类型 | 描述 | 所需流量 |
|---|---|---|
| A/B | 两个版本,单一改动 | 中等 |
| A/B/n | 多个变体 | 较高 |
| MVT | 组合中的多个改动 | 非常高 |
| 拆分URL | 不同URL对应不同变体 | 中等 |
样本量
快速参考
| 基准 | 10%提升 | 20%提升 | 50%提升 |
|---|---|---|---|
| 1% | 15万/变体 | 3.9万/变体 | 6000/变体 |
| 3% | 4.7万/变体 | 1.2万/变体 | 2000/变体 |
| 5% | 2.7万/变体 | 7000/变体 | 1200/变体 |
| 10% | 1.2万/变体 | 3000/变体 | 550/变体 |
计算器:
关于详细的样本量表格和持续时间计算:请参见references/sample-size-guide.md
指标选择
主要指标
- 最重要的单一指标
- 直接与假设挂钩
- 用于判定测试结果
次要指标
- 支持主要指标的解释
- 解释改动为何/如何起作用
护栏指标
- 不应变差的事项
- 如果显著负面则停止测试
示例:定价页面测试
- 主要:套餐选择率
- 次要:页面停留时间、套餐分布
- 护栏:支持工单、退款率
设计变体
可变内容
| 类别 | 示例 |
|---|---|
| 标题/文案 | 信息角度、价值主张、具体性、语气 |
| 视觉设计 | 布局、颜色、图片、层次结构 |
| CTA | 按钮文案、大小、位置、数量 |
| 内容 | 包含的信息、顺序、数量、社会证明 |
最佳实践
- 单一、有意义的改动
- 足够大胆以产生差异
- 忠实于假设
流量分配
| 方法 | 分配 | 使用时机 |
|---|---|---|
| 标准 | 50/50 | A/B测试默认 |
| 保守 | 90/10, 80/20 | 限制不良变体的风险 |
| 逐步增加 | 从小开始,逐渐增加 | 技术风险缓解 |
考虑因素:
- 一致性:用户返回时看到相同变体
- 跨时段/周的均衡曝光
实施
客户端
- JavaScript在页面加载后修改页面
- 实施快速,可能导致闪烁
- 工具:PostHog, Optimizely, VWO
服务端
- 在渲染前确定变体
- 无闪烁,需要开发工作
- 工具:PostHog, LaunchDarkly, Split
运行测试
启动前检查清单
- [ ] 假设已记录
- [ ] 主要指标已定义
- [ ] 样本量已计算
- [ ] 变体已正确实施
- [ ] 跟踪已验证
- [ ] 所有变体已完成QA
测试期间
应做:
- 监控技术问题
- 检查细分质量
- 记录外部因素
避免:
- 偷看结果并提前停止
- 对变体进行更改
- 从新来源添加流量
偷看问题
在达到样本量之前查看结果并提前停止会导致假阳性并做出错误决策。预先承诺样本量并信任过程。
分析结果
统计显著性
- 95%置信度 = p值 < 0.05
- 意味着结果随机概率小于5%
- 并非保证——只是一个阈值
分析检查清单
- 达到样本量? 如果没有,结果是初步的
- 统计显著? 检查置信区间
- 效应量有意义? 与MDE、项目影响比较
- 次要指标一致? 支持主要指标?
- 护栏问题? 是否有任何指标变差?
- 细分差异? 移动端 vs. 桌面端?新用户 vs. 回访用户?
结果解读
| 结果 | 结论 |
|---|---|
| 显著胜出 | 实施变体 |
| 显著失败 | 保留对照组,了解原因 |
| 无显著差异 | 需要更多流量或更大胆的测试 |
| 混合信号 | 深入挖掘,可能细分 |
文档记录
记录每个测试,包括:
- 假设
- 变体(附截图)
- 结果(样本、指标、显著性)
- 决策和经验教训
关于模板:请参见references/test-templates.md
增长实验项目
单个测试很有价值。持续的实验项目是一种复利资产。本节介绍如何将实验作为持续的增长引擎来运行,而不仅仅是一次性测试。
实验循环
1. 生成假设(来自数据、研究、竞争对手、客户反馈)
2. 使用ICE评分进行优先级排序
3. 设计和运行测试
4. 以统计严谨性分析结果
5. 将获胜者推广到手册
6. 从经验教训中生成新假设
→ 重复
假设生成
从多个来源为实验积压提供素材:
| 来源 | 寻找什么 |
|---|---|
| 分析 | 流失点、低转化页面、表现不佳的细分 |
| 客户研究 | 痛点、困惑、未满足的期望 |
| 竞争对手分析 | 他们使用但你未使用的功能、信息或UX模式 |
| 支持工单 | 关于转化流程的重复问题或投诉 |
| 热图/录屏 | 用户犹豫、愤怒点击或放弃的地方 |
| 过去的实验 | “显著失败”的测试通常揭示新的尝试角度 |
ICE优先级排序
对每个假设在三个维度上评分1-10:
| 维度 | 问题 |
|---|---|
| 影响 | 如果有效,它会在多大程度上影响主要指标? |
| 信心 | 我们有多大把握它会有效?(基于数据,而非直觉。) |
| 容易度 | 我们能够多快、多便宜地推出并衡量这个? |
ICE分数 = (影响 + 信心 + 容易度) / 3
首先运行得分最高的实验。每月根据上下文变化重新评分。
实验速度
将实验率作为增长的领先指标进行跟踪:
| 指标 | 目标 |
|---|---|
| 每月启动的实验数 | 大多数团队4-8个 |
| 胜率 | 成熟项目通常为20-30%(持续更高的比率可能表明假设保守) |
| 平均测试持续时间 | 2-4周 |
| 积压深度 | 20+个假设排队 |
| 累计提升 | 所有获胜者的复合收益 |
实验手册
当测试获胜时,不仅要实施它——还要记录模式:
## [实验名称]
**日期**:[日期]
**假设**:[假设]
**样本量**:[每个变体的n]
**结果**:[胜者/败者/无结论] — [主要指标]变化了[X%](95%置信区间:[范围],p=[值])
**护栏**:[任何护栏指标及其结果]
**细分差异**:[按设备、细分或队列的显著差异]
**成功/失败原因**:[分析]
**模式**:[可复用的洞察——例如,“定价CTA附近的社会证明增加了套餐选择”]
**应用于**:[此模式可能有效的其他页面/流程]
**状态**:[已实施/搁置/需要后续测试]
随着时间的推移,您的手册将成为针对您的产品和受众的经过验证的增长模式库。
实验节奏
每周(30分钟):审查正在运行的实验的技术问题和护栏指标。不要提前判定胜者——但如果护栏指标显著负面,则停止测试。
每两周:总结已完成的实验。分析结果,更新手册,从积压中启动下一个实验。
每月(1小时):审查实验速度、胜率、累计提升。补充假设积压。使用ICE重新排序。
每季度:审计手册。哪些模式已广泛应用?哪些获胜模式尚未规模化?漏斗的哪些区域测试不足?
常见错误
测试设计
- 测试的改动太小(无法检测)
- 测试太多东西(无法隔离)
- 没有清晰的假设
执行
- 提前停止
- 测试中途更改
- 未检查实施
分析
- 忽略置信区间
- 挑选细分
- 过度解读无结论的结果
任务特定问题
- 您当前的转化率是多少?
- 此页面获得多少流量?
- 您正在考虑什么改动,为什么?
- 值得检测的最小改进是多少?
- 您有哪些测试工具?
- 您之前测试过这个区域吗?
相关技能
- cro:用于基于CRO原则生成测试想法
- analytics:用于设置测试衡量
- copywriting:用于创建变体文案





