问题所在:你在做改动,但这些改动真的在提升效果吗?
你构建了一个处理客户咨询的AI智能体。你认为一个新的提示词可能会提高响应准确性。或者你设计了一个智能体对传入请求进行分类的工作流,想测试不同的路由逻辑。你做出改动,部署它,然后……接下来会发生什么?
如果你和大多数AI智能体构建者一样,你可能会查看一些指标,也许检查投诉是否减少,然后凭直觉宣布成功或失败。这种方法有一个根本问题:你实际上不知道这个改动是有帮助、有害,还是根本没有区别。
这种情况发生的原因是:
- 没有基线测量。 你没有在改动前捕获"正常"状态是什么样的。
- 没有受控比较。 同一时间还有其他事情发生了变化——用户行为发生了转变,不同类型的请求进来了,或者外部因素影响了结果。
- 没有统计严谨性。 你查看了小样本,得出的结论很容易被随机变异解释。
- 没有定义成功标准。 你没有提前明确"更好"意味着什么,或者多大的改进才算有意义。
结果呢?你在没有实际效果的改动上浪费时间。你放弃了实际上有效但快速浏览时没有明显效果的改动。你从半测试的修改中积累了技术债务。而且你对系统化改进智能体的能力失去了信心。
好的解决方案应该改变什么
正确的实验方法意味着:
- 在做改动前定义假设。 "如果我将提示词改为包含明确的逐步说明,智能体的任务完成率将至少提高5%。"
- 测量基线。 你知道当前的任务完成率是73%。
- 运行受控测试。 一些用户获得旧版本,一些获得新版本,随机分配。
- 等待统计显著性。 你不会在一个版本看起来更好时就立即停止测试。
- 基于证据做决策。 你知道这个改动以95%的置信度将完成率提高了7%。
这不仅仅关乎一次测试。这是关于建立一种通过严谨实验持续改进智能体的实践。你维护一个测试想法的待办列表,对其进行优先排序,正确运行它们,并从每次测试中学习。
介绍A/B测试设置技能
如果上面描述的问题听起来很熟悉,那么值得考察一下A/B测试设置技能。它是一个更大的营销导向技能集合的一部分,旨在帮助你规划、设计和实施A/B测试,并建立增长实验项目。
这个技能本身不是一个测试平台。它不会为你运行实验。相反,它为正确设计测试提供结构化指导——涵盖假设形成、样本量计算、测试持续时间规划和结果解释。
这个技能实际做什么
当你调用这个技能时,它充当实验顾问。它帮助你:
- 评估你的测试背景。 你试图改进什么?你在考虑什么改动?你当前的基线是什么?
- 设计测试结构。 变体应该如何定义?你的对照组和实验组是什么?哪些指标重要?
- 计算需求。 你需要多少流量?测试应该运行多长时间?最小可检测效应是什么?
- 应用实验原则。 确保你的测试产生统计有效、可操作的结果。
该技能会在提问前检查现有的产品营销上下文文件(.agents/product-marketing-context.md 或旧设置中的 .claude/product-marketing-context.md),因此它可以利用你已经记录的信息工作。
这个技能何时适用
当你处理以下场景时,这个技能是相关的:
- 比较两个提示词版本,想知道哪个产生更好的响应。
- 测试不同的工作流配置,如路由逻辑、升级阈值或交接标准。
- 评估UI/UX更改,如智能体界面中的按钮位置、对话流程或响应格式。
- 建立实验项目,你想系统地测试和改进你的智能体。
- 回答诸如"我应该测试这个改动吗?"或"我需要运行这个测试多长时间?"或"这个结果在统计上显著吗?"等问题。
该技能的描述明确提到了触发词,包括"A/B测试"、"拆分测试"、"实验"、"测试这个改动"、"变体文案"、"多变量测试"、"假设"、"统计显著性"、"增长实验"、"实验速度"、"ICE评分"和"实验项目"。如果你的问题涉及比较方法并衡量哪个表现更好,这个技能就适用。
这个技能何时不适用
同样重要的是了解何时应该寻找其他方案:
- 对于跟踪实施(设置分析事件、配置跟踪像素),技能描述指向一个单独的
analytics-tracking技能。 - 对于页面级转化优化(着陆页设计、页面级别的CTA测试),有一个专门的
page-cro技能。 - 对于运行实际实验(流量拆分、用户分配、数据收集),你需要一个单独的测试平台或基础设施。
这个技能专注于规划和设计阶段,而不是运行实验的技术执行。
评估这个技能是否适合你的工作流
在采用这个技能之前,考虑以下因素:
你的实验成熟度
适合的情况:
- 你是A/B测试新手,需要正确测试设计的指导。
- 你一直在进行非正式测试,想增加统计严谨性。
- 你想建立系统化的实验实践,但不知道从哪里开始。
可能不需要的情况:
- 你已经有一个成熟的实验框架和既定流程。
- 你的团队包括专门处理测试设计的数据科学家。
你的使用场景
适合的情况:
- 你正在构建AI智能体,想测试提示词、工作流或配置的改动。
- 你在营销或增长领域工作,想将实验原则应用于智能体的性能。
- 你需要关于样本量、测试持续时间和统计显著性等方面的帮助。
考虑替代方案的情况:
- 你需要运行测试的技术基础设施方面的帮助(流量拆分、功能标志)。
- 你在寻找一个自动运行和分析实验的工具。
你的技术背景
该技能是 marketingskills 仓库的一部分,包含多个营销导向的技能。它设计用于AI编码助手(仓库主题包括 claude 和 codex)。如果你使用的AI智能体可以从这个目录消费技能,集成是直接的。
使用前需要检查的内容
仓库信号
- 星标和分叉: 仓库有41,711个星标和6,565个分叉,表明社区采用和兴趣度很高。
- 许可证: MIT许可证,允许修改和再分发,是宽松的。
- 主题:
claude、codex、marketing——表明该技能是为营销环境中的AI编码助手设计的。 - 仓库结构: 该技能是更大集合(
marketingskills)的一部分,表明它与相关技能一起维护。
安全信号
- 安全级别: 列为"低",意味着该技能不需要提升权限或访问敏感系统。
- 没有安装命令: 该技能不包含特定的安装命令,表明它是通过你的AI智能体的技能消费机制使用的,而不是需要单独设置。
- 没有提到外部依赖: 该技能似乎是自包含的指导,而不是需要API密钥或外部服务连接。
内容质量
该技能的 SKILL.md 摘录显示了结构化的指导,包含清晰的部分:
- 初始评估: 在提问前检查现有上下文。
- 核心原则: 强调统计有效、可操作的结果。
- 结构化方法: 涵盖测试背景、当前状态和约束。
这表明该技能提供有条理的指导,而不是通用建议。
实际示例:测试新的智能体提示词
让我们通过一个真实场景来说明这个技能如何提供帮助。
你的情况: 你构建了一个客户支持AI智能体。你想测试在提示词中添加明确的逐步说明是否能提高任务完成率。
没有这个技能: 你更改提示词,部署给所有用户,一周后检查指标。如果完成率上升了,你就宣布成功。但你不知道这个改进是由于提示词的改动、用户行为的转变,还是随机变异。
使用这个技能: 该技能会指导你完成:
- 定义假设: "在提示词中添加逐步说明将使任务完成率至少提高5个百分点。"
- 建立基线: 你过去30天的当前完成率是73%。
- 计算样本量: 根据你的流量和期望的置信水平,每个变体大约需要2,000次交互。
- 规划测试持续时间: 按你当前的流量速率,测试需要运行14天。
- 定义成功标准: 如果新提示词以95%的统计显著性达到至少78%的完成率,你将认为测试成功。
- 设置测试结构: 50%的用户看到旧提示词(对照组),50%看到新提示词(实验组),随机分配。
这种结构化方法确保你获得可靠的结果,可以自信地据此行动。
建立实验实践
除了单个测试,这个技能可以帮助你建立系统化的实验项目:
- 实验待办列表: 维护一个优先排序的测试想法列表。
- ICE评分: 使用影响力、置信度和容易度来优先排序实验。
- 实验速度: 跟踪你正在运行和学习的测试数量。
- 实验手册: 记录你的测试过程以保持一致性。
这将临时测试转变为AI智能体的严谨改进实践。
局限性和注意事项
n
- 不是测试平台: 这个技能帮助测试设计,而不是测试执行。你需要单独的基础设施来进行流量拆分和数据收集。
- 需要统计理解: 虽然该技能提供指导,但你仍然需要理解统计显著性、样本量和置信区间等概念。
- 依赖上下文: 该技能检查现有的上下文文件,因此在你记录了产品营销信息时效果最好。
- 营销导向: 该技能来自营销技能集合,因此示例和术语可能偏向营销用例,尽管这些原则广泛适用。
下一步
如果你有兴趣为AI智能体的能力添加结构化的A/B测试指导:
- 查看技能页面: 访问A/B测试设置技能页面获取完整详情。
- 检查仓库: 查看marketingskills仓库以了解更广泛的背景和相关技能。
- 用一个简单实验测试: 在承诺完整的实验项目之前,尝试使用该技能为你的智能体设计一个A/B测试。
- 检查兼容性: 确保你的AI智能体设置可以从这个目录消费技能。
目标不是给你的工作流增加复杂性。而是确保当你对AI智能体做出改动时,你确实知道这些改动是否有帮助。