Growth experiment planner
Skill linxumoney/growth-experiment-planner/skills/growth-experiment-planner
判断增长或产品想法是否值得做实验,并生成可证伪假设、指标、护栏、样本与时长评估、停止规则和结果决策。适用于用户提出 A/B 测试、增长实验、转化率优化、版本对比、实验优先级、低流量验证或“这个想法该怎么测”时。From its SKILL.md
npx -y skills add linxumoney/growth-experiment-planner --skill growth-experiment-plannerAssembled from the repository path, not quoted from the project. Check it against their README if it does not work.
One thing to look at
- 0 stars0 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.
SKILL.md
3.6 KB, ~1.2k tokens by cl100k_base, as published. Nobody here has run it
增长实验规划器
帮助用户设计能真正支持决策的增长实验。目标不是让每个想法都进入 A/B 测试,而是选择成本最低、证据质量足够的验证方式。
第一步:明确决策
先回答:实验结束后,团队准备根据结果做什么决定?
如果用户没有说明,提炼为一个明确决策,例如:
- 是否向全部用户发布该变化
- 是否继续投入开发
- 是否保留某个渠道
- 是否改变定价或信息表达
没有对应决策的实验,标记为“暂不值得测”。
第二步:选择验证方式
在以下方式中选择成本最低且足够可靠的一种:
直接修复:明显缺陷、合规问题、可访问性问题或已知错误。定性研究:问题和动机尚不清楚,先访谈、可用性测试或观察。仪表分析:现有行为数据已经能回答问题。原型测试:完整开发成本高,先验证理解与可用性。受控实验:有足够流量、稳定分流和明确可测指标。阶段发布:风险较高,需要先小范围观察护栏指标。
说明选择理由。不要默认 A/B 测试总是最佳方法。
第三步:建立证据链
把输入整理为:
- 观察:已经知道的事实或数据。
- 解释:对原因的推测。
- 改变:准备修改的单一变量。
- 结果:预期影响的用户行为。
- 决策:达到什么条件后采取什么动作。
事实和推测必须分开。缺少基线、流量或事件定义时明确标注。
第四步:生成实验卡
使用以下结构:
实验名称:
业务决策:
目标用户:
现有证据:
可证伪假设:
唯一变量:
对照版本:
实验版本:
主指标:
护栏指标:
最小有意义变化:
流量与时长判断:
停止条件:
发布条件:
失败后的下一步:
假设必须能被数据否定。避免“体验更好”“用户更喜欢”这类不可操作表达。
第五步:指标检查
- 主指标只能有一个,并直接对应决策。
- 诊断指标用于解释原因,不用于反复挑选胜利结果。
- 护栏指标覆盖收入、留存、错误率、退款、投诉或长期伤害。
- 指标必须有事件定义、分母、窗口和数据来源。
- 不把代理指标冒充最终价值。
第六步:可行性判断
根据用户给出的基线、流量和目标变化做量级判断。没有统计工具时,不编造精确样本量;明确说明需要计算器或分析人员复核。
出现以下情况时建议替代方案:
- 流量太低,合理时间内无法识别有意义变化。
- 多个变量同时变化,无法归因。
- 分流不稳定或用户跨组污染。
- 指标延迟过长。
- 实验可能给用户造成显著伤害。
输出格式
判断:适合实验 / 先做研究 / 直接修复 / 暂不投入
理由:一句话说明关键证据和限制
实验卡:
...
数据缺口:
- 最多列 3 项
下一步:
- 立即可执行的一个动作
边界
- 不伪造基线、样本量、显著性或实验结果。
- 不建议通过欺骗性界面、暗黑模式或隐瞒价格提高转化。
- 不因为结果不显著就宣称两个版本完全相同。
- 不在实验进行中反复查看后选择有利时点停止。
What ships with it: 1 file
299 B alongside SKILL.md
agents/
- openai.yaml299 B