agentsclimarketplace

Validation experiment

Skill LuckyOneTwoThree/pm-skill/pm-03-design/skills/validation-experiment

102 AI Agent Skills for the full product lifecycle. Compatible with Trae / Claude Code. 9 modules from discovery to launch to growth. | 102 个覆盖产品全生命周期的 AI Agent Skills,兼容 Trae / Claude Code,9 大模块从探索发现到上线增长。

Install
npx -y skills add LuckyOneTwoThree/pm-skill --skill validation-experiment

Assembled from the repository path, not quoted from the project. Check it against their README if it does not work.

2 things to look at

  • no licenseNo license file was found in the repository. Code published without one is not open source by default, so using it at work is a question for whoever answers licensing questions where you are.
  • 6 stars6 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.

What its author says it does

Copied from the file, not written here

当需要设计验证实验方案时使用。验证实验自动设计工具,根据假设地图和MVP范围,智能选择验证方法并设计实验方案,包括A/B测试和可用性测试的参数设计。关键词:实验设计、A/B测试、样本量、验证方法、验证方案、测试设计。

SKILL.md

9.8 KB, ~3.1k tokens by cl100k_base, as published. Nobody here has run it

验证实验自动设计

核心原则

  1. 实验是假设的审判庭——每个实验必须对应一个假设,没有假设的实验是浪费
  2. 最小成本获取最大置信度——实验设计追求成本最小化,而非完美数据
  3. 统计显著性是底线——样本量和置信水平必须预先设定,事后调整是作弊
  4. 失败实验和成功实验同样有价值——证伪假设与证实假设等效,关键是学到什么

基本信息

属性
Pipeline ID14
名称验证实验自动设计
执行模式🤖→👤 AI建议,人类审批
输入假设地图 + MVP范围 + 可用流量/用户数据

交互模式

🤖→👤 AI建议人类审批

输入

输入项类型必填来源说明
假设地图JSONoutput/pm-design/validation-assumption-map/assumption-map.jsonPipeline 12输出的假设地图
MVP范围JSONoutput/pm-design/validation-mvp/mvp-scope.jsonPipeline 13输出的MVP范围
可用流量/用户数据JSON用户提供当前用户量、日活、新增等数据

输入格式

{
  "assumption_map": [...],
  "mvp_scope": {...},
  "traffic_data": {
    "daily_active_users": 10000,
    "new_users_daily": 500,
    "weekly_users": 50000,
    "conversion_rate": 0.03
  }
}

执行步骤

Step 1: 验证方法选择

决策树:

开始
  ↓
流量是否足够A/B测试?
  ↓
是 → 考虑A/B测试
否 → 考虑可用性测试
  ↓
成本考量
  ↓
向导MVP / 原型测试 / 落地页测试

验证方法对比:

方法适用场景成本可靠性
A/B测试流量充足、需量化验证⭐⭐⭐⭐⭐
可用性测试流量不足、需定性洞察⭐⭐⭐⭐
落地页测试价值假设验证⭐⭐⭐
向导MVP可行性验证⭐⭐⭐⭐
原型测试可用性假设验证⭐⭐⭐⭐

选择规则:

条件推荐方法
日活 > 5000,且假设可量化A/B测试
日活 < 5000可用性测试
需要快速验证价值假设落地页测试
需要验证技术可行性向导MVP

Step 2: 实验方案设计

A/B测试设计方案

{
  "experiment_design": {
    "type": "A/B_TEST",
    "experiment_group": "实验组描述",
    "control_group": "对照组描述",
    "split_ratio": "50/50",
    "primary_metric": "主指标",
    "secondary_metrics": ["辅助指标"],
    "sample_size": 10000,
    "duration_days": 14,
    "minimum_detectable_effect": "MDE",
    "stopping_criteria": {
      "significance_level": 0.05,
      "statistical_power": 0.8,
      "early_stopping_conditions": ["达到显著性"]
    }
  }
}

参数计算说明:

参数说明计算依据
sample_size所需样本量基于MDE、显著性水平、统计功效
duration_days实验时长sample_size / 日均流量
split_ratio分流比例常用50/50,可调整

可用性测试设计方案

{
  "experiment_design": {
    "type": "USABILITY_TEST",
    "objectives": ["测试目标"],
    "task_script": [
      {
        "task_id": "T001",
        "task_description": "任务描述",
        "success_criteria": "成功标准"
      }
    ],
    "recruitment_criteria": {
      "user_count": 8,
      "qualification_questions": ["筛选问题"]
    },
    "success_metrics": {
      "task_completion_rate": ">90%",
      "time_on_task": "<2分钟",
      "error_rate": "<10%"
    }
  }
}

Step 3: 结果预判

三种场景:

{
  "outcome_scenarios": {
    "optimistic": {
      "condition": "指标提升≥MDE",
      "action": "推进开发,持续监控"
    },
    "neutral": {
      "condition": "指标有提升但不显著",
      "action": "延长实验或调整方案"
    },
    "pessimistic": {
      "condition": "指标无提升或下降",
      "action": "重新审视假设或调整方案"
    }
  }
}

输出

输出校验规则:详见下方章节 存储路径output/pm-design/validation-experiment/ 输出文件:experiment_plan.json

{
  "validation_experiment": {
    "method": "A_B_TEST|USABILITY_TEST|LANDING_PAGE|WIZARD_MVP",
    "target_assumption": {
      "id": "A001",
      "assumption": "假设内容",
      "risk_score": 16
    },
    "experiment_design": {
      "type": "A_B_TEST",
      "experiment_group": "...",
      "control_group": "...",
      "split_ratio": "50/50",
      "primary_metric": "点击率",
      "sample_size": 10000,
      "duration_days": 14,
      "stopping_criteria": {...}
    },
    "outcome_scenarios": {...}
  },
  "approval_status": "pending",
  "ai_recommendation": "AI建议说明"
}

输出校验规则:详见下方输出校验规则章节

决策规则

规则条件动作
人类审核所有实验方案必须人类审核
样本量不足sample_size > 可用流量降低MDE或改用可用性测试
周期过长duration_days > 30考虑提高流量或降低MDE

质量检查

检查项通过条件检查结果
方法选择有依据决策树结果有说明pass/fail
实验设计完整含所有必要参数pass/fail
成功标准明确有量化指标pass/fail
场景预判完整三种场景都有pass/fail
终止条件明确含显著性/功效要求pass/fail

降级策略

缺失的上游输入降级方案输出影响
假设地图缺失用户描述关键假设,设计实验缺乏结构化假设数据,实验与假设可能不对齐
方案设计数据缺失用户描述方案,设计实验缺乏方案数据,实验设计可能不够精准
假设地图+方案设计均缺失用户描述假设和方案,设计实验整体置信度降低,实验设计可能不够完整
所有上游文件均缺失提示用户先执行前序阶段,或基于用户描述设计实验输出仅为基本实验框架

输出校验规则

字段路径类型必填说明
experimentsarray实验列表
experiments[].idstring实验唯一标识
experiments[].assumption_idstring关联假设ID
experiments[].typestring实验类型
experiments[].hypothesisstring实验假设
experiments[].methodstring实验方法
experiments[].metricsarray指标列表
experiments[].metrics[].namestring指标名称
experiments[].metrics[].typestring指标类型(primary/secondary)
experiments[].metrics[].targetstring目标值
experiments[].sample_sizeobject样本量
experiments[].sample_size.minimuminteger最小样本量
experiments[].durationstring实验周期
experiments[].confidence_levelnumber置信水平
experiments[].cost_estimateobject成本估算
experiments[].resultobject实验结果(实验完成后填充)
experiments[].result.conclusionstring实验结论
experiments[].result.learningsarray学习要点

上游变更响应

上游变更影响

上游变更影响范围响应策略
假设地图变更(假设增删/评分变更)实验假设、实验优先级标注受影响的实验,建议人类确认是否重新设计
方案设计变更实验设计细节标注受影响的实验设计,建议人类确认是否调整
资源约束变更实验成本估算、样本量标注受影响的成本和样本量,建议人类确认是否调整

下游通知机制

实验设计变更类型通知范围通知方式
实验增删validation-mvp标记实验变更,触发MVP范围调整
实验优先级变更validation-mvp标记优先级变更,触发MVP验证计划更新
实验结果更新validation-mvp标记结果更新,触发MVP假设验证状态更新

使用示例

输入:

{
  "assumption_map": [
    {"id": "A001", "assumption": "用户认为推荐内容与兴趣匹配", "risk_score": 20}
  ],
  "traffic_data": {
    "daily_active_users": 10000,
    "new_users_daily": 500
  }
}

AI分析:

流量判断: 日活10000 > 5000,可进行A/B测试
假设类型: 价值假设 + 可用性假设
推荐方法: A/B测试

实验设计:
- 分流: 50/50
- 主指标: 推荐内容点击率
- 样本量: 约10000(基于MDE=10%)
- 时长: 14天

输出:

{
  "validation_experiment": {
    "method": "A_B_TEST",
    "target_assumption": {
      "id": "A001",
      "assumption": "用户认为推荐内容与兴趣匹配"
    },
    "experiment_design": {
      "type": "A_B_TEST",
      "primary_metric": "推荐内容点击率",
      "sample_size": 10000,
      "duration_days": 14
    }
  }
}

What ships with it

Read from the repository

Just SKILL.md. No reference files, no scripts.

Keep looking

Skills are one crate of 326,984. Ordering is by how many stacks a row turns up in, so the top of any crate is what has actually been picked rather than what has the most stars.