agentsclimarketplace

Validation experiment

Skill LuckyOneTwoThree/pm-skill/pm-03-design/skills/validation-experiment

当需要设计验证实验方案时使用。验证实验自动设计工具,根据假设地图和MVP范围,智能选择验证方法并设计实验方案,包括A/B测试和可用性测试的参数设计。关键词:实验设计、A/B测试、样本量、验证方法、验证方案、测试设计。From its SKILL.md

Install
npx -y skills add LuckyOneTwoThree/pm-skill --skill validation-experiment

Assembled from the repository path, not quoted from the project. Check it against their README if it does not work.

2 things to look at

  • no licenseNo license file was found in the repository. Code published without one is not open source by default, so using it at work is a question for whoever answers licensing questions where you are.
  • 6 stars6 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.

SKILL.md

9.8 KB, ~3.1k tokens by cl100k_base, as published. Nobody here has run it

验证实验自动设计

核心原则

  1. 实验是假设的审判庭——每个实验必须对应一个假设,没有假设的实验是浪费
  2. 最小成本获取最大置信度——实验设计追求成本最小化,而非完美数据
  3. 统计显著性是底线——样本量和置信水平必须预先设定,事后调整是作弊
  4. 失败实验和成功实验同样有价值——证伪假设与证实假设等效,关键是学到什么

基本信息

属性值
Pipeline ID14
名称验证实验自动设计
执行模式🤖→👤 AI建议,人类审批
输入假设地图 + MVP范围 + 可用流量/用户数据

交互模式

🤖→👤 AI建议人类审批

输入

输入项类型必填来源说明
假设地图JSON是output/pm-design/validation-assumption-map/assumption-map.jsonPipeline 12输出的假设地图
MVP范围JSON是output/pm-design/validation-mvp/mvp-scope.jsonPipeline 13输出的MVP范围
可用流量/用户数据JSON○用户提供当前用户量、日活、新增等数据

输入格式

{
  "assumption_map": [...],
  "mvp_scope": {...},
  "traffic_data": {
    "daily_active_users": 10000,
    "new_users_daily": 500,
    "weekly_users": 50000,
    "conversion_rate": 0.03
  }
}

执行步骤

Step 1: 验证方法选择

决策树:

开始
  ↓
流量是否足够A/B测试?
  ↓
是 → 考虑A/B测试
否 → 考虑可用性测试
  ↓
成本考量
  ↓
向导MVP / 原型测试 / 落地页测试

验证方法对比:

方法适用场景成本可靠性
A/B测试流量充足、需量化验证高⭐⭐⭐⭐⭐
可用性测试流量不足、需定性洞察中⭐⭐⭐⭐
落地页测试价值假设验证低⭐⭐⭐
向导MVP可行性验证高⭐⭐⭐⭐
原型测试可用性假设验证低⭐⭐⭐⭐

选择规则:

条件推荐方法
日活 > 5000,且假设可量化A/B测试
日活 < 5000可用性测试
需要快速验证价值假设落地页测试
需要验证技术可行性向导MVP

Step 2: 实验方案设计

A/B测试设计方案

{
  "experiment_design": {
    "type": "A/B_TEST",
    "experiment_group": "实验组描述",
    "control_group": "对照组描述",
    "split_ratio": "50/50",
    "primary_metric": "主指标",
    "secondary_metrics": ["辅助指标"],
    "sample_size": 10000,
    "duration_days": 14,
    "minimum_detectable_effect": "MDE",
    "stopping_criteria": {
      "significance_level": 0.05,
      "statistical_power": 0.8,
      "early_stopping_conditions": ["达到显著性"]
    }
  }
}

参数计算说明:

参数说明计算依据
sample_size所需样本量基于MDE、显著性水平、统计功效
duration_days实验时长sample_size / 日均流量
split_ratio分流比例常用50/50,可调整

可用性测试设计方案

{
  "experiment_design": {
    "type": "USABILITY_TEST",
    "objectives": ["测试目标"],
    "task_script": [
      {
        "task_id": "T001",
        "task_description": "任务描述",
        "success_criteria": "成功标准"
      }
    ],
    "recruitment_criteria": {
      "user_count": 8,
      "qualification_questions": ["筛选问题"]
    },
    "success_metrics": {
      "task_completion_rate": ">90%",
      "time_on_task": "<2分钟",
      "error_rate": "<10%"
    }
  }
}

Step 3: 结果预判

三种场景:

{
  "outcome_scenarios": {
    "optimistic": {
      "condition": "指标提升≥MDE",
      "action": "推进开发,持续监控"
    },
    "neutral": {
      "condition": "指标有提升但不显著",
      "action": "延长实验或调整方案"
    },
    "pessimistic": {
      "condition": "指标无提升或下降",
      "action": "重新审视假设或调整方案"
    }
  }
}

输出

输出校验规则:详见下方章节 存储路径:output/pm-design/validation-experiment/ 输出文件:experiment_plan.json

{
  "validation_experiment": {
    "method": "A_B_TEST|USABILITY_TEST|LANDING_PAGE|WIZARD_MVP",
    "target_assumption": {
      "id": "A001",
      "assumption": "假设内容",
      "risk_score": 16
    },
    "experiment_design": {
      "type": "A_B_TEST",
      "experiment_group": "...",
      "control_group": "...",
      "split_ratio": "50/50",
      "primary_metric": "点击率",
      "sample_size": 10000,
      "duration_days": 14,
      "stopping_criteria": {...}
    },
    "outcome_scenarios": {...}
  },
  "approval_status": "pending",
  "ai_recommendation": "AI建议说明"
}

输出校验规则:详见下方输出校验规则章节

决策规则

规则条件动作
人类审核所有实验方案必须人类审核
样本量不足sample_size > 可用流量降低MDE或改用可用性测试
周期过长duration_days > 30考虑提高流量或降低MDE

质量检查

检查项通过条件检查结果
方法选择有依据决策树结果有说明pass/fail
实验设计完整含所有必要参数pass/fail
成功标准明确有量化指标pass/fail
场景预判完整三种场景都有pass/fail
终止条件明确含显著性/功效要求pass/fail

降级策略

缺失的上游输入降级方案输出影响
假设地图缺失用户描述关键假设,设计实验缺乏结构化假设数据,实验与假设可能不对齐
方案设计数据缺失用户描述方案,设计实验缺乏方案数据,实验设计可能不够精准
假设地图+方案设计均缺失用户描述假设和方案,设计实验整体置信度降低,实验设计可能不够完整
所有上游文件均缺失提示用户先执行前序阶段,或基于用户描述设计实验输出仅为基本实验框架

输出校验规则

字段路径类型必填说明
experimentsarray是实验列表
experiments[].idstring是实验唯一标识
experiments[].assumption_idstring是关联假设ID
experiments[].typestring是实验类型
experiments[].hypothesisstring是实验假设
experiments[].methodstring是实验方法
experiments[].metricsarray是指标列表
experiments[].metrics[].namestring是指标名称
experiments[].metrics[].typestring是指标类型(primary/secondary)
experiments[].metrics[].targetstring是目标值
experiments[].sample_sizeobject是样本量
experiments[].sample_size.minimuminteger是最小样本量
experiments[].durationstring是实验周期
experiments[].confidence_levelnumber是置信水平
experiments[].cost_estimateobject是成本估算
experiments[].resultobject否实验结果(实验完成后填充)
experiments[].result.conclusionstring否实验结论
experiments[].result.learningsarray否学习要点

上游变更响应

上游变更影响

上游变更影响范围响应策略
假设地图变更(假设增删/评分变更)实验假设、实验优先级标注受影响的实验,建议人类确认是否重新设计
方案设计变更实验设计细节标注受影响的实验设计,建议人类确认是否调整
资源约束变更实验成本估算、样本量标注受影响的成本和样本量,建议人类确认是否调整

下游通知机制

实验设计变更类型通知范围通知方式
实验增删validation-mvp标记实验变更,触发MVP范围调整
实验优先级变更validation-mvp标记优先级变更,触发MVP验证计划更新
实验结果更新validation-mvp标记结果更新,触发MVP假设验证状态更新

使用示例

输入:

{
  "assumption_map": [
    {"id": "A001", "assumption": "用户认为推荐内容与兴趣匹配", "risk_score": 20}
  ],
  "traffic_data": {
    "daily_active_users": 10000,
    "new_users_daily": 500
  }
}

AI分析:

流量判断: 日活10000 > 5000,可进行A/B测试
假设类型: 价值假设 + 可用性假设
推荐方法: A/B测试

实验设计:
- 分流: 50/50
- 主指标: 推荐内容点击率
- 样本量: 约10000(基于MDE=10%)
- 时长: 14天

输出:

{
  "validation_experiment": {
    "method": "A_B_TEST",
    "target_assumption": {
      "id": "A001",
      "assumption": "用户认为推荐内容与兴趣匹配"
    },
    "experiment_design": {
      "type": "A_B_TEST",
      "primary_metric": "推荐内容点击率",
      "sample_size": 10000,
      "duration_days": 14
    }
  }
}

What ships with it

Read from the repository

Just SKILL.md. No reference files, no scripts.

Keep looking

Skills are one crate of 325,949. Ordering is by how many stacks a row turns up in, so the top of any crate is what has actually been picked rather than what has the most stars.