agentsclimarketplace

Experiment orchestrator

Skill LuckyOneTwoThree/pm-skill/pm-05-metrics-ops/orchestrators/experiment-orchestrator

102 AI Agent Skills for the full product lifecycle. Compatible with Trae / Claude Code. 9 modules from discovery to launch to growth. | 102 个覆盖产品全生命周期的 AI Agent Skills,兼容 Trae / Claude Code,9 大模块从探索发现到上线增长。

Install
npx -y skills add LuckyOneTwoThree/pm-skill --skill experiment-orchestrator

Assembled from the repository path, not quoted from the project. Check it against their README if it does not work.

2 things to look at

  • no licenseNo license file was found in the repository. Code published without one is not open source by default, so using it at work is a question for whoever answers licensing questions where you are.
  • 6 stars6 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.

What its author says it does

Copied from the file, not written here

当需要设计或执行A/B测试实验时使用。实验验证指挥官,调度experiment-design/execution。关键词:A/B测试、实验设计、统计显著性、实验执行、效果验证、AB测试、对照实验。

SKILL.md

7.2 KB, ~2.3k tokens by cl100k_base, as published. Nobody here has run it

实验设计指挥官

核心原则

实验是学习的最快方式

每一个实验都是一次有控制的探索,目标不是证明假设正确,而是以最快速度获得可靠的学习。实验的价值在于学习速度,而非实验数量。

编排理念

  1. 设计→执行两阶段缺一不可:没有设计的执行是盲目的,执行阶段包含结果分析和报告生成
  2. 人类审核是实验的必要卡口:实验方案和实验报告都必须经人类审核,执行过程可自动化
  3. 护栏指标一票否决:无论主指标多正向,护栏指标突破即暂停

编排协议

编排协议遵循 orchestrator-protocol.md 统一标准。

Pipeline

pipeline: experiment-orchestrator
version: 8.0

post_pipeline:
  - action: stage-summary
    output: output/phase-reports/pm-metrics-ops/experiment-orchestrator.md

stages:
  - id: phase-1
    name: "实验设计"
    depends_on: []
    skills: [experiment-design]
    gate:
      condition: "实验设计经人类审核确认"
      fail_action: "阻止实验上线,修改后重新审核"

  - id: phase-2
    name: "实验执行"
    depends_on: [phase-1]
    skills: [experiment-execution]
    gate:
      condition: "样本量充足且统计检验完成、实验报告经人类审核确认"
      fail_action: "延长实验周期或扩大流量"

阶段执行计划

调用 experiment-design

Skill: experiment-design
输入:
  hypothesis: 用户提供(假设陈述)
  available_traffic: 用户提供(可用流量)
  metrics_system: metrics-system → metrics.json(可选)
  historical_data: analysis-funnel/analysis-retention(可选)
输出: output/pm-metrics-ops/experiment-design/
验证: 假设已结构化(If-Then-Because-For);主指标与假设直接对应;护栏指标覆盖留存、收入、技术三个维度;样本量计算参数有据可依
模式: 🤖→👤

调用 experiment-execution

Skill: experiment-execution
输入:
  experiment_design: output/pm-metrics-ops/experiment-design/experiment_design.json
  experiment_data: 用户提供
  termination_conditions: output/pm-metrics-ops/experiment-design/experiment_design.json
  product_background: 用户提供(可选)
输出: output/pm-metrics-ops/experiment-execution/
验证: 实验分组流量分配正确;护栏指标未触发告警;实验数据采集完整;统计显著性计算正确;统计结论与数据一致;行动建议与结论一致;护栏指标全覆盖;异质性效应已分析(至少3个分群维度)
模式: 🤖→👤

阶段总结(post_pipeline)

所有业务阶段执行完成后,必须立即生成阶段总结文档:

动作: 生成阶段总结
输入:
  所有子Skill输出: output/pm-metrics-ops/
  人类决策记录: 本轮执行中的人类决策点及结果
输出: output/phase-reports/pm-metrics-ops/experiment-orchestrator.md
验证: 阶段总结文档已生成,6项结构(执行概览/关键发现/决策记录/产出清单/风险与待办/下游衔接)均非空
下游衔接:
  primary:
    target: decision-orchestrator
    reason: 实验完成,将实验结论转化为决策行动
    input_mapping:
      experiment_output: "output/pm-metrics-ops/experiment-execution/ → decision-dace输入"
  alternatives:
    - target: release-orchestrator
      reason: 实验结果显著,建议全量发布
      condition: 实验结果统计显著(p<0.05)且业务意义达标时
    - target: analysis-orchestrator
      reason: 实验结果需更深入的数据分析
      condition: 实验结果存在异常或需多维下钻时
  special_cases: []
模式: 🤖

阶段卡口:阶段总结文档已生成且6项结构均非空 → 未通过:补充缺失结构项后重新生成

阶段卡口

卡口条件未通过处理
实验方案人类已审核实验设计经人类审核确认阻止实验上线,修改后重新审核
统计显著性已判断experiment-result输出文件已生成且非空延长实验周期或扩大流量
实验报告已审核实验报告经人类审核确认补充分析或修改结论
阶段总结已生成output/phase-reports/pm-metrics-ops/experiment-orchestrator.md 已生成且6项结构均非空补充缺失结构项后重新生成

人类决策点

决策点触发条件决策内容
实验方案审核实验设计完成审核假设合理性、指标选择、分流方案
全量/终止决策实验结果分析完成决定全量发布、终止实验或延长周期
实验报告确认实验报告生成完成确认报告结论和行动建议

决策规则

条件Action
样本量达到100%立即触发结果分析
统计显著(p < 0.05)且稳定考虑提前终止
护栏指标显著下降触发告警,考虑终止
新奇效应显著延长实验周期
实验组持续负向考虑提前终止

异常处理

异常类型处理策略
实验设计人类审核未通过阻止实验上线,返回设计阶段修改,不进入执行阶段
护栏指标突破阈值立即暂停实验执行,触发告警,提交人类决策是否终止实验
实验数据采集异常标记数据异常,暂停统计检验,提示人类检查数据管道
实验报告人类审核未通过返回执行阶段补充分析,不传递到下游
多实验流量冲突按优先级排队,低优先级实验暂停,标注"流量冲突"
阶段总结生成失败基于已完成的子Skill输出生成部分总结,缺失项标注"数据缺失",不阻塞编排完成

变更记录

  • v1.0: 初始版本
  • v2.0: 结构优化
  • v3.0: 新增 experiment-report(A/B测试报告)
  • v4.0: 编排器优化——任务调度改为阶段执行计划,新增子Skill执行协议,调度规则改为执行模式,阶段卡口和人类决策点改为表格
  • v5.0: 执行步骤原则替换为编排理念,新增异常处理表
  • v6.0: 编排协议优化——将"读取子Skill定义并代理执行"改为"使用Skill工具显式调用子Skill";新增Pipeline定义(YAML声明式执行图);阶段执行计划改为调用指令格式;调度规则合并入编排协议
  • v7.0: 阶段总结强化——Pipeline新增post_pipeline定义;调用规则第6条改为强制执行;阶段执行计划新增阶段总结执行指令;阶段卡口新增阶段总结校验;异常处理新增阶段总结生成失败策略
  • v8.0: 合并 experiment-report 到 experiment-execution,移除 experiment-report 阶段,更新编排理念为设计→执行两阶段

Keep looking

Skills are one crate of 328,083. Ordering is by how many stacks a row turns up in, so the top of any crate is what has actually been picked rather than what has the most stars.