Ai native experiment engine
Skill gmaxxxie/ai-native-product-agent-skills/skills/ai-native-experiment-engine
AI Native Product Methodology — 80 executable skills across P0-P14 stages, covering needs discovery to aesthetic authority. From 8 books.
npx -y skills add gmaxxxie/ai-native-product-agent-skills --skill ai-native-experiment-engineAssembled from the repository path, not quoted from the project. Check it against their README if it does not work.
One thing to look at
- no licenseNo license file was found in the repository. Code published without one is not open source by default, so using it at work is a question for whoever answers licensing questions where you are.
What its author says it does
Copied from the file, not written here
AI Native 产品方法论——试验展开阶段的实操 Skill。 用户提供 Direction Brief 或问题方向,Skill 自动执行试验展开流程: 资料准备 → 能力实验 → 产品实验 → 商业实验 → 评估与失败分析 → 输出实验结论报告。 覆盖《AI Native 产品方法论》第06-10章。
SKILL.md
20.4 KB, as published. Nobody here has run it
AI Native 试验展开 Skill
触发条件
当用户提供 Direction Brief 或已通过方向定界的问题方向,需要进入实验验证阶段时,触发此 Skill。
使用场景
- 方向定界已完成,需要进入实验验证阶段
- 需要设计一组可验证、可比较、可放弃、可继承的实验体系
- 需要判断某个 AI 能力在真实任务中是否成立
执行步骤
- 资料准备:准备外部资料、内部业务资料、样本集(正例/负例/边界案例)和评估标准(Rubric)。
- 能力实验:先用最强模型测试能力天花板,确定上限后用更便宜模型测试成本压缩空间。
- 产品实验:验证用户是否愿意以某种交互或流程使用这项能力,评估任务完成率和满意度。
- 商业实验:验证客户是否愿意付费试点,评估续期意愿和场景扩展可能性。
- 评估与失败分析:用样本、对照和失败案例判断能力是否成立,沉淀失败模式为下一轮优化输入。
- 输出实验结论报告:整合能力边界、产品形态建议、资料缺口、风险边界和进入系统构建的条件。
整合子方法(原 p2a–p2e)
p2a: 试验展开概述
从 Direction Brief 出发,执行资料准备评估→三层实验体系设计(能力/产品/商业)→评估 Rubric 建立→实验节奏规划,输出试验展开总体方案。确保每轮实验可验证、可比较、可放弃、可继承。
p2b: 产品形态探索
在能力实验结论基础上,通过能力边界分析→交互原型设计→工作流嵌入测试→产品形态判断,用实验驱动设计(而非拍脑袋)决定最终形态:问答、Copilot、工作流还是 Agent。
p2c: 流程重构与任务设计
产品形态确定后,执行任务拆解→人机协作模式选择(助手/协同/自主)→工作流设计→节点标注(Human-in-the-Loop vs on-the-Loop)→验证与迭代,输出流程重构方案。
p2d: 目标收敛与产品决策
多轮实验完成后,整理实验记录→证据对比分析→收敛信号识别(稳定成功率/清晰边界/用户接受度/价值密度)→做出继续/延后/转向/停止的产品决策,输出收敛报告。
p2e: 影子验证
收敛决策后,设计影子系统→与人工流程并行运行→建立人工对比机制→沉淀失败模式→为审计放行准备真实可量化证据。影子验证是离线评估与灰度上线之间的关键桥梁。
核心概念
- 能力实验(Capability Experiment):验证某项 AI 能力在真实任务中是否成立
- 产品实验(Product Experiment):验证用户是否愿意以某种交互或流程使用这项能力
- 商业实验(Business Experiment):验证客户是否愿意为这类能力投入预算或试点资源
- 评估(Evaluation):用样本、对照和失败案例判断能力是否成立
试验展开流程
资料准备
→ 能力实验(先用最强模型看天花板)
→ 产品实验(验证交互和流程)
→ 商业实验(验证价值密度和付费意愿)
→ 评估与失败分析
→ 输出实验结论报告
第一步:资料准备
试验前必须准备:
- 外部资料:行业知识、公开规则、产品文档
- 内部业务资料:SOP、历史工单、对话记录、专家经验
- 样本集:正例、负例、边界案例、长尾问题
- 评估标准(Rubric):什么算对、什么算错、什么算可接受
没有资料准备的实验会漂浮。
第二步:能力实验
原则:先看能力上限,再压缩成本
- 先用最强模型(如 GPT-4o/Claude Opus)测试能力天花板
- 确定能力上限足够高后,再用更便宜模型测试能否保住目标效果
- 如果最强模型也无法达到可接受水平,应该放弃或重新定义问题
能力实验要验证的问题
- AI 到底能做到什么深度
- 哪些场景能够稳定成立
- 哪些场景只能做到辅助,不能做到自动化
- 哪些场景即使技术可行,也没有足够高的价值密度
实验产物
- 流程类 demo:任务流程、节点跳转、人工接管点、审批逻辑
- 功能类 demo:问答、分类、归因、生成建议
- 界面类 demo:单页界面、工作台原型、表单交互或 Copilot 面板
- 系统说明文档:边界、模块、接口草稿、评估方式、失败处理
第三步:产品实验
验证用户是否愿意以某种交互或流程使用这项能力:
- 用户如何表达目标
- 系统如何展示状态和建议
- 用户如何纠偏或确认
- 任务完成率和满意度
第四步:商业实验
验证价值密度:
- 客户是否愿意付费试点
- 续期意愿如何
- 场景扩展可能性
- 与现有解决方案的成本对比
第五步:评估与失败分析
评估不是看主观感觉
- 用样本、对照和失败案例判断能力是否成立
- 建立评估 Rubric:明确什么算对、什么算错、什么算可接受
- 每次实验都应有可量化的评估结果
失败分析是实验最重要的产物
- 哪些场景能稳定成立,哪些不能
- 哪些问题资料还不够
- 哪些能力只适合做建议,哪些已经有机会进入产品化
- 失败案例应该被沉淀为下一轮优化的输入
输出物:实验结论报告
- 能力边界:哪些场景能稳定成立,哪些不能
- 产品形态建议:问答、Copilot、工作流、智能体,哪种更适合
- 资料缺口:还需要补充哪些材料才能进入系统构建
- 风险边界:哪些动作必须人工接管
- 进入系统构建的条件:什么条件满足后可以进入系统构建
使用方式
当用户提供 Direction Brief 或问题方向时,自动执行:
- 检查资料准备是否充分
- 设计能力实验方案(先强模型看上限)
- 设计产品实验方案(交互与流程验证)
- 设计商业实验方案(价值密度验证)
- 建立评估 Rubric 并执行评估
- 沉淀失败案例和人工修正
- 输出实验结论报告
示例
示例1:AI 客服 Copilot 能力验证
场景描述: 基于方向定界输出的 Direction Brief,验证 AI 客服候选回复生成的能力边界。
用户输入: Direction Brief:AI 客服协同系统(已完成方向定界)
Skill 执行流程:
-
资料准备验证
- 检查已有:FAQ(500条)、工单样本(1000条)、物流规则
- 需要补充:50条边界案例(模糊问题、多轮对话、情绪问题)
- 评估标准:准确性、完整性、风险识别率
-
能力实验
实验批次 模型 场景 准确率 结论 第1批 GPT-4o 订单查询 92% ✅ 能力强 第2批 GPT-4o 物流异常解释 85% ✅ 可用 第3批 Claude 3.5 售后政策咨询 78% ⚠️ 需资料补充 第4批 GPT-4o-mini 订单查询 88% ✅ 可压缩成本 -
产品实验(影子验证)
- 在真实会话中运行系统,输出候选回复但不发送
- 对比人工客服实际回复与系统建议
- 评估:采纳率65%,人工修改率35%
- 发现问题:多轮上下文丢失、异常情况处理不足
-
商业实验
- 与客服主管访谈:预计节省30%培训时间
- 测算:首响时间从5分钟→1分钟,但人工审核增加20%
- 结论:净效益正向,ROI > 200%
-
失败分析
失败类型 数量 原因 解决方案 上下文丢失 12 会话状态未保留 加入记忆系统 敏感承诺 5 未识别价格承诺 增加规则拦截 过度承诺 8 超出政策范围 收紧生成边界
输出结果:
# 实验结论报告:AI 客服 Copilot
## 能力边界(已验证)
✅ 订单查询:92%准确率,可用
✅ 物流解释:85%准确率,可用
⚠️ 售后政策:78%准确率,需补充资料
❌ 投诉处理:不适合AI独立完成
## 产品形态建议
- 类型:Copilot(人工确认模式)
- 界面:侧边栏候选回复 + 风险标记
- 关键交互:一键采纳、快速编辑、风险提示
## 资料缺口
- 需要补充200条售后政策边界案例
- 需要建立敏感承诺规则库
- 需要测试集覆盖更多长尾问题
## 风险边界
- 退款、赔付相关:必须人工确认
- 价格相关:必须引用最新数据源
- 情感升级:自动转人工
## 进入系统构建条件
✅ 能力边界已清晰
✅ 产品形态已验证
⚠️ 需补充售后政策资料(预计1周)
✅ ROI已验证正向
示例2:AIOps 故障分诊能力验证
场景描述: 验证 AI 在告警聚类、日志解释、案例召回上的能力边界。
用户输入: Direction Brief:AIOps 故障分诊辅助系统
Skill 执行流程:
-
资料准备
- 样本集:50个历史故障(含日志、告警、处理记录)
- 评估标准:召回率 > 80%,误报率 < 20%
-
分层能力实验
第一层:日志解释能力
- 测试:100条典型日志
- 结果:GPT-4o 解释准确 88%,Claude 3.5 85%
- 结论:✅ 能力成立
第二层:告警聚类能力
- 测试:10次真实故障的告警流(共300条)
- 结果:相关告警聚类准确率 82%
- 失败案例:跨服务依赖关系未识别
- 结论:⚠️ 基本可用,需改进依赖分析
第三层:案例召回能力
- 测试:新故障发生时召回历史相似案例
- 结果:Top3 召回准确率 75%
- 结论:⚠️ 可用但需优化索引策略
-
产品实验(影子验证)
- 值班工程师处理故障时,系统并行输出分诊建议
- 对比结果:系统建议 vs 工程师实际判断
- 评估:采纳率55%,辅助参考率80%
- 关键发现:系统擅长"看什么",弱于"怎么做"
-
商业与风险评估
- 价值:平均定位时间从45分钟→25分钟
- 风险:2次错误归因建议(被工程师识别后忽略)
- 结论:高风险场景需强化边界控制
-
失败案例分析
失败场景 原因 改进方向 新型异常未识别 超出历史案例库 建立未知异常标记机制 依赖关系误判 缺少服务拓扑数据 补充CMDB集成 时序相关故障遗漏 未关联时间窗口 加入时间序列分析
输出结果:
# 实验结论报告:AIOps 故障分诊系统
## 能力边界(验证结果)
✅ 日志解释:88%准确率
⚠️ 告警聚类:82%准确率(依赖分析弱)
⚠️ 案例召回:75%准确率(需优化索引)
❌ 自动修复:明确不做(高风险)
## 产品形态建议
- 主形态:值班面板辅助(非自动执行)
- 输出:故障摘要卡 + 相似案例 + "建议先看"
- 边界:不提供操作建议,只提供信息组织
## 资料缺口
- 需要服务依赖拓扑数据
- 需要更多跨服务故障案例
- 需要建立异常标记与升级规则
## 风险边界(高约束设计)
- AI输出 = 建议,不是命令
- 所有AI建议需人工确认后执行
- 生产操作权限永不开放给AI
- 误判路径100%可追溯
## 进入系统构建条件
✅ 三层能力通过验证
⚠️ 需CMDB数据接入(2周)
✅ 风险边界已明确
✅ 影子验证完成(采纳率55%)
示例3:法律合同审查助手能力验证
场景描述: 基于方向定界,验证 AI 在法律合同条款识别和风险提示上的能力边界。
用户输入: Direction Brief:法律合同审查助手(限定为非最终决策,仅辅助)
Skill 执行流程:
-
资料准备
- 样本集:100份标准合同(NDA、服务协议、劳动合同)
- 法律条款库:常见风险条款模板
- 评估标准:条款识别准确率、风险判断准确率
-
分层能力实验
第一层:条款识别能力
合同类型 测试数量 GPT-4o Claude 3.5 结论 NDA保密协议 30份 90% 88% ✅ 可用 服务协议 40份 85% 82% ✅ 可用 劳动合同 30份 78% 75% ⚠️ 需补充 第二层:风险提示能力
- 测试:识别"不对等条款"(如单方解约权、无限责任)
- 结果:高风险条款识别率 82%,但部分隐蔽条款漏检
- 失败案例:隐含在"其他"条款中的风险未能识别
第三层:成本压缩测试
- GPT-4o-mini:准确率下降 8%,但成本降低 70%
- 结论:对于初筛场景,可使用低成本模型
-
产品实验(影子验证)
- 法务专员审查合同,AI 并行分析
- 对比:专员实际标记 vs AI 标记
- 结果:
- AI 辅助发现额外风险点数量:平均 1.2 个/份合同
- 专员对 AI 建议采纳率:45%
- 审查时间:从 1.5小时 → 45分钟
-
失败分析
失败类型 比例 原因 改进措施 隐含条款遗漏 15% 风险不在标准条款中 建立隐含风险模式库 行业特殊条款 12% 特定行业术语不理解 补充行业词典 上下文误判 8% 条款组合效应未识别 增强上下文分析
输出结果:
# 实验结论报告:法律合同审查助手
## 能力边界
✅ 标准条款识别(NDA、服务协议):88%+
⚠️ 复杂合同(劳动、股权):75-78%,需改进
✅ 高风险条款标记:82%
❌ 隐含风险识别:能力不足
## 产品形态建议
- Copilot 模式:并排显示原始合同 + AI 标记
- 人机协作:AI 初筛 → 人工复核
- 输出:checklist + 风险条款高亮 + 修改建议
## 关键发现
- 适合标准合同快速审查
- 复杂交易合同仍需资深律师主导
- AI 发现的问题平均 40% 被专员认可采纳
## 进入系统构建条件
⚠️ 补充200份劳动/股权合同样本
✅ 法务团队认可边界设定
✅ 影子验证通过
示例4:HR 智能简历筛选助手
场景描述: 验证 AI 在简历解析、候选人匹配、初筛评估上的能力,需特别注意公平性和偏见问题。
用户输入: Direction Brief:HR 智能简历筛选助手
Skill 执行流程:
-
资料准备
- 样本集:1000份历史简历(已脱敏去除姓名、性别、年龄)
- 岗位要求:5个标准岗位(Java开发、产品经理、销售等)
- 评估标准:匹配准确率、偏见检测
-
能力实验
技能点1:简历信息提取
- 测试:从PDF/Word中提取结构化信息
- 结果:
- 教育背景:94% 准确率
- 工作经历:87% 准确率(部分非标准格式简历困难)
- 技能标签:79% 准确率(技能同义词识别不足)
技能点2:岗位匹配评分
- 测试:根据JD要求给候选人打分
- 结果:
- Top10 推荐命中率:68%
- 与 HR 专员评分相关性:0.72(中等相关)
技能点3:偏见检测
- 测试:匿名化简历 vs 完整简历的评分差异
- 关键发现:
- 去除性别信息后,技术岗男女得分无显著差异 ✅
- 但某些管理岗仍略有偏差 ⚠️(需持续监控)
-
产品实验
- 在真实招聘流程中并行运行
- HR 先按原流程筛选,再看 AI 建议
- 结果:
- AI 发现"遗漏候选人"比例:12%
- 这些被遗漏候选人中,最终面试通过率:35%
- 说明 AI 发现了一些人类筛选中的盲点
-
公平性评估
维度 测试结果 风险等级 性别偏见 无显著差异 🟢 低风险 学历偏好 存在过度偏好985/211 🟡 中风险 年龄相关 无明显年龄歧视 🟢 低风险 地域相关 部分地域词汇偏见 🟡 中风险
输出结果:
# 实验结论报告:HR 智能简历筛选助手
## 能力边界
✅ 简历信息提取:教育94%、经历87%
⚠️ 岗位匹配:Top10命中率68%,有提升空间
⚠️ 公平性:整体可控,但需监控学历/地域偏见
## 重要发现:AI 发现人类盲点
- AI 识别出 HR 遗漏的合格候选人 12%
- 这些候选人面试通过率 35%
- AI 在"非标准背景但有潜力"的识别上有优势
## 产品形态建议
- 初筛助手:辅助而非替代 HR 筛选
- 盲筛模式:默认隐藏可能导致偏见的信息
- 透明度:显示匹配依据(哪些JD要求被满足)
- 反馈闭环:HR 驳回时标记原因,优化模型
## 公平性保障措施
- 定期偏见审计(A/B 测试)
- 多样性指标监控
- 申诉机制:候选人可请求人工复核
## 进入系统构建条件
⚠️ 建立偏见监控 dashboard
✅ HR 团队培训完成(理解 AI 辅助边界)
✅ 法务确认合规性
示例5:内容创作智能助手(营销文案)
场景描述: 验证 AI 在营销文案创作上的能力,包括多风格适应、品牌一致性、合规风险检测。
用户输入: Direction Brief:营销文案智能创作助手
Skill 执行流程:
-
资料准备
- 品牌资料:品牌调性指南、过往优质文案100篇
- 产品信息:功能清单、卖点、目标用户画像
- 合规资料:广告法禁用词、行业敏感词库
-
多维度能力实验
维度1:创作质量
场景 人工评分 采纳率 社交媒体短文案(微博/小红书) 4.2/5 68% 电商详情页长文案 3.8/5 52% 邮件营销标题 4.0/5 60% 视频脚本 3.5/5 42% 维度2:品牌一致性
- 测试:给定品牌调性,生成文案
- 评估:品牌团队判断是否符合调性
- 结果:符合率 73%,主要偏差在情感强度控制
维度3:合规风险
- 测试:100篇 AI 生成文案的合规检测
- 结果:
- 检出禁用词:准确率 95%
- 夸大宣传:检出率 60%(部分较为隐蔽)
- 竞品对比:合规性 100%(无不当对比)
-
风格适应实验
- 同一产品,生成不同风格文案
- 结果:风格区分度明显,但在"高级 but 接地气"的平衡上仍有困难
-
A/B 测试(影子验证)
- 选择 20% 流量,对比 AI 文案 vs 人工文案
- 结果:
- 点击率:AI 文案 3.2% vs 人工 3.5%(略低)
- 转化率:AI 文案 1.8% vs 人工 2.1%(略低)
- 但生成速度:AI 平均 2分钟 vs 人工平均 2小时
-
失败分析
问题类型 描述 改进方向 同质化 多个产品文案风格过于相似 增强产品差异化输入 情感过度 有时过于夸张 细化情感强度控制 长尾场景 小众产品理解不足 补充小众样本
输出结果:
# 实验结论报告:内容创作智能助手
## 能力边界
✅ 短文案创作:质量4.2/5,可用
⚠️ 长文案详情页:质量3.8/5,需改进
⚠️ 品牌一致性:73%,需调优
✅ 合规检测:禁用词检出率95%
## 关键发现
- 效率优势:2分钟 vs 2小时(60倍提升)
- 质量差距:点击率和转化率略低(-10%)
- 适用场景:更适合批量、快速、标准化文案
- 不适合:品牌大推、需要深度创意的campaign
## 产品形态建议
- 初稿生成:AI 快速产出多版本草稿
- 人工精修:创作者在 AI 基础上优化
- 合规预检:发布前自动检测风险
- 风格模板:提供多风格快速切换
## 商业模式
- 内部赋能:提升创作团队效率
- 外部售卖:小型商家自助生成基础文案
## 进入系统构建条件
✅ 品牌团队认可质量标准
⚠️ 建立质量反馈闭环机制
✅ 法务确认合规流程