agentsclimarketplace

Ab test designer

Skill findscripter/everything-skills/05-business/ab-test-designer

类书式 AI Agent 技能大典 · 精选/中文化/互见成网的 500+ 开源技能,可作为 Claude Code 插件市场一键安装。A curated, cross-referenced encyclopedia of 500+ open-source agent skills.

Install
npx -y skills add findscripter/everything-skills --skill ab-test-designer

Assembled from the repository path, not quoted from the project. Check it against their README if it does not work.

2 things to look at

  • no licenseNo license file was found in the repository. Code published without one is not open source by default, so using it at work is a question for whoever answers licensing questions where you are.
  • 1 stars1 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.

What its author says it does

Copied from the file, not written here

当你要规划、设计或落地一次 A/B 测试,或搭建持续的增长实验体系时使用;产出含假设、主/次/护栏指标、样本量与运行计划的可执行实验方案,并用 ICE 排期、统计显著性判定结果;不适用于纯埋点实施、单页 CRO 改稿或无对照组的分析。触发词:A/B 测试、ab test、split test、分流测试、多变量测试、MVT、实验设计、假设检验、统计显著性、样本量、ICE 评分、增长实验、experiment backlog、哪个版本更好。

The file declares its own license as MIT. That is the author’s claim about this one file, and it is not the same thing as the license GitHub reports for the repository, which is listed with the other numbers below.

SKILL.md

7.6 KB, as published. Nobody here has run it

何时使用

当用户要对比两个(或多个)方案、用数据判断谁更优,或要搭建系统化的增长实验流程时使用。典型场景:设计 A/B / A/B/n / 多变量(MVT)/ Split URL 测试,写实验假设,算样本量与运行时长,定主指标/次指标/护栏指标,用 ICE 给实验排期,按统计显著性判读结果并沉淀实验手册。

不该用的边界(负边界):

  • 只是要做埋点/事件追踪的实施 → 用专门的 analytics 类技能。
  • 只针对单个落地页做转化文案与版式优化、且不设对照组 → 走 CRO 流程。
  • 没有对照组、样本极小或无法分流的「看一眼数据」需求 → 这不是 A/B 测试,别强行套显著性结论。

开始前先确认三件事:① 测试背景(想改进什么、要改什么);② 现状(基线转化率、当前流量);③ 约束(技术复杂度、时间、可用工具)。若仓库存在 .agents/product-marketing.md(或 .claude/product-marketing.md、旧版 product-marketing-context.md),先读它,已覆盖的信息不必再问。

步骤

  1. 写假设:一次只测一个变量,给出有依据的明确预测,而非「试试看」。
  2. 选测试类型:按可用流量选 A/B(中等流量)、A/B/n(更高)、MVT(极高)、Split URL(中等)。
  3. 定指标:1 个主指标(与业务价值和假设直接挂钩,用它来判定)、若干次指标(解释为什么生效)、护栏指标(不能变差,恶化就停)。
  4. 算样本量:先定最小可检测提升(MDE),再用计算器算每组样本量与时长,事先确定、运行中不改
  5. 设计变体:单一且足够大的改动,忠于假设。
  6. 分配流量:默认 50/50;高风险用 90/10、80/20 或逐步放量;保证回访用户看到同一变体、曝光在时段上均衡。
  7. 选实现方式:客户端(JS 改页面,快但有闪烁,PostHog/Optimizely/VWO)或服务端(渲染前定变体,无闪烁但需开发,PostHog/LaunchDarkly/Split)。
  8. 上线前过 checklist,运行中只监控不偷看,达到样本量后再判读。
  9. 判读结果:按显著性、效应量、次指标一致性、护栏、分群差异得出结论并归档。
  10. (增长体系) 把赢家沉淀进实验手册,从学习中产出新假设,循环往复。

指令

假设结构:

因为 [观察/数据],
我们相信 [改动]
会带来 [预期结果]
对于 [受众]。
当 [指标] 变化时,我们就能验证这一点。

弱:「改按钮颜色也许能提高点击。」 强:「因为用户反馈很难找到 CTA(热图+反馈佐证),我们相信把按钮放大并用对比色,能让新访客的 CTA 点击率提升 15%+。用从页面浏览到注册开始的点击率衡量。」

样本量速查(每组所需样本,按基线×相对提升):

基线+10%+20%+50%
1%150k39k6k
3%47k12k2k
5%27k7k1.2k
10%12k3k550

计算器:Evan Miller https://www.evanmiller.org/ab-testing/sample-size.html、Optimizely https://www.optimizely.com/sample-size-calculator/

上线前 checklist: 假设已记录 / 主指标已定 / 样本量已算 / 变体实现正确 / 埋点已验证 / 各变体已 QA。

运行中要做: 监控技术问题、检查分群质量、记录外部因素。 运行中禁止: 偷看结果并提前停(peeking 会制造假阳性)、改动变体、引入新流量来源。

判读 checklist: ① 达到样本量了吗(没到=初步结论)② 是否显著(看置信区间)③ 效应量是否有意义(对比 MDE,估算业务影响)④ 次指标是否一致 ⑤ 护栏是否有恶化 ⑥ 分群是否有差异(移动 vs 桌面、新 vs 老)。

结论对照: 显著胜出→上线变体;显著落败→保留对照并复盘原因;无显著差异→加流量或做更大胆的测试;信号混杂→下钻分群。

ICE 排期: 对每个假设在 Impact(若生效能推动主指标多少)、Confidence(基于数据而非直觉的把握度)、Ease(多快多省地上线并衡量)三项打 1–10 分,ICE = (Impact + Confidence + Ease) / 3,先跑高分实验,每月按上下文重评。

实验节奏: 每周(30 分)查技术问题与护栏,护栏显著恶化才停,但不提前判赢;双周收尾已完成实验、更新手册、从 backlog 启动下一个;每月(1 小时)复盘实验速度/胜率/累计提升,补充假设、重排 ICE;每季审计手册(哪些模式已推广、哪些赢家未规模化、漏斗哪段测试不足)。健康指标:每月上线 4–8 个、胜率 20–30%、单测 2–4 周、backlog 储备 20+。

示例

定价页测试:

  • 主指标:套餐选择率
  • 次指标:页面停留、套餐分布
  • 护栏:客服工单数、退款率

实验手册条目模板(赢家沉淀):

## [实验名]
日期:[date]
假设:[假设]
样本量:[每组 n]
结果:[胜/负/不确定] — [主指标] 变化 [X%](95% CI:[区间],p=[值])
护栏:[护栏指标及结果]
分群差异:[设备/分群/同期群上的显著差异]
为何生效/失败:[分析]
可复用模式:[如「定价 CTA 旁加社会证明能提升套餐选择」]
可应用于:[其他可能奏效的页面/流程]
状态:[已实施 / 暂缓 / 需跟进测试]

注意事项

  • 设计陷阱:改动太小(检测不出)、一次测太多(无法归因)、没有清晰假设。
  • 执行陷阱:提前停、中途改变体、不核对实现是否正确。
  • 分析陷阱:忽略置信区间、挑数据(cherry-pick 分群)、过度解读不显著的结果。
  • 95% 置信 = p < 0.05,意味着结果纯随机的概率 < 5%,这只是阈值不是保证。
  • 「偷看就停」是最常见的致命错误:事先承诺样本量并相信流程。
  • 每个测试都要归档:假设、变体(含截图)、结果(样本/指标/显著性)、决策与学习。

互见

  • seo-content-writer:用于生成变体文案与内容版本,作为实验输入。
  • first-principles-thinking:在假设生成与原因复盘时拆解第一性问题。

本条采编自 coreyhaines31/marketingskills(MIT)。

Keep looking

Skills are one crate of 328,083. Ordering is by how many stacks a row turns up in, so the top of any crate is what has actually been picked rather than what has the most stars.