agentsclimarketplace

Exp usability testing

Skill guofu-shiqu/ux-expert-skills/skills/exp-usability-testing

UX Expert Skills — 25 个体验管理专家 Skill,兼容 Claude Code & OpenAI Codex,基于 Agent Skills 开放标准

Install
npx -y skills add guofu-shiqu/ux-expert-skills --skill exp-usability-testing

Assembled from the repository path, not quoted from the project. Check it against their README if it does not work.

One thing to look at

  • 2 stars2 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.

What its author says it does

Copied from the file, not written here

可用性测试。当需要设计可用性测试方案、编写测试任务脚本、执行测试或分析测试结果时调用。

SKILL.md

6.0 KB, as published. Nobody here has run it

可用性测试

设计可用性测试方案,包括测试类型选择、任务设计、测试脚本编写、执行方法和结果分析,发现用户实际使用中的体验问题。

触发条件

  • 需要发现用户实际使用中的体验问题
  • 需要验证设计改版是否真正改善体验
  • 需要评估特定任务流程的可用性
  • 需要在上线前进行可用性验证
  • 需要对比新旧方案的体验差异

核心能力

1. 测试类型选择

测试类型方法适用阶段目的
形成性可用性测试小样本(5-8人),定性为主设计迭代阶段发现问题、指导改进
总结性可用性测试大样本(20+),定量为主上线后/版本对比评估质量、基线对比
远程可用性测试线上工具,异步或同步地理分散用户降低成本、扩大样本
眼动追踪测试眼动仪记录注视点视觉密集页面了解视觉注意力分布
A/B 测试线上分流对比上线后验证验证方案效果
专家评审专家走查快速评估快速发现明显问题

2. 测试任务设计

任务设计原则:

  • 任务应基于真实用户目标,而非功能点
  • 任务描述避免引导性语言
  • 任务应有明确的完成标准
  • 任务难度应覆盖核心场景

任务设计模板:

任务名称:[...]
场景描述:[给用户一个真实的生活化场景]
任务目标:[用户需要完成什么]
成功标准:[怎样算完成]
预计时长:[X 分钟]
关注点:[测试者要重点观察什么]

任务类型:

  • 成功路径任务 — 测试用户能否顺利完成核心任务
  • 探索任务 — 测试用户能否自主发现功能
  • 错误恢复任务 — 测试用户能否从错误中恢复
  • 边界任务 — 测试极端场景下的表现

3. 测试脚本结构

完整的测试脚本包含以下部分:

  1. 开场说明 — 研究目的、时长、隐私、鼓励发声思考
  2. 暖场问题 — 了解用户背景、使用习惯
  3. 前测问卷 — 收集用户属性和预期
  4. 测试任务 — 按顺序执行各任务
  5. 任务后评分 — 每个任务后让用户评分(SEQ 单题易用性量表)
  6. 整体评估 — SUS 量表或整体满意度
  7. 回顾访谈 — 询问困惑点、改进建议
  8. 结束语 — 感谢、后续跟进

4. 关键指标

过程指标:

  • 任务完成率(Task Completion Rate)
  • 任务时长(Time on Task)
  • 错误次数(Number of Errors)
  • 求助次数(Help Requests)
  • 迷路次数(Lostness)

主观指标:

  • SEQ(Single Ease Question)— "完成这个任务的难度是?" 1-7 分
  • SUS(System Usability Scale)— 10 题标准量表
  • ASQ(After-Scenario Questionnaire)— 场景后满意度
  • NPS — 净推荐值

行为指标:

  • 首次点击正确率
  • 回退次数
  • 停滞时间(犹豫)
  • 非预期路径

5. 结果分析方法

问题分类:

严重程度定义处理优先级
致命(P0)用户完全无法完成任务立即修复
严重(P1)用户花费大量时间或多次出错本版本修复
一般(P2)用户有困惑但最终完成下版本优化
轻微(P3)小的体验摩擦放入优化池

输出格式:可用性测试方案 + 结果报告

测试方案

【可用性测试方案】

▸ 测试目标:[...]
▸ 测试类型:[形成性/总结性/远程/眼动/A-B/专家评审]
▸ 测试对象:[用户描述],样本量:[X人]
▸ 测试环境:[实验室/远程/线上]

▸ 任务清单:
  任务1:[名称],场景:[...],成功标准:[...],预计:[X分钟]
  任务2:[...]
  ...

▸ 测试脚本:[完整脚本]
▸ 评分量表:[SEQ / SUS / ASQ / NPS]
▸ 预计总时长:[X分钟/人]

结果报告

【可用性测试结果报告】

▸ 测试概况:
  参与人数:[X]
  测试时间:[...]
  测试版本:[...]

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━

▸ 一、关键指标

  任务     │ 完成率 │ 平均时长 │ 错误次数 │ SEQ均值 │ 严重程度
  ─────────┼────────┼──────────┼──────────┼─────────┼─────────
  任务1    │  XX%   │  X分XX秒 │   X.X    │  X.X    │  [...]
  任务2    │  XX%   │  X分XX秒 │   X.X    │  X.X    │  [...]
  ...
  整体     │  XX%   │  X分XX秒 │   X.X    │  X.X    │

  SUS 得分:[XX.X]/100([优秀/良好/一般/差])

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━

▸ 二、问题清单

  P0 致命问题:
    1. [问题描述],出现频次:[X/X],发生环节:[...]
       原因分析:[...]
       修复建议:[...]

  P1 严重问题:
    1. [...]

  P2 一般问题:
    1. [...]

  P3 轻微问题:
    1. [...]

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━

▸ 三、用户行为洞察

  典型路径:[...]
  迷路热点:[...]
  犹豫时刻:[...]
  意外发现:[...]

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━

▸ 四、用户原声

  正面:"[用户原话]"
  负面:"[用户原话]"
  建议:"[用户原话]"

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━

▸ 五、改版建议

  必须修复:
    1. [...]
  建议优化:
    1. [...]
  验证建议:
    [修复后应再次测试哪些任务]

使用方法

当需要验证和发现可用性问题时调用本 skill。测试结果可与认知心理学分析、旅程分析等 skill 衔接,将发现的问题转化为深层的体验洞察和优化策略。

Keep looking

Skills are one crate of 328,083. Ordering is by how many stacks a row turns up in, so the top of any crate is what has actually been picked rather than what has the most stars.