agentsclimarketplace

Delphi method

Skill maydengximin-sketch/delphi-method-skill/skills/delphi-method

德尔菲法(Delphi Method / 专家咨询法)全流程方法学助手,聚焦"用多轮匿名专家咨询构建并筛选指标体系"的完整链路。当用户要做德尔菲专家检验的任何环节时使用:判断该不该用德尔菲(vs 层次分析法/问卷调查/焦点小组)、指标初选与初始指标体系搭建、专家遴选(人数、资质、代表性)、咨询问卷设计(Likert 计分、开放意见栏)、轮次设计(几轮、什么时候停)、四大核心统计量计算与解读——专家积极系数(回收率)、专家权威系数 Cr(判断依据 Ca + 熟悉程度 Cs)、专家协调程度(肯德尔和谐系数 Kendall's W + 卡方检验、变异系数 CV)、专家意见集中程度(算术平均值、满分频率);两套指标筛选标准(界值法 / 变异系数-均值法)的公式、判定规则与选择依据;指标增删改的决策与专家反馈;权重确定;德尔菲过程文档与论文方法章写作;审稿与答辩高频质疑应对。触发词包括"德尔菲""德尔菲法""Delphi""专家咨询""专家检验""专家打分""指标体系构建""指标筛选""肯德尔和谐系数""Kendall W""协调系数""变异系数""满分频率""专家权威系数""专家积极系数""界值法""两轮咨询""指标剔除""专家意见集中度"等。工具中立(SPSS/Excel/R/DView 皆可),覆盖从"要不要用德尔菲"到"最终指标体系成文"的全过程。From its SKILL.md

Install
npx -y skills add maydengximin-sketch/delphi-method-skill --skill delphi-method

Assembled from the repository path, not quoted from the project. Check it against their README if it does not work.

2 things to look at

  • 29 days oldThe repository was created 29 days ago. New is not bad, but a brand new repository carrying a familiar-sounding name is the shape a typosquat arrives in, and there has been no time for anyone else to find a problem with it.
  • 1 stars1 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.

SKILL.md

12.0 KB, ~4.4k tokens by cl100k_base, as published. Nobody here has run it

德尔菲法(专家咨询/专家检验)

核心姿态

德尔菲法的本质是:用多轮匿名反馈,让一群专家的意见从分散走向收敛

它不是"找几个专家打个分",而是一个有明确判定标准的收敛过程。判断一次德尔菲做得好不好,看三件事:

  1. 专家够不够格(权威系数、代表性)
  2. 意见收没收敛(协调系数、变异系数是否随轮次改善)
  3. 筛选有没有依据(筛选标准是事先定好的,不是看着数据凑的)

最常见的失败:先看数据,再定标准。这是结果导向的倒推,审稿人一眼就能看穿。筛选标准必须在收数据之前写死。

不要承诺"做完德尔菲就一定能发表"。也不要把德尔菲当成给已有指标体系"背书"的工具——如果两轮下来一个指标都没删,审稿人会问:那你做这个干什么?

一、什么时候该用德尔菲

适合不适合
缺乏客观数据,需要依靠专家经验判断已有充足的客观数据可做统计推断
构建一个新的指标体系/评价体系只是要验证一个成熟量表(用 CFA)
议题跨学科、需要多方经验整合议题有明确标准答案
需要匿名以避免权威压制和从众需要面对面碰撞产生新想法(用焦点小组)

和相邻方法的关系

  • 德尔菲 → AHP/熵权法:德尔菲负责"选出哪些指标",AHP 等负责"每个指标多重要"。两者常串联使用。
  • 德尔菲 vs 问卷调查:德尔菲的样本是专家(十几到几十人),追求收敛;问卷调查的样本是总体代表(几百人),追求推断。不要混淆。

二、完整流程

指标初选(文献分析 / 质性编码 / 理论框架)
      ↓
组建专家团队(遴选标准事先写死)
      ↓
设计咨询问卷(Likert 计分 + 开放意见栏)
      ↓
第一轮咨询 → 回收 → 计算四大系数 → 按筛选标准增删改
      ↓
第二轮咨询(把第一轮结果反馈给专家)→ 回收 → 再计算
      ↓
判断是否收敛?(W 提升、CV 下降、意见趋于一致)
      ↓  否 → 第三轮
      ↓  是
确定最终指标体系 → (可选)确定权重

轮次:通常 2-3 轮。一轮不够(没有反馈就不叫德尔菲);超过三轮专家易疲劳、流失率上升。

三、专家团队

人数:常见 15-50 人。少于 15 人代表性存疑,多于 50 人协调难度陡增、边际收益递减。

遴选标准(必须事先写死并在论文中报告)

  • 研究领域与本课题的相关性
  • 职称 / 学历 / 从业年限(例:中级及以上职称,从业 ≥ 5 年)
  • 领域代表性(学界 + 业界 + 一线实践者的配比)
  • 地域 / 机构分布(避免单一来源)

必须报告:专家基本情况表(人数、职称、学历、年限、专业方向的分布)。不要出现专家姓名与工作单位——匿名是德尔菲的方法要求,也是伦理要求。

四、四大核心统计量

这四个是德尔菲的"体检指标",缺一不可,审稿人都会看。

1. 专家积极系数(回收率)

积极系数 = 回收问卷数 / 发放问卷数
  • 反映专家对本研究的关心程度。
  • 一般认为 ≥ 70% 可接受,越高越好。多轮之间的流失率也要报告。

2. 专家权威系数 Cr

Cr = (Ca + Cs) / 2
  • Ca = 判断依据系数:专家做判断的依据(理论分析、实践经验、同行了解、直觉),每项按影响程度大/中/小赋值后求和。
  • Cs = 熟悉程度系数:专家对该问题的熟悉程度(很熟悉…不熟悉),按 1.0 / 0.8 / 0.6 / 0.4 / 0.2 / 0 赋值。
  • 判定:Cr ≥ 0.7 认为结果可信,Cr ≥ 0.8 为高权威。
  • 注意:Ca 和 Cs 的量表必须放在问卷里让专家自评,不能事后拍脑袋填。很多人做到一半才发现忘了收,只能重发问卷。

3. 专家协调程度

(1)肯德尔和谐系数 Kendall's W —— 检验全体专家意见的一致性

  • 取值 0-1,需同时报告 卡方检验的显著性(p < 0.05)
  • W 显著 ≠ W 很高。W 只要显著,就说明专家意见的一致性非随机;W 的绝对值高低反映一致性强弱。

常用解释区间:

W 值一致性程度
< 0.2较差
0.2 – 0.4一般
0.4 – 0.6中等
0.6 – 0.8较强
0.8 – 1.0很强

⚠️ 现实中德尔菲的 W 常落在 0.2–0.5,这是正常的——专家人数越多、指标越多,W 天然越低。关键看 W 是否显著,以及第二轮是否高于第一轮(收敛的证据)。不要因为 W 只有 0.3 就慌,也不要为了好看去删专家。

(2)变异系数 CV

CV = 标准差 / 算术平均值
  • 反映专家对某一个具体指标评分的离散程度。CV 越小,专家对该指标越有共识。
  • 一般以 CV < 0.25 作为共识良好的经验标准。

W 和 CV 的分工:W 看整体专家一致性,CV 看单个指标的共识。两者都要报。

4. 专家意见集中程度

  • 算术平均值:该指标的重要性得分均值,越高越重要。
  • 满分频率:给该指标打满分的专家人数 / 总人数。越高说明认同度越强。

五、两套指标筛选标准(选一套,事先写死)

方法 A:变异系数-均值法(简单、常用)

判定规则(三项指标):

  • 算术平均值 > 3.0(或 3.5,5 分制下)
  • 变异系数 < 0.25
  • 满分频率(可选纳入)

剔除规则:三项中有一项不满足即剔除。(也有研究采用"两项均不满足才剔除"的宽松版——必须在方法章明确说明你用的是哪一种。)

方法 B:界值法(更严谨、更受审稿人认可)

界值不是拍脑袋定的,而是由本轮全部指标的数据算出来的

算术平均值界值 = 全部指标均值的平均数 − 标准差    → 指标均值 > 界值 才合格
变异系数界值   = 全部指标 CV 的平均数 + 标准差     → 指标 CV  < 界值 才合格
满分频率界值   = 全部指标满分频率的平均数 − 标准差  → 指标满分频率 > 界值 才合格

判定规则

  • 三项全部合格 → 保留
  • 部分不合格 → 提交专家组讨论决定去留(并在论文中说明理由)
  • 三项全部不合格 → 直接剔除

界值法的优势:阈值来自数据本身,不是主观设定,更难被质疑"标准是为了留下你想留的指标而定的"

怎么选

  • 指标数量多、想要更强的方法学辩护 → 界值法
  • 指标少、追求简洁 → 变异系数-均值法
  • 不要两套都算,然后挑对自己有利的那套报告。 这是学术不端。

六、轮次间的动作

第一轮结束后,必须做三件事:

  1. 按标准筛选:删掉不合格指标(并记录每一个被删指标的数据与理由——审稿人会要)
  2. 处理专家的开放意见:新增指标、合并指标、修改表述
  3. 准备反馈材料:把第一轮的统计结果(均值、CV、满分频率)连同修改后的指标反馈给专家

反馈是德尔菲的灵魂。没有反馈的多轮打分,只是重复调查,不是德尔菲。

收敛的判断依据

  • Kendall's W 升高
  • 变异系数 普遍下降
  • 需要增删的指标 趋近于零

三者同时出现,即可停止。

七、工具操作

SPSS 算 Kendall's W分析 → 非参数检验 → 旧对话框 → K 个相关样本 → 勾选 Kendall's W (把每个指标作为一个变量,每位专家作为一行)

Excel:均值 AVERAGE、标准差 STDEV.S、变异系数 = 标准差/均值、满分频率 = COUNTIF(区域,5)/专家数。界值按上面的公式再算一层。

Rirr::kendall(matrix, correct = TRUE)

专用软件(如 DView 等)也可,但必须能说清它算的是什么公式——审稿人不认"软件算出来的"。

八、过程文档 / 论文方法章结构

一份完整的德尔菲报告应包含:

  1. 指标初选:来源(文献/质性编码/理论)、初始指标体系表(几个一级、几个二级、几个三级)
  2. 专家团队:遴选标准、人数、基本情况分布表(匿名)
  3. 问卷设计:计分方式、是否含开放意见栏、权威系数量表
  4. 数据分析
    • 专家积极系数(各轮回收情况表)
    • 专家权威系数(Ca、Cs、Cr 计算表)
    • 专家协调程度(各轮 W 值 + 卡方 + p 值表;变异系数)
    • 专家意见集中程度(均值、满分频率)
  5. 指标筛选:筛选标准(写清是界值法还是均值-CV 法及其公式)、各轮筛选结果表、被剔除指标及其理由
  6. 最终指标体系:修改前后对比、最终体系表
  7. (可选)权重确定:AHP / 百分权重法等

九、审稿与答辩高频质疑

质疑怎么答
"专家只有 20 人,代表性够吗?"德尔菲追求的是专家的权威性与代表性,不是统计推断的样本量。用 Cr 值和专家分布来答。
"W 只有 0.3,一致性这么差?"W 显著即说明非随机一致;并展示第二轮 W 高于第一轮,证明意见在收敛。
"为什么删这几个指标?"拿出事先写死的筛选标准和每个被删指标的具体数据。标准在前,数据在后。
"两轮就够了吗?"用收敛证据答:W 升高、CV 普遍下降、增删指标趋近于零。
"专家怎么选的?"拿出事先写死的遴选标准,并说明领域/职称/年限/机构的分布。
"你是不是先看了数据才定标准?"这是最致命的质疑。唯一的防御是:标准写在收数据之前,并在文中明确陈述。

十、伦理与边界

  • 匿名性:专家之间必须互相匿名;论文中不得出现专家姓名与单位。
  • 知情同意:专家应知晓研究目的、轮次安排与数据用途。
  • 不得为了让某个指标"活下来"而调整标准、剔除专家或修改数据。
  • 不得在两套筛选方法中挑选对自己有利的结果报告。
  • 报告全部轮次的数据,包括不好看的那一轮。

📚 详细统计公式与工具操作见 references/statistics.md; 筛选标准的完整判定逻辑见 references/screening-criteria.md; 过程文档与论文写作模板见 references/reporting.md; 权威文献见 references/bibliography.md

What ships with it: 4 files

19.8 KB alongside SKILL.md

Keep looking

Skills are one crate of 326,645. Ordering is by how many stacks a row turns up in, so the top of any crate is what has actually been picked rather than what has the most stars.