- name
- delphi-method
- description
- 德尔菲法(Delphi Method / 专家咨询法)全流程方法学助手,聚焦"用多轮匿名专家咨询构建并筛选指标体系"的完整链路。当用户要做德尔菲专家检验的任何环节时使用:判断该不该用德尔菲(vs 层次分析法/问卷调查/焦点小组)、指标初选与初始指标体系搭建、专家遴选(人数、资质、代表性)、咨询问卷设计(Likert 计分、开放意见栏)、轮次设计(几轮、什么时候停)、四大核心统计量计算与解读——专家积极系数(回收率)、专家权威系数 Cr(判断依据 Ca + 熟悉程度 Cs)、专家协调程度(肯德尔和谐系数 Kendall's W + 卡方检验、变异系数 CV)、专家意见集中程度(算术平均值、满分频率);两套指标筛选标准(界值法 / 变异系数-均值法)的公式、判定规则与选择依据;指标增删改的决策与专家反馈;权重确定;德尔菲过程文档与论文方法章写作;审稿与答辩高频质疑应对。触发词包括"德尔菲""德尔菲法""Delphi""专家咨询""专家检验""专家打分""指标体系构建""指标筛选""肯德尔和谐系数""Kendall W""协调系数""变异系数""满分频率""专家权威系数""专家积极系数""界值法""两轮咨询""指标剔除""专家意见集中度"等。工具中立(SPSS/Excel/R/DView 皆可),覆盖从"要不要用德尔菲"到"最终指标体系成文"的全过程。
# 德尔菲法(专家咨询/专家检验)
## 核心姿态
德尔菲法的本质是:**用多轮匿名反馈,让一群专家的意见从分散走向收敛**。
它不是"找几个专家打个分",而是一个有明确判定标准的**收敛过程**。判断一次德尔菲做得好不好,看三件事:
1. **专家够不够格**(权威系数、代表性)
2. **意见收没收敛**(协调系数、变异系数是否随轮次改善)
3. **筛选有没有依据**(筛选标准是事先定好的,不是看着数据凑的)
**最常见的失败**:先看数据,再定标准。这是结果导向的倒推,审稿人一眼就能看穿。**筛选标准必须在收数据之前写死。**
不要承诺"做完德尔菲就一定能发表"。也不要把德尔菲当成给已有指标体系"背书"的工具——如果两轮下来一个指标都没删,审稿人会问:那你做这个干什么?
## 一、什么时候该用德尔菲
| 适合 | 不适合 |
|---|---|
| 缺乏客观数据,需要依靠专家经验判断 | 已有充足的客观数据可做统计推断 |
| 要**构建**一个新的指标体系/评价体系 | 只是要**验证**一个成熟量表(用 CFA) |
| 议题跨学科、需要多方经验整合 | 议题有明确标准答案 |
| 需要匿名以避免权威压制和从众 | 需要面对面碰撞产生新想法(用焦点小组) |
**和相邻方法的关系**:
- **德尔菲 → AHP/熵权法**:德尔菲负责"选出哪些指标",AHP 等负责"每个指标多重要"。两者常串联使用。
- **德尔菲 vs 问卷调查**:德尔菲的样本是专家(十几到几十人),追求**收敛**;问卷调查的样本是总体代表(几百人),追求**推断**。不要混淆。
## 二、完整流程
```
指标初选(文献分析 / 质性编码 / 理论框架)
↓
组建专家团队(遴选标准事先写死)
↓
设计咨询问卷(Likert 计分 + 开放意见栏)
↓
第一轮咨询 → 回收 → 计算四大系数 → 按筛选标准增删改
↓
第二轮咨询(把第一轮结果反馈给专家)→ 回收 → 再计算
↓
判断是否收敛?(W 提升、CV 下降、意见趋于一致)
↓ 否 → 第三轮
↓ 是
确定最终指标体系 → (可选)确定权重
```
**轮次**:通常 **2-3 轮**。一轮不够(没有反馈就不叫德尔菲);超过三轮专家易疲劳、流失率上升。
## 三、专家团队
**人数**:常见 **15-50 人**。少于 15 人代表性存疑,多于 50 人协调难度陡增、边际收益递减。
**遴选标准(必须事先写死并在论文中报告)**:
- 研究领域与本课题的相关性
- 职称 / 学历 / 从业年限(例:中级及以上职称,从业 ≥ 5 年)
- 领域代表性(学界 + 业界 + 一线实践者的配比)
- 地域 / 机构分布(避免单一来源)
**必须报告**:专家基本情况表(人数、职称、学历、年限、专业方向的分布)。**不要出现专家姓名与工作单位**——匿名是德尔菲的方法要求,也是伦理要求。
## 四、四大核心统计量
这四个是德尔菲的"体检指标",缺一不可,审稿人都会看。
### 1. 专家积极系数(回收率)
```
积极系数 = 回收问卷数 / 发放问卷数
```
- 反映专家对本研究的关心程度。
- **一般认为 ≥ 70% 可接受**,越高越好。多轮之间的流失率也要报告。
### 2. 专家权威系数 Cr
```
Cr = (Ca + Cs) / 2
```
- **Ca = 判断依据系数**:专家做判断的依据(理论分析、实践经验、同行了解、直觉),每项按影响程度大/中/小赋值后求和。
- **Cs = 熟悉程度系数**:专家对该问题的熟悉程度(很熟悉…不熟悉),按 1.0 / 0.8 / 0.6 / 0.4 / 0.2 / 0 赋值。
- **判定:Cr ≥ 0.7 认为结果可信**,Cr ≥ 0.8 为高权威。
- **注意**:Ca 和 Cs 的量表必须**放在问卷里让专家自评**,不能事后拍脑袋填。很多人做到一半才发现忘了收,只能重发问卷。
### 3. 专家协调程度
**(1)肯德尔和谐系数 Kendall's W** —— 检验全体专家意见的一致性
- 取值 0-1,需同时报告 **卡方检验的显著性(p < 0.05)**。
- **W 显著 ≠ W 很高**。W 只要显著,就说明专家意见的一致性非随机;W 的绝对值高低反映一致性强弱。
常用解释区间:
| W 值 | 一致性程度 |
|---|---|
| < 0.2 | 较差 |
| 0.2 – 0.4 | 一般 |
| 0.4 – 0.6 | 中等 |
| 0.6 – 0.8 | 较强 |
| 0.8 – 1.0 | 很强 |
> ⚠️ 现实中德尔菲的 W 常落在 **0.2–0.5**,这是正常的——专家人数越多、指标越多,W 天然越低。**关键看 W 是否显著,以及第二轮是否高于第一轮(收敛的证据)**。不要因为 W 只有 0.3 就慌,也不要为了好看去删专家。
**(2)变异系数 CV**
```
CV = 标准差 / 算术平均值
```
- 反映专家对**某一个具体指标**评分的离散程度。CV 越小,专家对该指标越有共识。
- 一般以 **CV < 0.25** 作为共识良好的经验标准。
**W 和 CV 的分工**:W 看**整体**专家一致性,CV 看**单个指标**的共识。两者都要报。
### 4. 专家意见集中程度
- **算术平均值**:该指标的重要性得分均值,越高越重要。
- **满分频率**:给该指标打满分的专家人数 / 总人数。越高说明认同度越强。
## 五、两套指标筛选标准(选一套,事先写死)
### 方法 A:变异系数-均值法(简单、常用)
判定规则(三项指标):
- **算术平均值 > 3.0(或 3.5,5 分制下)**
- **变异系数 < 0.25**
- **满分频率**(可选纳入)
**剔除规则**:三项中有一项不满足即剔除。(也有研究采用"两项均不满足才剔除"的宽松版——**必须在方法章明确说明你用的是哪一种**。)
### 方法 B:界值法(更严谨、更受审稿人认可)
界值不是拍脑袋定的,而是**由本轮全部指标的数据算出来的**:
```
算术平均值界值 = 全部指标均值的平均数 − 标准差 → 指标均值 > 界值 才合格
变异系数界值 = 全部指标 CV 的平均数 + 标准差 → 指标 CV < 界值 才合格
满分频率界值 = 全部指标满分频率的平均数 − 标准差 → 指标满分频率 > 界值 才合格
```
**判定规则**:
- 三项**全部合格** → 保留
- **部分不合格** → 提交专家组讨论决定去留(并在论文中说明理由)
- **三项全部不合格** → 直接剔除
> 界值法的优势:阈值来自数据本身,不是主观设定,**更难被质疑"标准是为了留下你想留的指标而定的"**。
### 怎么选
- 指标数量多、想要更强的方法学辩护 → **界值法**
- 指标少、追求简洁 → **变异系数-均值法**
- **不要两套都算,然后挑对自己有利的那套报告。** 这是学术不端。
## 六、轮次间的动作
第一轮结束后,必须做三件事:
1. **按标准筛选**:删掉不合格指标(并记录每一个被删指标的数据与理由——审稿人会要)
2. **处理专家的开放意见**:新增指标、合并指标、修改表述
3. **准备反馈材料**:把第一轮的**统计结果(均值、CV、满分频率)连同修改后的指标**反馈给专家
**反馈是德尔菲的灵魂**。没有反馈的多轮打分,只是重复调查,不是德尔菲。
**收敛的判断依据**:
- Kendall's W **升高**
- 变异系数 **普遍下降**
- 需要增删的指标 **趋近于零**
三者同时出现,即可停止。
## 七、工具操作
**SPSS 算 Kendall's W**:
`分析 → 非参数检验 → 旧对话框 → K 个相关样本 → 勾选 Kendall's W`
(把每个指标作为一个变量,每位专家作为一行)
**Excel**:均值 `AVERAGE`、标准差 `STDEV.S`、变异系数 = 标准差/均值、满分频率 = `COUNTIF(区域,5)/专家数`。界值按上面的公式再算一层。
**R**:`irr::kendall(matrix, correct = TRUE)`
**专用软件**(如 DView 等)也可,但**必须能说清它算的是什么公式**——审稿人不认"软件算出来的"。
## 八、过程文档 / 论文方法章结构
一份完整的德尔菲报告应包含:
1. **指标初选**:来源(文献/质性编码/理论)、初始指标体系表(几个一级、几个二级、几个三级)
2. **专家团队**:遴选标准、人数、基本情况分布表(匿名)
3. **问卷设计**:计分方式、是否含开放意见栏、权威系数量表
4. **数据分析**
- 专家积极系数(各轮回收情况表)
- 专家权威系数(Ca、Cs、Cr 计算表)
- 专家协调程度(各轮 W 值 + 卡方 + p 值表;变异系数)
- 专家意见集中程度(均值、满分频率)
5. **指标筛选**:筛选标准(写清是界值法还是均值-CV 法及其公式)、各轮筛选结果表、**被剔除指标及其理由**
6. **最终指标体系**:修改前后对比、最终体系表
7. (可选)**权重确定**:AHP / 百分权重法等
## 九、审稿与答辩高频质疑
| 质疑 | 怎么答 |
|---|---|
| "专家只有 20 人,代表性够吗?" | 德尔菲追求的是**专家的权威性与代表性**,不是统计推断的样本量。用 Cr 值和专家分布来答。 |
| "W 只有 0.3,一致性这么差?" | W 显著即说明非随机一致;并展示**第二轮 W 高于第一轮**,证明意见在收敛。 |
| "为什么删这几个指标?" | 拿出事先写死的筛选标准和每个被删指标的具体数据。**标准在前,数据在后。** |
| "两轮就够了吗?" | 用收敛证据答:W 升高、CV 普遍下降、增删指标趋近于零。 |
| "专家怎么选的?" | 拿出事先写死的遴选标准,并说明领域/职称/年限/机构的分布。 |
| "你是不是先看了数据才定标准?" | 这是最致命的质疑。**唯一的防御是:标准写在收数据之前,并在文中明确陈述。** |
## 十、伦理与边界
- **匿名性**:专家之间必须互相匿名;论文中不得出现专家姓名与单位。
- **知情同意**:专家应知晓研究目的、轮次安排与数据用途。
- **不得**为了让某个指标"活下来"而调整标准、剔除专家或修改数据。
- **不得**在两套筛选方法中挑选对自己有利的结果报告。
- 报告**全部**轮次的数据,包括不好看的那一轮。
> 📚 详细统计公式与工具操作见 `references/statistics.md`;
> 筛选标准的完整判定逻辑见 `references/screening-criteria.md`;
> 过程文档与论文写作模板见 `references/reporting.md`;
> 权威文献见 `references/bibliography.md`。
GitHub에서 보기