统计百科 ·

信度和效度有什么区别?一篇讲透量表质量评估

信度衡量测量的一致性,效度衡量测量的准确性——两者都是论文量表质量报告的必备指标。本文用打靶比喻彻底讲清信度与效度的关系、区别与判断标准,并给出论文里应报告哪些指标(Cronbach α、KMO、AVE、CR)的完整清单。

论文里用了量表,导师或审稿人要求报告"信效度"——但"信度"和"效度"到底是两回事还是一回事?很多人用了几年量表,仍然说不清楚。这篇文章把这个问题从头讲透。


引入:为什么论文里量表信效度经常搞混

凡是用到问卷或量表收集数据的论文——心理学、管理学、教育学、社会学、医学……几乎都绕不过这样一句审稿意见:

"请报告量表的信度和效度分析结果。"

或者是:

"信度分析部分仅报告了 Cronbach α,效度部分的 AVE 和 CR 缺失,请补充。"

然后很多人就开始混用这两个词:把 Cronbach α 认为"既是信度又是效度的证明",或者把 EFA 的因子载荷当作信度指标写进了方法部分——这些都是典型错误。

信度和效度是两个独立的概念,测的是量表质量的不同侧面,缺一不可。

搞清楚这两个概念,不只是为了应付审稿人,更是为了真正理解自己的研究工具测得对不对、测得稳不稳。


一、信度是什么——测量的一致性与稳定性

1.1 信度的核心含义

**信度(Reliability)**回答的问题是:

这个量表重复测量同一件事,结果会不会一致?

如果你今天用一份焦虑量表测某人,明天再测一次,两次分数差不多,这份量表就有比较好的信度。如果两次分数差很多——不是因为那个人真的变了,而是量表本身不稳定——这份量表的信度就很差。

信度本质上衡量的是测量误差的大小:测量误差越小,信度越高。

注意:信度只说"结果一致",它完全不管"一致的结果是不是你真正想测的东西"。这是信度和效度的本质分野。

1.2 信度的主要类型

信度类型含义核心指标
内部一致性信度量表内各题项之间的相互一致程度Cronbach alpha、McDonald Omega
重测信度同一批人在不同时间点两次作答的相关性Pearson r(两次总分)
评分者信度不同评分者对同一对象评定的一致程度组内相关系数(ICC)、Kappa 系数
复本信度两份平行量表(测同一构念)的得分相关性Pearson r

在使用 Likert 量表的社会科学研究中,内部一致性信度是最常用的,核心指标是 Cronbach alpha(克朗巴赫 alpha 系数)

1.3 Cronbach alpha 怎么看

Cronbach alpha 的取值范围是 0 到 1,越接近 1 说明内部一致性越好。通行标准(Nunnally, 1978):

alpha 范围评价
>= .90信度极佳(但需警惕题项冗余)
.80 到 .89信度良好,大多数量表研究的目标
.70 到 .79信度可接受,常见于探索性研究
.60 到 .69信度偏低,需说明局限性
< .60信度不足,不建议用于推断统计

重测信度通常用 Pearson 相关系数衡量,一般要求 r > .70,间隔时间 2-4 周最为常见。


二、效度是什么——测量的准确性与针对性

2.1 效度的核心含义

**效度(Validity)**回答的问题是:

这个量表测的,真的是它声称要测的那个东西吗?

一份量表可能每次测出的分数都很一致(信度很好),但它测的根本不是你关心的构念——这就是高信度、低效度。

效度关注的是测量工具与它的测量目标之间的匹配程度。这是个更难评估的问题,因为很多心理学构念(如"焦虑""学习动机""组织承诺")是无法直接观察的,只能用量表间接测量,这个间接过程做得准不准就是效度问题。

2.2 效度的主要类型

效度的分类比信度复杂得多,不同教材的划分方式略有出入,以下是实证研究中最常遇到的几类:

(一)内容效度(Content Validity)

量表的题项内容是否全面、系统地覆盖了所测构念的各个方面。

  • 评估方式:通常由领域专家评定,不输出一个单一数字
  • 报告方式:说明量表来源(如引用自 XX 等人 XX 年开发的量表)、经过哪些专家审核
  • 内容效度高 = 这份量表"出的题"涵盖了这个构念的各个角落

(二)结构效度(Construct Validity)

量表是否测到了理论上预期的因子结构(即题项按照预期归属到对应的维度上)。

这是社会科学论文中最核心的效度类型,通常用以下两种分析来验证:

  • 探索性因子分析(EFA):不预设因子结构,让数据自己说话,看题项是否自然聚合成有意义的维度
  • 验证性因子分析(CFA):预设理论模型(几个因子、哪些题归哪个因子),用数据检验模型拟合情况

(三)聚合效度(Convergent Validity)

同一构念的不同题项之间,应该有较高的相关性(因为它们测的是同一件事)。

  • 核心指标:AVE(平均方差提取量,Average Variance Extracted),要求 AVE > .50
  • 辅助指标:CR(组合信度,Composite Reliability),要求 CR > .70;以及标准化因子载荷,通常要求 > .50(理想 > .70)

(四)区分效度(Discriminant Validity)

不同构念之间应该有足够的区别,量表不应该把本来不同的事混为一谈。

  • 核心判断:某构念的 AVE 平方根应大于该构念与其他所有构念之间的相关系数(Fornell & Larcker 准则)
  • 另一判断方法:HTMT(异质特质-单质特质比率)< .85

(五)效标效度(Criterion Validity)

量表得分是否能够预测或关联到某个外部标准(效标)。

  • 共时效度:量表得分与同时测量的效标的相关性
  • 预测效度:量表得分是否能预测未来的某个结果

三、信度 vs 效度的关系——打靶比喻

信度和效度的关系,用打靶来比喻是最直观的:

靶心 = 你真正想测的构念(如"焦虑")
每颗子弹 = 每次测量的结果(或每道题项的得分)

情形一:高信度 + 高效度(理想状态)

   [靶]
  O O O
 O [心] O
  O O O

所有子弹都集中在靶心附近——测量既稳定,又准确。这是量表研究追求的目标。

情形二:高信度 + 低效度(一致但偏离目标)

   [靶]
      O O
     O O O
      O O

子弹打得很集中(信度高),但全都偏离了靶心(效度低)——每次测量结果都差不多,但测的根本不是想测的那个东西。

例如:你想测"学习动机",但量表里的题项其实更多反映"考试焦虑"。Cronbach alpha 可能很高(因为题项之间确实很一致),但你测的是错误的构念。

情形三:低信度 + 低效度(最差情况)

   [靶]
 O        O
      O
   O    O
        O

子弹散落各处,既不集中又不准确。

情形四:低信度 + 高效度(理论上存在,实践中难以实现)

子弹围绕靶心随机分散——平均而言是准的,但每次测量误差很大。

关键结论:高信度是高效度的必要条件,但不是充分条件。

  • 信度低 → 效度一定不好(乱打一气,谈不上准确)
  • 信度高 → 效度不一定好(可以一致地打偏)
  • 效度高 → 信度一定不低(能准确测到目标,说明测量本身是稳定的)

四、论文里要报告哪些信效度指标

不同研究设计对信效度的报告要求有所不同。以下是最常见的两类情形:

4.1 使用成熟量表(引进或改编已有量表)

如果你使用的是已经被广泛验证的量表(如焦虑量表、组织承诺量表),论文中一般需要报告:

指标来源分析最低要求
Cronbach alpha(各维度)信度分析>= .70
标准化因子载荷CFA> .50(理想 > .70)
AVE(各维度)CFA> .50
CR(各维度)CFA> .70
区分效度(Fornell-Larcker 或 HTMT)CFAAVE 平方根 > 各维度间相关
模型拟合指标CFACFI/TLI > .90,RMSEA < .08,SRMR < .08

4.2 使用自编量表(自己开发的量表)

自编量表需要先做 EFA 确定因子结构,再做 CFA 验证,信效度报告更完整:

阶段分析核心指标
探索结构EFAKMO > .70;Bartlett 球形检验 p < .05;各因子载荷 > .40;累计方差解释率 > 50%
验证结构CFA模型拟合指标(CFI/TLI/RMSEA/SRMR)
信度信度分析Cronbach alpha(各维度)>= .70
聚合效度CFAAVE > .50;CR > .70
区分效度CFAFornell-Larcker 准则或 HTMT < .85

4.3 AVE 和 CR 是什么,怎么计算

**AVE(平均方差提取量)**衡量的是:一个因子(构念)所能解释的题项方差,占总方差(题项方差 + 误差方差)的比例。

计算公式:

AVE = (各题项标准化因子载荷的平方之和) / (各题项标准化因子载荷的平方之和 + 各题项误差方差之和)

简化理解:AVE > .50 意味着这个因子能解释其测量题项超过 50% 的方差,测量误差占的比例小于 50%,聚合效度可接受。

**CR(组合信度)**是基于因子分析结果计算的信度指标,比 Cronbach alpha 对测量模型的要求更严格(不依赖 tau 等价假设)。

计算公式:

CR = (各题项标准化因子载荷之和的平方) / [(各题项标准化因子载荷之和的平方) + (各题项误差方差之和)]

CR > .70 为可接受;CR > .80 为良好。

实践中,AVE 和 CR 不需要手动计算——ChatSRS 做 CFA 时会自动输出这两个指标。


五、先做信度还是先做效度

这是实际操作中很多人困惑的问题。

标准流程是先效度、再信度。

原因:如果量表的因子结构本身就有问题(效度不达标),分维度计算 Cronbach alpha 就没有意义——你连"哪些题属于哪个维度"都还没有确定。

具体操作顺序:

  1. 内容效度(专家判断):量表开发或引进阶段完成,不需要数据
  2. EFA(探索性因子分析):如果是自编量表,先用 EFA 探索因子结构,确定维度划分和各维度的题项
  3. 信度分析(Cronbach alpha):在 EFA 确定的维度基础上,分维度计算 alpha,排除 CITC < .30 的题项
  4. CFA(验证性因子分析):用修正后的量表做 CFA,验证因子结构,输出 AVE、CR、模型拟合指标
  5. 区分效度:基于 CFA 结果,验证不同构念之间的区分性

如果是使用现成的成熟量表,通常跳过 EFA,直接做信度分析 + CFA。


六、用 ChatSRS 一句话同时完成信度和效度分析

chatsrs.com 上传数据后,可以用一条指令同时请求:

"这份数据是教师职业倦怠量表(3 个维度:情绪耗竭 EE1-EE5、去人格化 DP1-DP4、成就感降低 PA1-PA4,共 13 题,5 点 Likert),请:1. 做 KMO + Bartlett 球形检验;2. 做 CFA 验证三因子模型,输出因子载荷、AVE、CR 和模型拟合指数;3. 做 Fornell-Larcker 区分效度检验;4. 分维度计算 Cronbach alpha;5. 给出 APA 7th 格式的论文报告段落。"

ChatSRS 会一次性输出所有信效度指标和可直接放进论文的报告句,无需手动在 SPSS、R 或 Stata 之间切换。

具体操作的完整教程分别见:


七、FAQ

Q:先做信度分析还是效度分析?

A:标准顺序是先效度、再信度。如果使用自编量表,先做 EFA 确定因子结构(效度的一部分),再根据确定的维度分别计算 Cronbach alpha(信度)。如果使用现成的成熟量表,直接做 CFA + 信度分析,不需要先跑 EFA。

Q:信度高,效度一定高吗?

A:不是。高信度是高效度的必要条件但不充分条件。量表可以每次测出一致的分数(高信度),但这些一致的分数反映的是错误的构念(低效度)。打靶比喻:子弹可以每次打在同一个位置(高信度),但那个位置不是靶心(低效度)。

Q:AVE 和 CR 是什么,最低标准是多少?

A:AVE(平均方差提取量)衡量聚合效度,要求 > .50;CR(组合信度)衡量基于因子模型的信度,要求 > .70。两者都从 CFA 结果中计算,ChatSRS 做完 CFA 后会自动给出这两个数字。AVE < .50 但 CR > .60 时,有研究认为仍可接受,但需要额外说明。

Q:论文里最少要报告哪些信效度指标?

A:最简版本(使用成熟量表):各维度 Cronbach alpha(信度)+ CFA 模型拟合指标(CFI/TLI/RMSEA)+ 各维度 AVE 和 CR(聚合效度)。如果审稿人没有特别要求,这五类指标基本能通过大多数社科期刊的审稿。完整版还需要加区分效度(Fornell-Larcker 准则或 HTMT)。

Q:Cronbach alpha 和 CR(组合信度)有什么区别,哪个更好?

A:两者都衡量内部一致性信度,但计算方式不同。Cronbach alpha 假设各题项对构念的贡献相等(tau 等价假设),而 CR 基于 CFA 的因子载荷计算,不做这个假设,在方法论上更严格。如果已经做了 CFA,建议同时报告 alpha 和 CR;如果只做了信度分析而没有 CFA,报告 alpha 即可。

Q:KMO 值和 Bartlett 检验是信度还是效度的指标?

A:两者都属于效度评估的范畴,具体来说是**结构效度(EFA 阶段)**的前提检验指标。KMO(Kaiser-Meyer-Olkin 取样适当性量数)衡量变量间共同因子存在的适合程度,要求 > .70;Bartlett 球形检验检验变量间相关矩阵是否显著不同于单位矩阵,要求 p < .05。这两个指标不反映信度,不要放到"信度分析"部分报告。


小结

信度和效度都是量表质量评估的核心指标,但测量的是不同侧面:

  • 信度 = 一致性:量表能否稳定地、可重复地产生相同结果,核心指标是 Cronbach alpha
  • 效度 = 准确性:量表是否真正测量了目标构念,核心指标包括 KMO/EFA(结构)、AVE/CR(聚合)、Fornell-Larcker/HTMT(区分)

两者的关系:高信度是高效度的前提,但高信度不保证高效度。论文报告必须两者都有,缺一不可。

操作顺序:内容效度(专家) → EFA(探索结构) → 信度分析(Cronbach alpha) → CFA(验证结构 + 聚合效度 + 区分效度)。


相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。