统计百科 ·

统计显著性与 P 值完全指南 — 概念讲透、误解澄清、论文规范报告

彻底讲清 P 值的正确定义、显著性水平 alpha 的由来、5 大常见误解、第一类/第二类错误、多重比较陷阱,以及 APA 7th 论文级规范报告格式。适合做实证研究的本科生、研究生和科研人员。

p < .05,这个数字几乎出现在每一篇实证论文里。但它到底是什么意思?90% 的研究者对它的理解存在偏差。这篇文章把 P 值和统计显著性从头讲透,帮你不再"用错"、不再"被审稿人打回"。


引入:p < .05 到底什么意思?

如果你做过问卷数据分析,你大概写过这样一句话:

"两组均值差异显著(p = .032 < .05),表明干预效果显著。"

审稿人或导师可能批了一个问题:"你的 p 值解读有误。"

为什么?

因为p < .05 不是"干预有效的概率是 95%",也不是"差异是真实的概率是 95%",更不是"零假设错误的概率是 5%"。

P 值有一个非常精确的、经常被误解的定义——理解这个定义,是做严谨实证研究的基础。


回归不显著怎么办:五项诊断

多元线性回归分析不显著时,先区分“整体模型不显著”“单个回归系数不显著”和“区间过宽”。它们不是同一个问题,也不能用同一种补救办法。

  1. 研究设计:回到研究问题,核对时间顺序、对照、混杂因素和理论预期。设计不能识别目标关系时,增加模型数量也不会自动变成可信证据。
  2. 测量:检查变量定义、量表信度、编码、范围受限和测量误差。低质量测量会衰减关系,也可能让系数方向不稳定。
  3. 样本量:结合事前功效依据、效应量和置信区间判断估计精度。小样本下 p > .05 可能只是信息不足,不能直接写成“没有效应”。
  4. 模型设定:检查线性、残差、共线性、必要控制变量和异常值处理。任何调整都要有理论或预设依据,并区分验证性与探索性分析。
  5. 如实报告:同时报告整体 F、R²、系数、标准误、精确 p 值和区间,说明限制。禁止 p-hacking,不能为了显著反复删样本、换变量或只展示成功模型。

因此,“回归不显著能继续分析吗”的答案是:可以继续做有依据的诊断和稳健性分析,但不能继续追逐显著性。可进入 ChatSRS 按五项清单核对回归输出,最终判断仍由研究者根据设计与证据作出。

不显著结果怎么如实写

先报告模型和估计,再说明限制。例如:

整体 F 检验未达预设显著性水平,F(3, 146) = 1.82,p = .146,调整 R² = .016。学习投入的单个回归系数为 B = 0.18,95% CI [-0.04, 0.40],p = .108。区间同时包含接近零与可能有实际意义的正向估计,因此当前样本不足以支持明确关联,也不能据此断言“完全没有效应”。后续仅按预先说明的测量与稳健性方案复核,不以获得 p < .05 为目标。

这类写法保留了整体 F、系数、95% CI、精确 p 值和不确定性,也明确阻断 p-hacking。若整体模型显著但单个系数不显著,或整体模型不显著但个别系数看似显著,也应分别报告并结合共线性、模型设定与研究设计解释,不能挑一个结果代替整套证据。


一、P 值是什么

1.1 从原假设(零假设)说起

每一次假设检验,都从设立**原假设(null hypothesis,H0)**开始。

原假设通常是"什么都没有发生"的假设:

  • "两组均值相等"(H0: mu1 = mu2)
  • "相关系数为零"(H0: rho = 0)
  • "干预没有效果"(H0: 干预组与对照组均值差 = 0)

与原假设对立的是备择假设(alternative hypothesis,H1),即"有差异"、"有效果"、"有关联"。

假设检验的逻辑不是直接证明"有效果",而是采用反证法:假设原假设成立,看数据有多"奇怪"。如果数据足够奇怪(发生概率很低),就有理由拒绝原假设,转而接受备择假设。

1.2 P 值的精确定义

**P 值(p-value)**的正确定义是:

在原假设(H0)为真的前提下,观察到当前样本统计量或比它更极端的结果的概率。

拆解这句话:

  • "在原假设为真的前提下" — 这是一个条件概率,条件是 H0 成立
  • "观察到当前样本统计量或比它更极端的结果" — 不只是这一次的数据,还包括更极端的情况
  • "概率" — 这是一个频率主义的概率,表示在无数次重复实验中出现这种结果的比例

用一个例子说明:

你做了一个独立样本 t 检验,计算得 t = 2.45,p = .032。这个 p = .032 的意思是:假设两组均值本来相等(H0 为真),在同样的实验条件下重复无数次,有 3.2% 的实验会产生 t 值 >= 2.45 或 <= -2.45 这样极端的结果。

因为 3.2% 很小(低于我们事先设定的阈值 5%),我们认为"原假设下这么小概率的事居然发生了"足够令人怀疑原假设,所以拒绝 H0。

注意:这个逻辑里没有任何关于"干预是否有效"的直接概率声明


二、0.05 从哪来——显著性水平 alpha

2.1 alpha 是事先划定的门槛

**显著性水平(significance level)**用希腊字母 alpha 表示,是在实验前人为约定的拒绝 H0 的概率阈值。

最常见的约定是 alpha = .05(5%),也就是:如果 H0 成立,我们愿意接受最多 5% 的概率犯"拒绝了其实正确的 H0"这个错误

规则是:如果 p <= alpha,就拒绝 H0,称结果"统计显著";如果 p > alpha,就不拒绝 H0,称结果"统计不显著"。

2.2 0.05 不是神圣的阈值

alpha = .05 是统计学家费舍尔(Ronald Fisher)在 20 世纪 20 年代提出的经验性约定,最初用于农业实验。他说"1/20 的概率大概是合适的阈值",并非来自严格的数学推导。

不同领域使用不同的 alpha:

领域常用 alpha原因
社会科学、心理学.05惯例,相对宽松
医学临床试验.05 或 .01影响患者,需更严格
粒子物理学.0000003(5 sigma)发现新粒子需极高置信度
基因组学(GWAS).00000005多重检验极多,Bonferroni 校正后
探索性研究.10允许更多"信号"

核心原则:alpha 应在收集数据之前设定,而不是看到 p 值后再调整。

2.3 alpha 和 p 值的关系

  • alpha 是事先设定的阈值(通常 .05)
  • p 值是根据数据计算出来的结果
  • 比较:p <= alpha 就显著,p > alpha 就不显著

两者之间不能混淆——"p < .05 是显著的"这句话成立,是因为我们预先约定了 alpha = .05。


三、P 值的 5 大常见误解

这是论文和课堂中反复出现的错误,每一条都值得仔细辨认。

误解 1:P 值是"原假设为真的概率"

错误表述:"p = .032,说明原假设成立的概率只有 3.2%。"

正确理解:p 值是 P(数据|H0),即在 H0 成立条件下数据出现的概率。它不是 P(H0|数据),即数据下 H0 成立的概率。

后者是贝叶斯后验概率,需要先验概率才能计算,频率主义的 p 值不能给出这个答案。

误解 2:1 - p 是"研究假设为真的概率"

错误表述:"p = .032,所以有 96.8% 的把握认为干预是有效的。"

这个说法在逻辑上是同样的错误,是上一条的变体。p 值不给出任何关于 H1 概率的声明。

误解 3:p 值衡量"效应的大小"

错误表述:"p = .001,说明效应非常强。"

p 值受样本量影响极大:同样大小的效应,样本量越大,p 越小。一个微小但毫无实际意义的差异,在 N = 10000 时完全可能得到 p < .001。

效应大小要用**效应量(effect size)**来衡量,如 Cohen's d、eta squared、r,而不是 p 值。

误解 4:p 值显著就意味着"发现了重要的事"

错误表述:"结果显著(p < .05),本研究具有重要的理论贡献。"

统计显著性 ≠ 实践显著性(practical significance)或理论重要性。

一项干预对学业成绩有"显著效果"(p = .043),但 Cohen's d = 0.05(极小效应),实际上几乎没有任何实践价值。

误解 5:p > .05 证明"没有差异"

错误表述:"p = .12 > .05,说明两组没有差异。"

"不拒绝原假设"和"原假设为真"是完全不同的两件事。p > .05 只说明"数据不够充分支持我们拒绝 H0",这可能因为:

  • 效应真的很小(但不一定是零)
  • 样本量不足(检验功效太低)
  • 数据变异性太大

这条误解导致大量"阴性结果"被曲解为"无差异的证明",是科研中的严重问题。


四、显著 vs 不显著的正确表述

根据上面的分析,以下是写论文时的正确措辞指南:

显著结果的正确表述

  • [可以写] "两组均值差异具有统计显著性,t(118) = -4.45, p < .001"
  • [可以写] "相关分析结果显著,r = .42, p < .001"
  • [不要写] "p < .05,差异是真实的"(p 值不证明差异'真实')
  • [不要写] "干预有效(p = .032)"(需要同时报告效应量才完整)
  • [不要写] "p = .032,有 96.8% 的把握认为干预有效"(概率解读错误)

不显著结果的正确表述

  • [可以写] "两组均值差异未达统计显著性,t(58) = 1.42, p = .162, Cohen's d = 0.18"
  • [可以写] "在本研究样本量下,未观察到统计显著差异(p = .162),效应量估计为 d = 0.18(小效应),可能存在检验功效不足的问题"
  • [不要写] "p > .05,两组无差异"(不能据此得出"无差异"的结论)
  • [不要写] "研究结果为阴性,干预无效"(阴性结果不等于无效的证明)

五、统计显著但无意义 / 不显著不等于无差异

5.1 效应量:显著性之外必须报告的指标

效应量(effect size)回答的是"差异有多大"这个问题,而 p 值只回答"差异是否显著"。

两者缺一不可。APA 7th 版已明确要求在报告显著性的同时报告效应量。

常用效应量指标:

分析类型效应量指标小效应中效应大效应
t 检验(两组比较)Cohen's d0.200.500.80
方差分析eta squared (eta^2).01.06.14
相关分析Pearson r.10.30.50
卡方检验Cramer's V.10.30.50
回归分析f^2.02.15.35

规则:即使 p 值不显著,也应报告效应量,让读者自行判断差异的实践意义。

5.2 统计功效:样本量是否足够?

**统计功效(statistical power)**是指当 H1 为真时,实验能够正确拒绝 H0 的概率(通常设置为 0.80,即 80%)。

功效不足的研究——即样本量太小——即便存在真实效应,也可能得到 p > .05 的结果(漏掉真实信号)。

功效分析通常在研究设计阶段完成,用于计算所需的最小样本量。事后如果结果不显著,也应该说明功效水平,避免把"功效不足"误解为"无差异"。

在 ChatSRS 中,可以用一句话做功效分析:

"假设 Cohen's d = 0.50,两组各多少人才能达到 80% 统计功效?"


六、第一类错误与第二类错误

统计检验是在不确定条件下做决策,难免会犯错。错误分两种:

6.1 第一类错误(Type I Error):误报

  • 定义:原假设为真,却被错误地拒绝了("冤枉了 H0")
  • 概率:等于显著性水平 alpha(通常为 .05)
  • 后果:声称有效果,但其实没有(假阳性)
  • 控制方法:降低 alpha(如设置 .01),或做多重比较校正

比喻:被告无罪,法院却判有罪——这是"冤假错案"。

6.2 第二类错误(Type II Error):漏报

  • 定义:原假设为假(备择假设为真),却没有拒绝 H0("放跑了真信号")
  • 概率:用 beta 表示(通常目标是 beta <= 0.20)
  • 后果:声称没有效果,但其实有(假阴性)
  • 控制方法:增大样本量,提高统计功效(1 - beta)

比喻:被告有罪,法院却判无罪——这是"放纵了罪犯"。

6.3 两类错误的权衡

两类错误是此消彼长的关系:降低 alpha 减少第一类错误,但会增加第二类错误。反之亦然。

H0 为真H0 为假
拒绝 H0(显著)第一类错误(alpha = .05)正确决策(功效 = 1 - beta)
不拒绝 H0(不显著)正确决策(1 - alpha)第二类错误(beta)

七、多重比较问题

7.1 为什么多重比较会膨胀错误率

每次显著性检验都有 5% 的概率犯第一类错误(在 H0 为真时)。如果做 20 次独立检验,每次 alpha = .05,那么至少有一次犯第一类错误的概率高达:

1 - (1 - .05)^20 = 1 - 0.95^20 ≈ 64%

也就是说,做 20 次检验,即使什么效应都不存在,平均会有 1 次得到 p < .05 的"显著"结果——这是纯粹的运气,不是真实的发现。

这个问题叫做家族误差率(familywise error rate,FWER)的膨胀

7.2 常见的多重比较校正方法

Bonferroni 校正是最简单的方法:将每次检验的 alpha 除以总检验次数 m。

如果做 5 次检验,校正后每次显著性阈值为 .05 / 5 = .01。

其他方法:

方法适用场景特点
Bonferroni独立检验,数量不多最保守,控制 FWER
Holm 法Bonferroni 的改进版比 Bonferroni 检验力更高
Benjamini-Hochberg (FDR)探索性研究,检验次数多控制假发现率而非 FWER,更宽松
Tukey HSD多重配对均值比较(ANOVA 事后检验)控制所有配对比较的错误率
ScheffeANOVA 事后检验,比较灵活最保守,适合计划外比较

7.3 什么时候需要多重比较校正

需要校正的情况:

  • 对同一数据集的多个因变量分别做 t 检验
  • ANOVA 后做所有配对均值的事后比较(post-hoc tests)
  • 子组分析中检验多个子组的效应
  • 基因组研究、神经影像数据等大规模检验场景

不需要(或讨论空间较大)的情况:

  • 有明确理论依据的几个主要假设(事先在预注册中写明)
  • 不同研究问题的独立检验(如比较不同量表的基线特征)
  • 探索性研究(用 FDR 宽松控制即可)

八、论文里怎么规范报告 P 值(APA 7th)

APA 出版手册(第七版)对 p 值的报告格式有明确规定。以下是执行层面的具体要求:

8.1 p 值的书写格式

  • p 值不加零(写 p = .032,不写 p = 0.032)
  • p 值精确到小数点后三位(如 p = .032, p = .148, p = .001)
  • 当 p < .001 时,写 p < .001,不写 p = .000 或 p = 0.000(.000 是舍入误差,真实 p 值不是 0)
  • 统计量(t, F, chi^2 等)一般精确到两位小数

8.2 统计显著性报告模板

t 检验

t([df]) = XX, p = .XXX, 95% CI [XX, XX], Cohen's d = X.XX

例:t(118) = -4.45, p < .001, 95% CI [-3.83, -1.47], Cohen's d = 0.81

F 检验(ANOVA)

F([df1], [df2]) = XX.XX, p = .XXX, eta^2 = .XX

例:F(2, 87) = 8.34, p < .001, eta^2 = .16

相关分析

r([df]) = .XX, p = .XXX

例:r(148) = .42, p < .001

卡方检验

chi^2([df], N = XX) = XX.XX, p = .XXX, Cramer's V = .XX

例:chi^2(2, N = 120) = 9.87, p = .007, Cramer's V = .29

8.3 常见格式错误

错误写法正确写法原因
p = 0.032p = .032APA 要求 p 值不加前导零
p = .000p < .001.000 是假值,真实 p 不是 0
p = 0.001p = .001同上,不加前导零
p < 0.05p < .05不加前导零
p = 3.2%p = .032用小数而非百分比
显著(p=.032)t(58) = 2.14, p = .032需要报告完整统计量
p < .05***t(58) = 2.14, p = .032APA 不推荐在文字中用星号,星号用于表格脚注

8.4 表格中 p 值的星号约定

在统计表格的脚注中,仍可使用星号简写:

注:* p < .05, ** p < .01, *** p < .001

但注意:

  • 星号用于表格,文字段落里应写出完整的精确 p 值
  • 脚注字母定义必须与表格内容一致
  • APA 7th 提倡报告精确 p 值(如 .032)而非仅仅 "p < .05"

8.5 一个完整的 APA 报告段落示例

独立样本 t 检验结果显示,实验组干预后焦虑得分(M = 5.82, SD = 3.14)显著低于对照组(M = 8.47, SD = 3.52),t(118) = -4.45, p < .001, 95% CI [-3.83, -1.47],Cohen's d = 0.81,为大效应。Levene 方差齐性检验未达显著(F = 1.43, p = .234),满足独立样本 t 检验的前提假设。

注意这段话里:

  • 报告了 M 和 SD(描述统计)
  • 报告了完整的统计量 t(df) = 值
  • 精确 p 值(p < .001 而非 p = .000)
  • 置信区间
  • Cohen's d 效应量并注明效应大小标准
  • 前提假设检验(Levene)

九、FAQ:实战中的高频疑问

Q:p = .06 怎么办?能说"接近显著"吗?

A:不推荐使用"接近显著"(marginally significant, approaching significance)这类措辞——APA 7th 和多数高质量期刊已明确反对这种说法,因为它是一种数据驯化(p-hacking)的信号。正确做法:诚实报告 p = .060, p > .05,结果未达显著;同时报告效应量(如 d = 0.38,中小效应)和置信区间,让读者判断是否值得用更大样本复验。也可以在讨论部分说明"受样本量限制(n = XX),本研究统计功效为 XX%,可能存在第二类错误的风险"。

Q:p 越小,效应越强吗?

A:不是。p 值同时受效应大小和样本量两个因素影响。样本量越大,同样的效应量会产生越小的 p 值。一个 N = 10000 的研究可以让一个 d = 0.05 的微小效应得到 p < .001,但这个效应在实践上可能毫无意义。评估效应强弱要看效应量指标(Cohen's d、eta^2 等),不要看 p 值的大小。

Q:单侧检验还是双侧检验,p 值差多少?

A:单侧检验的 p 值约为双侧检验的一半(在同等 t 值/z 值下)。单侧检验功效更高,更容易达到显著。但使用单侧检验需要有事先的理论依据和方向性假设,且应在预注册中说明。如果你在看到数据结果后才决定用单侧检验,这就是 p-hacking。没有强烈的方向性理由,默认使用双侧检验。

Q:p 值可以用来比较两个效应的大小吗?

A:不能。"研究 A 得到 p = .001,研究 B 得到 p = .04,所以研究 A 的效应更强"——这个逻辑是错误的。p 值受样本量影响,两个研究的样本量不同时,p 值完全无法比较效应大小。要比较效应大小,需要用同一类效应量指标(如都用 Cohen's d 或都用 r),且理想情况下进行正式的元分析。

Q:p 值能告诉我研究结论可不可以重复吗?

A:不能。p 值是在当前数据下的单次计算结果,本身不是"结论可复现性"的度量。一项 p = .049 的研究,在同样条件下重复,得到 p < .05 的概率甚至可能不到 50%(取决于效应量和样本量)。可复现性需要用置信区间、效应量报告、预注册、充足样本量和直接重复实验来保障。

Q:论文 p 值显著,是不是就说明我的研究假设"被证明"了?

A:统计推断中没有"证明",只有"提供了证据"。拒绝 H0 表示"数据与 H0 不相符",这给 H1 提供了间接支持,但并不代表 H1 被"证明"。测量误差、混淆变量、模型假设违反等因素都可能导致虚假显著。论文中应写"结果支持了……假设"而不是"证明了……"。


小结

理解 P 值和统计显著性,是读懂统计结果、写好论文的基础能力。核心要点:

  1. P 值的正确定义:在 H0 为真的前提下,观察到当前数据或更极端数据的概率,不是 H0 为真的概率,也不是效应为真的概率。
  2. alpha 是人为约定的阈值,.05 不是神圣不可侵犯的,要在数据收集前设定。
  3. 5 大误解:p 不是 H0 为真的概率、不是效应大小的度量、显著不等于重要、不显著不等于无差异。
  4. 效应量和功效:显著性之外必须报告效应量;不显著时要检查是否是功效不足导致的。
  5. 两类错误:第一类(误报)受 alpha 控制,第二类(漏报)受功效控制,两者权衡。
  6. 多重比较:多次检验会膨胀第一类错误率,应做 Bonferroni / FDR 等校正。
  7. APA 报告规范:p 值不加前导零、精确三位小数、p < .001 时写 p < .001 而非 p = .000,同时报告完整统计量和效应量。

相关阅读

想把这些概念用于实际分析,可以继续阅读:


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。