教程 ·

T 检验怎么做:独立样本与配对样本的选择、输出和报告

从研究设计判断独立样本或配对样本 t 检验,并如实说明 ChatSRS 当前输出 t、df、p、均值和标准差的能力,以及单样本、Levene、Welch、置信区间与效应量边界。

t 检验回答的是均值差异问题。真正的第一步不是看哪个 p 值更小,而是判断两组观测是否独立、是否来自同一对象,以及当前工具能不能真实执行所需检验。

一张表分清常见 t 检验

研究问题数据结构常见方法当前 ChatSRS 状态
两个互不重叠组的均值是否不同每人只属于一个组独立样本 t 检验可执行
同一对象的两个时点或成对对象是否不同每行是一对观测配对样本 t 检验可执行
一组样本均值是否不同于常数一组原始观测 + 参照值单样本 t 检验未注册

当前可执行的是独立样本 t 检验和配对样本 t 检验。单样本 t 检验在当前方法注册表中未注册,当前不能执行;页面可以解释它的适用场景,但不能把它写成产品已支持能力。

T 检验怎么做:四步选择流程

  1. 先写研究问题。 明确因变量、比较对象和预期的估计量。
  2. 判断观测关系。 两组由不同对象构成,通常考虑独立样本;同一对象前后测,通常考虑配对样本。
  3. 检查数据是否为原始逐行观测。 当前分析器接收数据表中的实际列,不接收只有均值、标准差和样本量的摘要输入。
  4. 在运行前约定输出边界。 若论文必须报告方差齐性、Welch、置信区间或效应量,要提前安排其他可验证工具补充,而不是在结果出来后凭空补数。

研究设计决定检验类型。不能把同一批人的前测当作一组、后测当作另一独立组,也不能同时跑多个方法后按最小 p 值挑结果。

ChatSRS 当前输出边界

独立样本 t 检验

独立样本分析要求:

  • 指定一个分组变量;
  • 分组变量恰好有两个非缺失组;
  • 指定一个或多个数值型因变量;
  • 每个组对相应因变量至少有 2 个有效观测。

当前实现使用等方差独立样本 t 检验,逐个因变量输出两组的 n、均值、样本标准差、t、p 和整数自由度 n1 + n2 - 2。独立样本分析当前不自动运行 Levene 检验、Welch 校正、置信区间或效应量。

这意味着页面不能声称“方差不齐会自动切换”。如果研究报告要求上述补充结果,应在其他受控工具中运行并记录版本、参数和输出,再与当前结果交叉核对。

配对样本 t 检验

配对分析把输入列按顺序两两成对,例如“前测、后测”。每一对会删除任一列缺失的行,并要求至少 3 对有效观测。

默认输出包括两个条件各自的均值与标准差、均值差、t、p 和自由度。配对分析的详细模式还会输出差值标准差和代码中标为 Cohen's d 的效应量;按实际公式它是以两个时点标准差平方均值的平方根为分母的 d_av,不是以差值标准差为分母的 d_z

当前配对输出也不自动提供均值差置信区间。报告效应量时应明确口径,避免只写“Cohen's d”却让读者误以为使用了另一种配对效应量定义。

当前不能直接运行的输入

只有 MSDn 的汇总统计量,当前不能直接运行本页对应的独立样本或配对样本分析器。必须提供逐行原始数据,并清楚标明分组列或成对变量列。

与当前能力一致的请求示例

独立两组

“用 group 作为分组变量,比较实验组和对照组在 anxiety_post 上的均值,运行独立样本 t 检验。请报告两组 n、均值、标准差、t、df 和 p;不要声称已经运行 Levene、Welch、置信区间或效应量。”

同一对象前后测

“将 anxiety_pre 与 anxiety_post 作为一对变量运行配对样本 t 检验,使用详细模式,报告两个时点的均值和标准差、均值差、差值标准差、t、df、p 与 d_av,并说明完整配对样本数。”

明确写出边界,能减少系统生成超出真实结果的解释。

独立样本结果怎么读

当前表格中的核心字段是:

字段当前含义解读注意
n每组该因变量的有效观测数不同因变量缺失情况可能不同
M、SD每组均值与样本标准差先核对量表方向与取值范围
t在等方差模型下的 t 统计量正负号取决于组别排序
dfn1 + n2 - 2当前不是 Welch 近似自由度
p双侧 t 检验的 p 值不等于实际差异大小

p 值较小只表示在模型假设下,数据与“总体均值相等”不太相容。它不能证明差异具有实际意义,也不能说明分组导致了差异。

若两组不是随机分配,均值差可能同时受基线差异、选择偏差或混杂变量影响。文章和论文应使用“存在均值差异证据”之类的表述,避免直接写成因果效果。

配对样本结果怎么读

配对检验利用同一对象两个观测的对应关系,检验平均差值是否为 0。解读时重点核对:

  • 差值方向是“第一列减第二列”;
  • 进入检验的是完整配对,而不是两个时点各自的全部非缺失样本;
  • t 的正负号随列顺序改变;
  • p 值不反映变化幅度;
  • d_av 的分母口径与 d_z 不同,不能混用阈值或与其他研究直接比较。

如果数据包含三个及以上时点,连续做多次配对 t 检验通常会增加多重比较和信息割裂问题,应改用与研究设计匹配的重复测量分析,或预先约定的对比。

为什么前提检查不能靠一句“自动完成”

t 检验常见的前提与风险包括:

  • 观测是否独立或配对关系是否正确;
  • 因变量是否存在严重异常值;
  • 小样本下差值或组内分布是否严重偏离正态;
  • 独立两组的方差差异是否会影响等方差结果;
  • 缺失是否与组别或结果有关。

这些问题不能只靠一个显著性检验机械开关。图形、研究设计、样本量、估计目标和稳健性分析要一起判断。当前实现没有自动 Levene/Welch 路由,因此需要 Welch 或稳健方法时,应转到能真实执行它们的工具。

APA 报告:只填真实输出

独立样本模板

等方差独立样本 t 检验显示,[组1][变量]M = [ ],SD = [ ],n = [ ])与 [组2]M = [ ],SD = [ ],n = [ ])的均值差异 [达到/未达到] 预先设定的显著性水平,t([df]) = [ ],p = [ ]

此模板只使用当前可验证字段。若另外补做了 Levene、Welch、置信区间或效应量,应明确注明它们来自哪一个工具和哪一次运行。

配对样本模板

[N] 对完整观测进行配对样本 t 检验。[时点1]M = [ ],SD = [ ])与 [时点2]M = [ ],SD = [ ])的平均差为 [ ]t([df]) = [ ],p = [ ]。详细模式计算的效应量为 d_av = [ ],其计算口径为两个时点标准差平方均值的平方根。

不要把示例占位符当成输出,也不要在没有置信区间时补写一个看似合理的区间。

常见问题

p 不显著是否等于两组完全相同

不是。p 值未达到阈值表示当前数据没有提供足够证据拒绝均值相等假设,不等于证明两组相等。等效性问题需要预先设定有意义界值并运行等效性检验。

每组样本超过 30 就可以忽略所有问题吗

不能。较大样本可以改善均值抽样分布,但不会修复错误分组、依赖观测、严重数据错误、选择偏差或不恰当的因果解释。

独立样本结果需要 Cohen's d 吗

许多论文会要求效应量和置信区间,但当前独立样本分析器不输出这些字段。可以使用其他可追溯工具补算,并注明具体公式;不要把配对详细模式的 d_av 误搬到独立样本结果。

两组方差看起来不同怎么办

当前页面对应的独立样本实现仍使用等方差 t 检验。若方差差异值得关注,应另外运行 Welch t 检验或稳健分析,并比较结论对方法选择是否敏感。

开始前的最小清单

  • 两组独立或成对关系已由研究设计确认;
  • 使用的是逐行原始数据,不是汇总数字;
  • 分组标签和配对列顺序已经核对;
  • 没有把未实现的 Levene、Welch、CI 或效应量写进结果;
  • p 值不会被解释成效应大小或因果证明。

确认这些条件后,可进入 ChatSRS 运行已支持的 t 检验。研究者仍需核对输入、输出口径和最终论文表述。

相关阅读


本文按当前分析器实现描述能力;不承诺结果显著,也不代替研究设计与统计复核。