教程 ·

主成分分析(PCA)怎么做?降维、综合指标、载荷与得分解读

主成分分析中文指南:明确 PCA 用于降维或构建综合指标,说明适用条件、标准化、主成分保留、成分载荷、得分与排名边界,并区分 PCA 与因子分析。

主成分分析把一组可能相关的数值变量转换为少数互不相关的线性组合。它可以用于降维、可视化前处理,也可以在明确规范选择后构建综合指标,但不能自动证明潜在构念,也不能仅凭一个排名替代实质判断。

PCA 不是 EFA 或共同因子分析的简写:PCA 分解观测变量的总方差,因子分析则以共同因子和独特方差的模型为核心。若研究目标是量表潜在结构,请先看EFA、CFA 与 PCA 选择树


PCA 的目标:降维或构建综合指标

目标一:降维

当多个变量高度相关、信息重复时,PCA 可用较少主成分表示主要变异。常见用途包括:

  • 在可视化或聚类前压缩维度;
  • 缓解大量相关特征带来的冗余;
  • 用少数得分代替一组高度相关指标;
  • 探索数据中主要变化方向。

降维目标强调信息保留和稳定性,不要求每个主成分都有一个强行命名的现实构念。

目标二:构建综合指标

研究者有时用保留主成分的得分合成综合指数或排序。这个步骤包含额外选择:

  • 哪些原始指标应该进入;
  • 正向、负向指标如何统一方向;
  • 是否基于相关矩阵标准化;
  • 保留几个成分;
  • 如何给成分得分加权;
  • 排名是否对样本、年份和异常值稳定。

因此,PCA 提供的是数据驱动的线性组合,不会自动赋予“公平”“重要”或“竞争力”等规范含义。综合指标必须由研究者说明构念、方向和权重合理性。

适用条件与数据准备

1. 变量应适合线性组合

PCA 通常用于数值变量。若变量是名义分类、极端偏态、有大量结构性零或测量尺度不可比,应先考虑相应编码、变换或其他方法,不要直接塞进同一相关矩阵。

2. 变量之间需要有可压缩的信息

若所有变量几乎无关,PCA 难以用少数成分保留主要信息;若变量几乎完全重复,则需先检查数据冗余。相关矩阵、散点图和领域含义要一起看。

3. 标准化取决于量纲与目标

  • 单位和方差差异很大时,常基于标准化变量或相关矩阵做 PCA;
  • 单位相同且原始方差本身具有实质意义时,协方差矩阵可能更合适;
  • 正负指标的方向要在构建综合指数前统一并记录。

“任何 PCA 都必须标准化”并不准确。选择相关矩阵还是协方差矩阵,应由变量单位、方差意义和研究目标决定。

4. 样本与结果稳定性

没有适用于所有 PCA 的固定“样本数是变量数几倍”规则。稳定性取决于变量数、相关结构、特征值间距、异常值和研究目的。应报告样本限制,并在可行时用重抽样、分样本或新数据检查载荷与得分稳定性。

5. 异常值和缺失值

PCA 对极端观测可能敏感。应先核对缺失处理、异常值依据和数据录入,不因某个样本影响排名就事后剔除。

保留几个主成分

保留主成分应综合碎石图、平行分析、累计方差、特征值间距、样本外用途和可解释性,不能只用“特征值大于 1”一条规则。

常见证据

证据能说明什么局限
碎石图特征值下降在哪出现明显拐点拐点可能主观或不清晰
平行分析实际特征值是否超过随机数据参照实现与数据类型要匹配
累计方差保留成分覆盖多少样本方差不存在跨学科统一比例
下游验证保留维度对预测、聚类或可视化是否稳定依赖具体任务
领域解释成分是否能支持研究用途不能用解释方便替代统计证据

若不同规则给出不同成分数,应报告选择依据并做敏感性分析,而不是挑选最有利于预期结论的方案。

成分载荷和得分怎么解释

成分载荷

成分载荷反映原始变量与主成分的关系,其方向和大小帮助判断哪些变量共同定义了该轴;载荷符号还受主成分整体符号任意性的影响,不能把负号自动解释为“负面”。

阅读时:

  1. 查看每个成分上绝对载荷较大的变量;
  2. 结合变量方向和单位解释共同变化模式;
  3. 注意一个变量可能在多个成分上都有信息;
  4. 不要只凭载荷阈值机械命名;
  5. 若更换样本后载荷结构变化很大,应降低解释强度。

主成分得分

得分表示每个观测在主成分轴上的相对位置。不同得分算法和标准化方式可能产生不同数值,因此报告中要说明方法。得分通常适合比较样本内相对位置,不一定可直接跨时期或跨样本比较。

综合得分与排名

若用多个成分合成综合得分,应明确:

  • 使用哪些成分;
  • 加权公式及其依据;
  • 指标方向如何处理;
  • 排名对保留成分数、标准化和异常值是否敏感;
  • 综合得分是样本内相对量,还是经过外部标定的量。

方差解释率较高只表示该轴覆盖较多变异,不等于它在政策、管理或伦理上更重要。


一份可复核的 PCA 流程

第一步:冻结变量合同

列出变量定义、单位、方向、缺失规则和纳入理由。综合评价尤其要说明指标体系从何而来。

第二步:检查数据

报告描述统计、相关结构、异常值和有效样本。决定使用相关矩阵还是协方差矩阵,并说明是否标准化。

第三步:估计并决定维数

输出特征值、解释方差、碎石图以及所采用的维数证据。不要在看到排名后才改变成分数。

第四步:解释载荷和得分

同时保留完整载荷矩阵与得分方法。命名是领域解释,不是算法自动生成的事实。

第五步:检查稳定性

比较不同合理设定、重抽样或分样本下的载荷、得分和排序。若结论高度敏感,应在报告中说明。

进入 ChatSRS 按五步清单整理 PCA。输出仍需由研究者核对变量、矩阵选择、保留规则、载荷和综合公式,平台不替研究者决定排名含义。


报告模板

本研究对〔变量数量〕项指标进行主成分分析,以〔降维/构建综合指标〕。鉴于〔单位和方差情况〕,分析基于〔相关/协方差〕矩阵,并对〔说明变量〕进行〔标准化/方向转换〕。主成分数量综合碎石图、平行分析、累计方差及研究用途确定,共保留〔数量〕个成分,累计解释〔比例〕的样本方差。各成分的主要载荷变量见表〔编号〕;得分采用〔方法〕计算,并通过〔重抽样/分样本/敏感性分析〕评估稳定性。

若进一步构建综合指数,应另写加权公式、方向处理和稳健性结果,不能只呈现最终排名。


常见问题

Q1:PCA 和 EFA 有什么区别?

PCA 用线性组合压缩观测变量总方差;EFA 假设共同因子解释变量间共享方差。降维与综合得分通常考虑 PCA,潜在测量结构则考虑 EFA/CFA。

Q2:PCA 前一定要做 KMO 和 Bartlett 检验吗?

它们可描述相关结构是否有压缩空间,但不能替代对变量、图形、异常值和稳定性的检查,也不应作为跨场景唯一准入门槛。

Q3:特征值大于 1 就一定保留吗?

不是。该规则可能保留过多或过少成分,应与碎石图、平行分析、累计方差、下游用途和稳定性共同判断。

Q4:主成分得分可以直接排名吗?

可以构建样本内排序,但要先说明指标方向、标准化、保留成分和加权公式,并检查排序对合理设定是否稳定。算法不会自动赋予排名现实价值。


相关阅读


本文用于解释 PCA 的方法合同与报告边界,不把经验规则写成统一阈值。