教程 ·

Logistic 回归分析怎么做?二元模型、OR 值与结果解读

Logistic 回归分析中文指南:先按二元、多分类、有序结局选择模型,再核对变量编码、OR 与置信区间、拟合和诊断,避免把不同模型混为一谈。

Logistic 回归不是一个可以套到所有分类结局上的单一按钮。开始分析前,先看因变量有几个类别、类别有没有自然顺序,再决定模型;之后才是变量编码、OR、置信区间和拟合诊断。

本文重点解释最常见的二元 Logistic 回归。如果你的结局是三类以上或有明确等级,应先完成模型分流,不能直接沿用二元模型的输出和解释。


“logistics 回归分析”是什么:先纠正规范名称

“logistics 回归分析”是用户检索时的常见搜索拼写,统计学中的规范名称是 Logistic 回归;英文 logistics 通常指物流领域,不是这里讨论的统计模型。

拼写差异不会产生一种新的回归方法。实际分析仍要先看因变量:两个互斥结果通常进入二元 Logistic 回归;三个及以上无序类别、有序类别则要分别匹配多分类或有序模型。本文后续聚焦当前可承接的二元模型,并用 Logistic 作为统一名称。


二元、多分类、有序 Logistic:先按因变量分流

  1. 二元 Logistic:因变量只有两个互斥结果,例如是否患病、是否购买、是否通过。当前页面和当前页面对应的分析入口只承接二元 Logistic 的基础建模与结果核对。
  2. 多分类 Logistic:因变量有三个或更多、类别之间没有自然顺序,例如品牌 A/B/C。多分类模型会分别比较各类别与参照类别,参数数量和解释方式不能沿用二元模型,需另行确认匹配的工具与实现。
  3. 有序 Logistic:因变量有三个或更多且存在自然顺序,并需检查比例优势或平行线假设,例如低/中/高满意度;若假设不满足,应另行确认部分比例优势模型或其他方案。

若因变量本来是连续量,不要为了使用 Logistic 回归随意二分。人为切点会损失信息,也可能改变结论。更完整的选择树可读二元、多分类与有序 Logistic 怎么选


二元 Logistic 回归回答什么问题

设事件发生概率为 P,二元 Logistic 回归建模的是对数优势:

logit(P) = ln[P / (1 - P)] = b0 + b1X1 + ... + bkXk

系数 b 经过指数变换得到 OR = exp(b)

  • OR > 1:在其他变量保持不变时,X 增加一个单位与事件优势升高相关;
  • OR < 1:与事件优势降低相关;
  • OR = 1:点估计对应没有优势变化;
  • 95% 置信区间包含 1:当前数据不足以排除无关联,但不等于已经证明没有关系。

OR 描述的是优势比,不是概率倍数。事件较常见时,OR 和风险比可能差异明显,报告中不能混用。

第一步:定义事件与变量编码

分析前应建立数据字典:

项目要核对的内容
因变量哪个值代表事件,哪个值是非事件;是否存在其他类别或缺失码
连续自变量单位是否有意义,是否需要按 10 单位或一个标准差解释
分类自变量参照组是谁,虚拟变量如何编码
有序自变量是按连续趋势处理,还是作为分类变量进入模型
缺失值删除或插补规则是否事先说明

例如,若 hypertension = 1 表示确诊,0 表示未确诊,则 OR 解释的是确诊优势。若编码相反,系数方向和 OR 解释也会反过来。

第二步:先看样本与事件数

先报告总样本量、事件数、非事件数和各预测变量的缺失情况。预测变量很多而事件很少时,模型容易过拟合,系数和区间会不稳定。

“每个变量至少 10 个事件”只能作为粗略提醒,不是通用保证。所需信息量还取决于效应大小、变量分布、非线性、缺失和惩罚方法。应结合研究设计与适当的样本量评估,而不是用单一经验数字替代判断。

第三步:检查模型设定

二元 Logistic 不要求自变量或残差正态,但仍需检查:

  • 连续变量与 logit 的关系是否近似线性;
  • 分类变量参照组是否符合研究问题;
  • 自变量之间是否存在严重共线性;
  • 是否有完全或近完全分离;
  • 交互项、非线性项和控制变量是否有理论依据;
  • 观测是否独立,若存在聚类或重复测量,是否需要匹配的模型。

不要先做一轮单因素筛选,再仅按 p 值决定谁能进入多因素模型。重要混杂因素可能在单因素分析中不显著,但仍应依据理论与设计保留。

第四步:按顺序阅读结果

建议按以下顺序读表:

  1. 确认模型使用的样本数和事件编码;
  2. 查看整体模型与基准模型的比较,但不把一个拟合指标当成唯一门槛;
  3. 查看每个变量的 b、SE、OR、95% CI 和精确 p 值;
  4. 检查拟合、区分度与校准,它们回答的问题不同;
  5. 回到研究设计,判断措辞应使用“关联”“预测”还是在强设计下讨论因果。

OR 报告示例

在控制年龄与吸烟状态后,BMI 每增加 1 kg/m² 与高血压优势升高相关,OR = 1.12,95% CI [1.05, 1.19],p < .001。

这里的 1.12 不是“患病概率增加 12%”。若要表达预测概率,应在明确其他变量取值的条件下计算边际概率或预测概率。

第五步:区分拟合、区分度与校准

  • 拟合比较:似然比检验、信息准则等用于比较特定模型;
  • 区分度:ROC AUC 描述模型区分事件与非事件的能力;
  • 校准:比较预测概率与实际发生率,不能只靠一个拟合优度检验;
  • 内部验证:在预测研究中,可用重抽样或交叉验证评估乐观偏差。

高 AUC 不代表概率预测准确,也不自动说明模型可用于临床或业务决策。模型用途、阈值和外部验证需要另行论证。


可复用的分析请求清单

提交分析前,把下面信息写清楚:

  • 因变量及事件编码;
  • 每个自变量的类型、单位与参照组;
  • 预先确定的控制变量和交互项;
  • 需要报告的 OR、区间、拟合和诊断;
  • 数据中的聚类、重复测量与缺失规则;
  • 结果用于解释关联还是建立预测模型。

进入 ChatSRS 按清单核对二元 Logistic 回归。平台输出仍需与数据字典、研究设计和原始结果逐项复核,研究者负责模型选择与最终结论。


常见问题

Q1:二元因变量可以用线性回归吗?

线性概率模型在特定研究中有其用途,但预测值可能超出 0 到 1,且误差结构需要稳健处理。若目标是常规二元结局建模和 OR 解释,二元 Logistic 通常更直接;最终仍取决于研究问题与估计目标。

Q2:OR 的置信区间包含 1,能写“没有影响”吗?

不能。更准确的写法是当前区间包含 1,数据没有提供足够精确的关联证据,并同时报告区间范围。因果用语还需要研究设计支持。

Q3:Hosmer-Lemeshow 检验不显著就说明模型好吗?

不能单独这样判断。该检验受样本量和分组方式影响,应与校准图、区分度、残差或影响点诊断及外部验证需求一起看。

Q4:多分类或有序结局能先合成二分类吗?

只有在切点具有明确临床、业务或理论含义且事先确定时才考虑。为了让模型更容易显著而事后合并类别,会损失信息并增加偏倚风险。


相关阅读


本文提供二元 Logistic 回归的方法与报告框架,不替代领域专家对研究设计、样本和模型的审查。