教程 ·
Logistic 回归分析怎么做?二元模型、OR 值与结果解读
Logistic 回归分析中文指南:先按二元、多分类、有序结局选择模型,再核对变量编码、OR 与置信区间、拟合和诊断,避免把不同模型混为一谈。
Logistic 回归不是一个可以套到所有分类结局上的单一按钮。开始分析前,先看因变量有几个类别、类别有没有自然顺序,再决定模型;之后才是变量编码、OR、置信区间和拟合诊断。
本文重点解释最常见的二元 Logistic 回归。如果你的结局是三类以上或有明确等级,应先完成模型分流,不能直接沿用二元模型的输出和解释。
“logistics 回归分析”是什么:先纠正规范名称
“logistics 回归分析”是用户检索时的常见搜索拼写,统计学中的规范名称是 Logistic 回归;英文 logistics 通常指物流领域,不是这里讨论的统计模型。
拼写差异不会产生一种新的回归方法。实际分析仍要先看因变量:两个互斥结果通常进入二元 Logistic 回归;三个及以上无序类别、有序类别则要分别匹配多分类或有序模型。本文后续聚焦当前可承接的二元模型,并用 Logistic 作为统一名称。
二元、多分类、有序 Logistic:先按因变量分流
- 二元 Logistic:因变量只有两个互斥结果,例如是否患病、是否购买、是否通过。当前页面和当前页面对应的分析入口只承接二元 Logistic 的基础建模与结果核对。
- 多分类 Logistic:因变量有三个或更多、类别之间没有自然顺序,例如品牌 A/B/C。多分类模型会分别比较各类别与参照类别,参数数量和解释方式不能沿用二元模型,需另行确认匹配的工具与实现。
- 有序 Logistic:因变量有三个或更多且存在自然顺序,并需检查比例优势或平行线假设,例如低/中/高满意度;若假设不满足,应另行确认部分比例优势模型或其他方案。
若因变量本来是连续量,不要为了使用 Logistic 回归随意二分。人为切点会损失信息,也可能改变结论。更完整的选择树可读二元、多分类与有序 Logistic 怎么选。
二元 Logistic 回归回答什么问题
设事件发生概率为 P,二元 Logistic 回归建模的是对数优势:
logit(P) = ln[P / (1 - P)] = b0 + b1X1 + ... + bkXk
系数 b 经过指数变换得到 OR = exp(b):
- OR > 1:在其他变量保持不变时,X 增加一个单位与事件优势升高相关;
- OR < 1:与事件优势降低相关;
- OR = 1:点估计对应没有优势变化;
- 95% 置信区间包含 1:当前数据不足以排除无关联,但不等于已经证明没有关系。
OR 描述的是优势比,不是概率倍数。事件较常见时,OR 和风险比可能差异明显,报告中不能混用。
第一步:定义事件与变量编码
分析前应建立数据字典:
| 项目 | 要核对的内容 |
|---|---|
| 因变量 | 哪个值代表事件,哪个值是非事件;是否存在其他类别或缺失码 |
| 连续自变量 | 单位是否有意义,是否需要按 10 单位或一个标准差解释 |
| 分类自变量 | 参照组是谁,虚拟变量如何编码 |
| 有序自变量 | 是按连续趋势处理,还是作为分类变量进入模型 |
| 缺失值 | 删除或插补规则是否事先说明 |
例如,若 hypertension = 1 表示确诊,0 表示未确诊,则 OR 解释的是确诊优势。若编码相反,系数方向和 OR 解释也会反过来。
第二步:先看样本与事件数
先报告总样本量、事件数、非事件数和各预测变量的缺失情况。预测变量很多而事件很少时,模型容易过拟合,系数和区间会不稳定。
“每个变量至少 10 个事件”只能作为粗略提醒,不是通用保证。所需信息量还取决于效应大小、变量分布、非线性、缺失和惩罚方法。应结合研究设计与适当的样本量评估,而不是用单一经验数字替代判断。
第三步:检查模型设定
二元 Logistic 不要求自变量或残差正态,但仍需检查:
- 连续变量与 logit 的关系是否近似线性;
- 分类变量参照组是否符合研究问题;
- 自变量之间是否存在严重共线性;
- 是否有完全或近完全分离;
- 交互项、非线性项和控制变量是否有理论依据;
- 观测是否独立,若存在聚类或重复测量,是否需要匹配的模型。
不要先做一轮单因素筛选,再仅按 p 值决定谁能进入多因素模型。重要混杂因素可能在单因素分析中不显著,但仍应依据理论与设计保留。
第四步:按顺序阅读结果
建议按以下顺序读表:
- 确认模型使用的样本数和事件编码;
- 查看整体模型与基准模型的比较,但不把一个拟合指标当成唯一门槛;
- 查看每个变量的
b、SE、OR、95% CI 和精确 p 值; - 检查拟合、区分度与校准,它们回答的问题不同;
- 回到研究设计,判断措辞应使用“关联”“预测”还是在强设计下讨论因果。
OR 报告示例
在控制年龄与吸烟状态后,BMI 每增加 1 kg/m² 与高血压优势升高相关,OR = 1.12,95% CI [1.05, 1.19],p < .001。
这里的 1.12 不是“患病概率增加 12%”。若要表达预测概率,应在明确其他变量取值的条件下计算边际概率或预测概率。
第五步:区分拟合、区分度与校准
- 拟合比较:似然比检验、信息准则等用于比较特定模型;
- 区分度:ROC AUC 描述模型区分事件与非事件的能力;
- 校准:比较预测概率与实际发生率,不能只靠一个拟合优度检验;
- 内部验证:在预测研究中,可用重抽样或交叉验证评估乐观偏差。
高 AUC 不代表概率预测准确,也不自动说明模型可用于临床或业务决策。模型用途、阈值和外部验证需要另行论证。
可复用的分析请求清单
提交分析前,把下面信息写清楚:
- 因变量及事件编码;
- 每个自变量的类型、单位与参照组;
- 预先确定的控制变量和交互项;
- 需要报告的 OR、区间、拟合和诊断;
- 数据中的聚类、重复测量与缺失规则;
- 结果用于解释关联还是建立预测模型。
可进入 ChatSRS 按清单核对二元 Logistic 回归。平台输出仍需与数据字典、研究设计和原始结果逐项复核,研究者负责模型选择与最终结论。
常见问题
Q1:二元因变量可以用线性回归吗?
线性概率模型在特定研究中有其用途,但预测值可能超出 0 到 1,且误差结构需要稳健处理。若目标是常规二元结局建模和 OR 解释,二元 Logistic 通常更直接;最终仍取决于研究问题与估计目标。
Q2:OR 的置信区间包含 1,能写“没有影响”吗?
不能。更准确的写法是当前区间包含 1,数据没有提供足够精确的关联证据,并同时报告区间范围。因果用语还需要研究设计支持。
Q3:Hosmer-Lemeshow 检验不显著就说明模型好吗?
不能单独这样判断。该检验受样本量和分组方式影响,应与校准图、区分度、残差或影响点诊断及外部验证需求一起看。
Q4:多分类或有序结局能先合成二分类吗?
只有在切点具有明确临床、业务或理论含义且事先确定时才考虑。为了让模型更容易显著而事后合并类别,会损失信息并增加偏倚风险。
相关阅读
本文提供二元 Logistic 回归的方法与报告框架,不替代领域专家对研究设计、样本和模型的审查。