教程 ·
描述统计与频数分析怎么做?N、均值、标准差和百分比分母
按 ChatSRS 当前两个分析器说明真实字段:描述统计逐变量输出有效 N、最小值、最大值、均值、样本标准差和中位数;频数分析输出频数、百分比及累积百分比,并披露不同缺失分母。
ChatSRS 当前把数值描述和分类频数分成两个独立分析器。DescriptiveAnalyzer 当前逐变量输出有效 N、最小值、最大值、均值、样本标准差和中位数;FrequencyAnalyzer 负责分类值的频数表。两者不会自动合成论文 Table 1。
下列字段只是描述统计与频数分析的字段顺序模板,不是真实产品回执;请用同一次运行的真实输出替换,并逐项复核变量类型、有效 N、缺失类别、百分比分母和排序。
先按研究角色分变量
不要只凭“数字长得像数字”决定分析方式。
- 连续数值变量通常先用描述统计检查范围、中心和离散;
- 名义或有序分类变量通常用频数表检查类别和比例;
- 用数字编码的类别仍可能是分类变量;
- 身份编号、邮编和题目代码不应因为是数字就计算均值;
- Likert 单题或量表总分应按研究设计和报告规范决定口径。
同一列在不同研究中可能承担不同角色。运行前应保存变量字典、单位、缺失码和合法范围。
描述统计有哪些真实字段
DescriptiveAnalyzer 对用户指定的每一列分别处理:
- 尝试把值转成数值;
- 非数值会转为缺失,再逐变量删除;
- 没有有效值的列会被跳过并产生 warning;
- 每列用自己的有效观测计算结果。
当前表格包含:
| 字段 | 当前计算口径 | 核对重点 |
|---|---|---|
| 有效 N | 当前变量转数值并删除缺失后的行数 | 不一定与其他变量相同 |
| 最小值 | 有效数值中的最小值 | 是否存在异常码或单位错误 |
| 最大值 | 有效数值中的最大值 | 是否超出量尺范围 |
| 均值 | 有效数值的算术平均数 | 是否适合当前变量 |
| 样本标准差 | pandas 默认样本标准差 | N 很小时要谨慎解释 |
| 中位数 | 有效数值排序后的中位位置 | 不能替代完整分布检查 |
它当前不计算分位数表,也不判断变量“是否正态”。均值、标准差和中位数同时存在,并不表示系统已经替研究者选好了最终报告方式。
不同变量的 N 为什么会不同
描述统计是逐变量删除缺失。若年龄缺一行、收入缺另一行,两列仍各自使用自己的有效数据,因此 N 可以不同。
这与需要多列同时进入模型时的完整案例删除不是同一个分母。把多列描述结果放进同一张表时,不能在表头写一个统一 N 后忽略各列差异。
频数分析有哪些真实字段
FrequencyAnalyzer 当前逐变量输出频数、百分比和累积百分比。
| 字段 | 当前计算口径 | 核对重点 |
|---|---|---|
| 变量 | 当前分类变量 | 是否与变量字典一致 |
| 选项 | 类别值或值标签 | 数字编码是否被正确解释 |
| 频数 | 该类别的行数 | 缺失类别也可能出现 |
| 百分比 | 该类别频数除以当前变量总行数 | 当前分母包含缺失 |
| 累积百分比 | 按当前排序逐项累加 | 名义类别通常不宜作次序解释 |
只要当前列至少有一个非缺失类别,频数分析就会把该列中的缺失值也作为一个类别计入百分比分母。它使用 value_counts(dropna=False),所以这里的百分比不是“有效百分比”;若需要排除缺失后的有效百分比,必须另行计算并明确标注。整列均为 pandas 缺失值(NA/NaN)时会被跳过并记录 warning;如果所有所选列都属于这种情况,公共运行入口会以“没有有效的列可供频数分析”错误结束,并且不生成频数表。空字符串或只含空白的字符串不会被 isnull() 识别为缺失,因此不会触发跳过,而会作为普通类别计数;需要在分析前按研究的数据字典明确清洗。
类别按数值优先、字符串其次、缺失最后排序。累积百分比只是这个排序下的累计结果。对于没有自然顺序的名义类别,累计值通常没有实质解释。
当前多变量频数表末尾还会出现一个全局总计,它把各变量频数相加。该数值不是独立受访者数,不能抄成样本量。
两种缺失口径不能混写
| 分析器 | 缺失处理 | 百分比或统计量分母 |
|---|---|---|
| 描述统计 | 转数值后逐变量删除缺失 | 当前变量的有效数值 N |
| 频数分析 | 至少含一个非缺失值的列把缺失保留为一个类别;整列均为 pandas 缺失值(NA/NaN)时跳过 | 当前未被跳过变量的全部行,包括缺失 |
两种结果若要整理成 Table 1 样本特征表,必须由用户核对分母和缺失规则后再合成。尤其不能把频数表的百分比写成“有效百分比”,也不能假设所有连续变量共享同一个 N。
当前没有自动提供的字段
当前不提供 IQR、偏度、峰度、Shapiro-Wilk、缺失率。
它不会自动生成连续与分类混合三线表,也不会自动生成完整 APA 段落。当前字段也不能替代直方图、箱线图、异常值规则、加权分析、复杂抽样口径或正式缺失机制评估。
如果目标规范要求中位数与 IQR、正态性检验、置信区间、加权比例或分层样本描述,应在单独核验的流程中计算,并记录来源。
一个可复核的样本特征流程
- 冻结变量字典:名称、单位、类型、值标签和缺失码。
- 检查数值转换:确认文本、千分位、单位和异常码没有变成缺失。
- 数值变量跑描述统计:逐列核对有效 N、范围、均值、SD 和中位数。
- 分类变量跑频数分析:核对类别、缺失行和全部行分母。
- 记录 warning:整列均为 pandas 缺失值(NA/NaN)、非数值转换和类别过多都要进入记录;空字符串和空白字符串须另行清洗。
- 决定最终报告口径:由研究问题、分布和目标规范决定。
- 再整理 Table 1:逐项注明 N 或缺失规则,不自动拼表。
- 形成待审草稿:每个数字都能追溯到真实表格。
要在 GUI、代码与自然语言工具之间选择执行方式,可查看AI 数据分析工具的证据优先选型。若这张样本特征表属于论文分析流程,还应回到毕业论文统计分析的研究者责任清单,核对问题定义、数据处理和最终判断分别由谁负责。
样本特征字段顺序模板
数据:
- 数据版本:[真实文件或数据集版本]
- 原始总行数:[真实值]
- 变量字典版本:[真实记录]
连续变量:
- [变量名]:有效 N=[真实值];最小值=[真实值];最大值=[真实值];
均值=[真实值];样本标准差=[真实值];中位数=[真实值]
分类变量:
- [变量名]:[类别 A] n=[真实值],[真实百分比];
[类别 B] n=[真实值],[真实百分比];
缺失类别 n=[真实值]
- 百分比分母:当前变量全部行,包括缺失
核对:
- warning:[原样保留并解释]
- 变量类型与最终报告口径:[研究者决定]
待审草稿:
“样本特征基于[数据版本]整理。连续变量按各自有效 N 报告;
分类变量百分比当前以包含缺失的全部行为分母。
各变量统计量和缺失数量见[真实表号]。”
这个模板不自动成为 APA 表,也没有替用户判断均值或中位数哪个更合适。
常见问题
描述统计会自动给 IQR 吗?
不会。当前只有最小值、最大值、均值、样本标准差和中位数。IQR 需要另行计算。
频数百分比会自动排除缺失吗?
不会。对于至少有一个非缺失类别的列,当前缺失作为一个类别进入分母;只有整列均为 pandas 缺失值(NA/NaN)时才会被跳过,空字符串或空白字符串仍会作为普通类别计数。若另算有效百分比,必须同时保留缺失数和新分母。
数值型性别编码应该跑描述统计还是频数?
如果数字代表类别,应按分类变量做频数分析,而不是解释均值。值标签和参照含义需要回到变量字典。
能把两个输出直接拼成论文 Table 1 吗?
可以把真实字段作为素材,但不能机械拼接。先统一标签、单位、小数位和缺失说明,并核对每个分母,再按学校或期刊模板整理。