345 字
1 分钟
R语言描述统计分析核心指南
集中趋势与离散程度
计算均值、中位数和众数反映数据的集中情况:
mean(x) # 均值(例如:50.5)median(x) # 中位数(例如:49.0)weighted.mean(x, w) # 加权均值
# 离散程度:极差、方差和标准差max(x) - min(x) # 极差var(x) # 方差(例如:10.2)sd(x) # 标准差(例如:3.19)分位数与形态指标
# 四分位数与分位数quantile(x, probs = c(0.25, 0.75))
# 偏度与峰度(需加载 e1071 包)library(e1071)skewness(x)kurtosis(x)一键输出描述统计量
不用一个一个算,很多包提供了一键汇总功能:
library(psych)describe(stat_data)
library(pastecs)stat.desc(stat_data)进阶补充:矩的数学推导与偏差修正
- 高阶矩的定义:描述性统计实质上是在估计随机变量的各阶矩。一阶原点矩是均值(位置),二阶中心矩是方差(尺度),三阶标准矩是偏度(非对称性),四阶标准矩是峰度(尾部厚度)。
- 样本偏度与峰度的偏差修正:标准的矩估计在小样本下是有偏的。Fisher-Pearson 标准化修正(多数高级统计软件如 SPSS、SAS 的默认行为)会在偏度和峰度的计算中引入 相关的修正系数,以消除有限样本带来的系统性偏差。
- 稳健统计量(Robust Statistics):当数据存在严重异常值时,均值和方差会失效。此时应该使用中位数(Median)、四分位距(IQR)或者截尾均值(Trimmed Mean,
mean(x, trim=0.1))以及中位数绝对偏差(MAD)来更稳健地描述数据分布。
分享
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时
相关文章 猜你想看
1
R语言方差分析 (ANOVA)
管理统计与R实训 T检验只能对比两组差异,如果要看 3 组及以上的分类变量对连续变量的影响,就需要用到方差分析(ANOVA)。
2
R语言基础数据结构
管理统计与R实训 本文将带你了解 R 语言中最基础也是最重要的数据结构:向量、矩阵、数组、数据框、因子和列表。掌握它们是处理任何复杂数据的第一步。
3
R语言字符串与日期处理
管理统计与R实训 在数据清洗中,字符串和日期处理是无法避开的难点。本文重点介绍如何分割、拼接字符串,使用正则表达式提取匹配,以及基础的日期计算。
4
R语言数据导入导出与基础绘图
管理统计与R实训 数据分析的第一步是把数据“搬”进 R 里,分析结束后再输出结果。同时,利用 R 的基础图形系统,我们可以快速生成散点图并进行探索性分析。
5
相关分析与线性回归
管理统计与R实训 当我们要研究两个连续变量(如身高与体重、投入与产出)之间的数量关系时,相关分析和回归分析是最犀利的武器。

