mobile wallpaper 1
345 字
1 分钟
R语言描述统计分析核心指南
2026-06-29

集中趋势与离散程度#

计算均值、中位数和众数反映数据的集中情况:

code.R
mean(x) # 均值(例如:50.5)
median(x) # 中位数(例如:49.0)
weighted.mean(x, w) # 加权均值
# 离散程度:极差、方差和标准差
max(x) - min(x) # 极差
var(x) # 方差(例如:10.2)
sd(x) # 标准差(例如:3.19)

分位数与形态指标#

code.R
# 四分位数与分位数
quantile(x, probs = c(0.25, 0.75))
# 偏度与峰度(需加载 e1071 包)
library(e1071)
skewness(x)
kurtosis(x)

一键输出描述统计量#

不用一个一个算,很多包提供了一键汇总功能:

code.R
library(psych)
describe(stat_data)
library(pastecs)
stat.desc(stat_data)

进阶补充:矩的数学推导与偏差修正#

  • 高阶矩的定义:描述性统计实质上是在估计随机变量的各阶矩。一阶原点矩是均值(位置),二阶中心矩是方差(尺度),三阶标准矩是偏度(非对称性),四阶标准矩是峰度(尾部厚度)。
  • 样本偏度与峰度的偏差修正:标准的矩估计在小样本下是有偏的。Fisher-Pearson 标准化修正(多数高级统计软件如 SPSS、SAS 的默认行为)会在偏度和峰度的计算中引入 n(n1)/(n2)\sqrt{n(n-1)}/(n-2) 相关的修正系数,以消除有限样本带来的系统性偏差。
  • 稳健统计量(Robust Statistics):当数据存在严重异常值时,均值和方差会失效。此时应该使用中位数(Median)、四分位距(IQR)或者截尾均值(Trimmed Mean,mean(x, trim=0.1))以及中位数绝对偏差(MAD)来更稳健地描述数据分布。
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

R语言描述统计分析核心指南
https://blog.sopak.space/posts/study/economics-management/ms-rfp/5/
作者
Xxxhite
发布于
2026-06-29
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录