2.5.1 统计分析方法

更新于 2026年10月10日 版权声明
2.5.1 统计分析方法

常用的数据分析方法如下。

(1)描述统计

描述性统计是指运用制表和分类,图形以及计算概括性数据来描述数据的集中趋势、离散趋势、偏度、峰度。

缺失值填充:常用方法有剔除法、均值法、最小邻居法、比率回归法、决策树法。

正态性检验:很多统计方法都要求数值服从或近似服从正态分布,所以之前需要进行正态性检验。常用方法有非参数检验的K-量检验、P-P图、Q-Q图、W检验、动差法。

(2)假设检验

参数检验是在已知总体分布的条件下(要求总体服从正态分布)对一些主要的参数(如均值、百分数、方差、相关系数等)进行的检验。

非参数检验则不考虑总体分布是否已知,常常也不是针对总体参数,而是针对总体的某些常见假设,例如是否满足正态分布等。

适用情况:顺序类型的数据资料,这类数据的分布形态一般是未知的。

主要方法:卡方检验、秩和检验、二项检验、游程检验、K-量检验等。

(3)列联表分析

用于分析离散变量或定型变量之间是否存在相关。

对于二维表,可进行卡方检验;对于三维表,可作Mentel-Hanszel分层分析。

列联表分析还包括配对计数资料的卡方检验、行列均为顺序变量的相关检验。

(4)相关性分析

研究现象之间是否存在某种依存关系,对具体有依存关系的现象探讨相关方向及相关程度。一般分为单相关、复相关和偏相关等。

单相关:两个因素之间的相关关系称为单相关,即研究时只涉及一个自变量和一个因变量。

复相关:三个或三个以上因素的相关关系称为复相关,即研究时涉及两个或两个以上的自变量和因变量相关。

偏相关:在某一现象与多种现象相关的场合,当假定其他变量不变时,其中两个变量之间的相关关系称为偏相关。

(5)方差分析

使用条件:各样本必须是相互独立的随机样本;各样本来自正态分布总体;各总体方差相等。

单因素方差分析:一项试验只有一个影响因素,或者存在多个影响因素时,只分析一个因素与响应变量的关系。

(6)回归分析(https://www.daowen.com)

回归分析是一种用于分析变量之间内在拟合关系的分析方法,根据回归分析的变量个数和形态不同,分为了线性回归、非线性回归和逻辑回归等。

一元线性回归分析:只有一个自变量X与因变量Y有关,X与Y都必须是连续型变量,因变量y或其残差必须服从正态分布。

多元线性回归分析:分析多个自变量与因变量Y的关系,X与Y都必须是连续型变量,因变量y或其残差必须服从正态分布。

Logistic回归分析:线性回归模型要求因变量是连续的正态分布变量,且自变量和因变量呈线性关系,而Logistic回归模型对因变量的分布没有要求,一般用于因变量是离散时的情况。

Logistic回归模型有条件与非条件之分,条件Logistic回归模型和非条件Logistic回归模型的区别在于参数的估计是否用到了条件概率。

其他回归方法:非线性回归、有序回归、Probit回归、加权回归等。

(7)聚类分析

样本个体或指标变量按其具有的特性进行分类,寻找合理的度量事物相似性的统计量。常见的K-Means方法就属于聚类分析的范畴。

(8)判别分析

判别分析主要根据已掌握的分类明确的样品集合建立判别函数,使产生错判的事例最少,进而对给定的一个新样品,判断它来自哪个总体。

(9)主成分分析

探究数据特征中的关系,将存在相关关系的一组特征变化转化为相互独立的一组新的特征变量,并用其中较少的几个新特征变量就能综合反映原多个特征中所包含的主要信息。

(10)时间序列分析

针对基于时间而动态变化的数据的统计方法,研究随机数据序列遵从的统计规律,用以解决实际问题,如时序预测问题。典型的时间序列通常由4种要素组成:趋势、规律变动、循环波动和不规则波动等。

常见的时间序列分析方法包括:指数平滑法、ARIMA模型等。

(11)生存分析

用来研究生存时间的分布规律以及生存时间和相关因素之间关系的一种统计分析方法。

(12)典型相关分析

相关分析一般分析两个变量之间的关系,而典型相关分析是分析两组变量(如3个学术能力指标与5个在校成绩表现指标)之间相关性的一种统计分析方法。典型相关分析的基本思想和主成分分析的基本思想相似,它将一组变量与另一组变量之间单变量的多重线性相关性研究转化为对少数几对综合变量之间的简单线性相关性的研究,并且这少数几对变量所包含的线性相关性的信息几乎覆盖了原变量组所包含的全部相应信息。

(13)其他分析方法

多重响应分析、距离分析、项目分析、对应分析、决策树分析、神经网络、系统方程、蒙特卡洛模拟等。

图示

数据挖掘简介

↑上一章 ↓下一章
关注公众号获取验证码
复制内容需要验证码(7.99元/天)