5.2.2 Spark MLlib支持的机器学习算法

更新于 2026年10月10日 版权声明
5.2.2 Spark MLlib支持的机器学习算法

Spark MLlib基于RDD,天生就可以与Spark SQL、GraphX、Spark Streaming无缝集成,以RDD为基石,Spark的这4个子框架可联手构建大数据计算中心。

Spark MLlib是Spark对常用的机器学习算法的实现库,同时包括相关的测试和数据生成器。Spark的设计初衷就是为了支持一些迭代的Job,这正好符合很多机器学习算法的特点。MLlib目前支持4种常见的机器学习问题:分类、回归、聚类和协同过滤。MLlib支持的机器学习算法,如图5⁃9所示。下面简单介绍一下Spark MLlib对这4类算法的支撑。

图示

图5⁃9 MLlib支持的机器学习算法

1)分类算法

分类算法属于监督式学习,使用类标签已知的样本建立一个分类函数或分类模型,应用分类模型能把数据库中的类标签未知的数据进行归类。分类在数据挖掘中是一项重要的任务,目前在商业上应用最多,常见的典型应用场景有流失预测、精确营销、客户获取、个性偏好等。MLlib目前支持分类算法有:逻辑回归、支持向量机、朴素贝叶斯和决策树。

2)回归算法(https://www.daowen.com)

回归算法也属于监督式学习,每个个体都有一个与之相关联的实数标签,并且希望在给出用于表示这些实体的数值特征后,所预测出的标签值可以尽可能接近实际值。MLlib目前支持回归算法有:线性回归、岭回归、Lasso和决策树。

3)聚类算法

聚类算法属于非监督式学习,通常被用于探索性的分析,是根据“物以类聚”的原理,将本身没有类别的样本聚集成不同的组,这样的一组数据对象的集合称为簇,并且对每一个这样的簇进行描述的过程。它的目的是使得属于同一簇的样本之间应该彼此相似,而不同簇的样本应该足够不相似,常见的典型应用场景有客户细分、客户研究、市场细分、价值评估。MLlib目前支持广泛使用的KMeans聚类算法。

4)协同过滤

协同过滤常被应用于推荐系统,这些技术旨在补充用户—商品关联矩阵中所缺失的部分,其中用户和商品通过一小组隐语义因子进行表达,并且这些因子也用于预测缺失的元素。MLlib目前支持ALS协同过滤算法。

↑上一章 ↓下一章
关注公众号获取验证码
复制内容需要验证码(7.99元/天)