5.1.4 机器学习的类型

更新于 2026年10月10日 版权声明
5.1.4 机器学习的类型

机器学习基于数据,并以此获取新知识、新技能。从解决问题的方向来讲,机器学习可以分为监督学习和无监督学习两大类型,如图5⁃6所示。

图示

图5⁃6 机器学习分类

1)监督学习

监督学习是利用一组已知类别的样本调整分类器的参数,使其达到所要求性能的过程,也称为监督训练或有教师学习。监督学习是从标记的训练数据来推断一个功能的机器学习任务。它是从给定的训练数据集中学习出一个函数(模型参数),当新的数据到来时,可以根据这个函数预测结果。

监督学习的训练集要求包括输入输出,也可以说是特征和目标。训练集中的目标是由人标注的。从图5⁃6可见,机器学习的任务有很多,分类是其基本任务之一。分类就是将新数据划分到合适的类别中,一般用于类别型的目标特征,如果目标特征为连续型,则往往采用回归方法。回归是对新目标特征进行预测,是机器学习中使用非常广泛的方法之一。

分类和回归,都是先根据标签值或目标值建立模型或规则,然后利用这些带有目标值的数据形成的模型或规则,对新数据进行识别或预测,这两种方法都属于监督学习。

2)无监督学习

与监督学习相对的是无监督学习(也叫非监督学习),无监督学习不指定目标值或预先无法知道目标值,它是将相似或相近的数据划分到相同的组里,聚类就是解决这一类问题的方法之一。

对于无监督学习,输入的数据没有被标记,也没有确定的结果。样本数据类别未知,需要根据样本间的相似性对样本集进行分类(聚类),试图使类内差距最小化,类间差距最大化。

无监督学习的目标不是告诉计算机怎么做,而是让它(计算机)自己去学习该怎样做。无监督学习的方法分为两大类:

①基于概率密度函数估计的直接方法,其原理是设法找到各类别在特征空间的分布参数,再进行分类。

②基于样本间相似性度量的简洁聚类方法,其原理是设法定出不同类别的核心或初始内核,然后依据样本与核心之间的相似性度量将样本聚集成不同的类别。

除了监督学习、无监督学习这两类最常见的学习方法,还有半监督学习、强化学习等方法,这里就不展开了。(https://www.daowen.com)

当接到一个数据分析、挖掘的任务或需求时,如果希望用机器学习来处理,首要的任务是根据任务或需求选择合适算法,选择哪种算法较合适?图5⁃7展示了机器学习算法分析的一般步骤。

图示

图5⁃7 机器学习算法选择步骤

充分了解数据及其特性,有助于人们更有效地选择机器学习算法。采用以上步骤在一定程度上可以缩小算法的选择范围,使人们少走些弯路,但在具体选择哪种算法方面,一般并不存在最好的算法或者可以给出最好结果的算法,在实际做项目的过程中,这个过程往往需要多次尝试,有时还要尝试不同算法。不过先用一种简单熟悉的方法,然后,在这个基础上不断优化,时常能收获意想不到的效果。

Spark是一个大数据计算平台,与Hadoop兼容,它立足于内存计算,天然地适应于迭代式计算。在机器学习方面,Spark具体有以下优势。

(1)完整的大数据生态系统

不仅有大家熟悉的SQL式操作组件Spark SQL,还有功能强大、性能优良的机器学习库Spark MLlib、图像计算的Spark GraphX及用于流式处理的Spark Streaming等。

(2)高性能的大数据计算平台

因为数据被加载到集群主机的分布式内存中。数据可以被快速地转换迭代,并缓存后续的频繁访问需求。基于内存运算,Spark可以比Hadoop快100倍,即使在磁盘中运算,Spark也比Hadoop快10倍左右。

(3)与Hadoop、Hive、HBase等无缝连接

Spark可以直接访问Hadoop、Hive、HBase等的数据,同时也可使用Hadoop的资源管理器。

(4)易用、通用、好用

Spark编程非常高效、简洁,支持多种语言的API,如Scala、Java、Python、R、SQL等,同时提供类似于Shell的交互式开发环境REPL。

↑上一章 ↓下一章
关注公众号获取验证码
复制内容需要验证码(7.99元/天)