5.2 Spark MLlib机器学习库

更新于 2026年10月10日 版权声明
5.2 Spark MLlib机器学习库

Spark之所以在机器学习方面具有得天独厚的优势,主要有以下两个原因。

速度快:机器学习算法一般有很多个步骤迭代计算的过程,机器学习的计算需要在多次迭代后获得足够小的误差或者足够收敛才会停止,迭代时如果使用Hadoop的MapReduce计算框架,每次计算都要读/写磁盘以及任务的启动等工作,这会导致非常大的I/O和CPU消耗。而Spark基于内存的计算模型天生就擅长迭代计算,多个步骤计算直接在内存中完成,只有在必要时才会操作磁盘和网络,可以说Spark是机器学习的理想的平台。(https://www.daowen.com)

通信效率高:从通信的角度讲,如果使用Hadoop的MapReduce计算框架,JobTracker和TaskTracker之间是通过心跳(Heartbeat)的方式来进行的通信和传递数据,因此执行速度会非常慢。而Spark具有出色而高效的Akka和Netty通信系统,通信效率极高。

↑上一章 ↓下一章
关注公众号获取验证码
复制内容需要验证码(7.99元/天)