4.6 本章小结
本章首先对比了大数据离线批量计算和流式计算各自特点及应用场景;然后,简单概述了大数据流式计算技术,分析了Spark生态系统;较全面地介绍了目前应用最为广泛的两种大数据流式计算框架:Storm和Spark Streaming。
对于Storm流式计算,本章分析了其框架和工作机制,讲解了Storm计算模型和Topology提交流程,并以一个简单的数字求和案例介绍了Storm编程。对于Spark Streaming流式计算,本章首先分析了其工作原理,其次介绍了Spark Streaming数据流处理流程,再次讲解了Spark Streaming编程思想和对DStream的操作方法,最后以WordCount为例介绍了Spark Streaming的使用方式。(https://www.daowen.com)
本章还介绍了大数据内存计算框架,讲解了内存计算中的分布式缓存体系及内存数据库,并对Spark SQL的cache使用方法进行了介绍,最后还介绍了在Storm下单词计数案例的实现。