1.4.2 批处理框架
批处理在大数据世界有着悠久的历史。批处理计算主要操作大容量静态数据集,并在计算过程完成后返回结果。
批处理计算模式中使用的数据集通常符合下列三大特征。
①有界:批处理数据集代表数据的有限集合。
②持久:数据通常存储在某种类型的持久存储位置中。
③大量:批处理操作通常是处理极为海量数据集的典型方法。
下列几种情况特别适合批处理计算模式。
(1)需要访问全套记录才能完成的计算工作(https://www.daowen.com)
例如在计算总数和平均数时,必须将数据集作为一个整体加以处理,而不能将其视作多条记录的集合。这些操作要求在计算过程中数据维持自己的状态。
(2)需要处理大量数据的任务
无论是直接从持久存储设备处理数据集,还是首先将数据集载入内存,批处理系统在设计过程中就充分考虑了数据的量,可提供充足的处理资源。由于批处理在应对大量持久数据方面的表现极为出色,因此经常用于对历史数据进行计算分析。
大量数据的处理需要付出大量时间,因此批处理不适合对处理时间要求较高的场合。
Apache Hadoop是一种专用于批处理的大数据计算框架,MapReduce是Hadoop的原生批处理引擎。