1.4.2 批处理框架

更新于 2026年10月10日 版权声明
1.4.2 批处理框架

批处理在大数据世界有着悠久的历史。批处理计算主要操作大容量静态数据集,并在计算过程完成后返回结果。

批处理计算模式中使用的数据集通常符合下列三大特征。

①有界:批处理数据集代表数据的有限集合。

②持久:数据通常存储在某种类型的持久存储位置中。

③大量:批处理操作通常是处理极为海量数据集的典型方法。

下列几种情况特别适合批处理计算模式。

(1)需要访问全套记录才能完成的计算工作(https://www.daowen.com)

例如在计算总数和平均数时,必须将数据集作为一个整体加以处理,而不能将其视作多条记录的集合。这些操作要求在计算过程中数据维持自己的状态。

(2)需要处理大量数据的任务

无论是直接从持久存储设备处理数据集,还是首先将数据集载入内存,批处理系统在设计过程中就充分考虑了数据的量,可提供充足的处理资源。由于批处理在应对大量持久数据方面的表现极为出色,因此经常用于对历史数据进行计算分析。

大量数据的处理需要付出大量时间,因此批处理不适合对处理时间要求较高的场合。

Apache Hadoop是一种专用于批处理的大数据计算框架,MapReduce是Hadoop的原生批处理引擎。

↑上一章 ↓下一章
关注公众号获取验证码
复制内容需要验证码(7.99元/天)