1.4.4 内存计算框架

更新于 2026年10月10日 版权声明
1.4.4 内存计算框架

受数据挖掘工具性能方面的限制,一般的数据挖掘是先对数据做预处理,之后才能做数据展示。如果预处理的数据是按照销售的产品种类去汇总,未来显示的信息也就只能按照这种方式展示。如要选择按照其他汇总,则要重新花时间做预处理。换言之,传统的数据挖掘先期准备时间过长,无法迅速处理当下瞬息万变的数据,难以满足决策者对信息进行“实时”分析的强需求。这就需要一种新的方法和工具,从“实时”的数据中提取有用的信息。

内存计算相比传统的计算模式的优势是:充分发挥多核的能力,对数据进行并行处理,并且内存读取的速度成倍数增加,数据按优化的列存储方式存放在内存里面。也就是说,内存计算可对大规模海量数据做实时分析和运算,不需要数据预处理和数据建模。例如,从任何维度去分析数据,实时建立模型,实时完成分析处理,上亿条数据处理完所需要的时间可能从几天缩短为几秒钟。

“如何在既有数据的基础上做未来分析预测”,这才是内存计算更大的价值体现。例如,根据现在社交网络上的数据,再加上一些假设条件,去做一个预测。内存计算能根据社交网络提供的海量数据,即时看到当前的客户行为模式,进而作出模拟预测。再比如在市场活动中,用户人群的特点,消费倾向等数据一定,如何增加满意度?满意度的增加会带来多少收益?这样的预测性问题,都是内存计算分析擅长的内容。可以说,内存计算是决策者的一个有力工具。

与Hadoop的MapReduce引擎相比,基于各种相同原则开发而来的Spark的侧重点是通过完善的内存计算和处理优化机制加快批处理工作负载的运行速度。(https://www.daowen.com)

Spark可作为独立集群部署(需要相应存储层的配合),或可与Hadoop集成并取代MapReduce引擎。

与MapReduce不同,Spark的数据处理工作全部在内存中进行,只在一开始将数据读入内存,以及在将最终结果持久存储时需要与存储层交互。所有中间态的处理结果均存储在内存中。

Spark是一个具有快速和灵活的迭代计算能力的典型系统,其采用了基于内存的RDD数据集模型实现快速的迭代计算,而且在内存满负载的时候,硬盘也能运算。运算结果表明,Spark的速度大约为Hadoop的一百倍,并且其成本可能比Hadoop更低。

↑上一章 ↓下一章
关注公众号获取验证码
复制内容需要验证码(7.99元/天)