1.1.1 分布式存储

更新于 2026年10月10日 版权声明
1.1.1 分布式存储

分布式存储是一个大的概念,其包含的种类繁多,除了传统意义上的分布式文件系统(Hadoop Distributed File System,HDFS)、分布式块存储和分布式对象存储外,还包括分布式数据库和分布式缓存等。这里仅对分布式文件系统等传统意义上的存储架构进行介绍,对数据库等内容不做介绍。

分布式存储是相对于集中式存储来说的,分布式存储最早由谷歌提出,其目的是通过廉价的服务器来解决使用大规模、高并发场景下的Web访问问题。图1⁃1是谷歌(Google)分布式文件系统的架构模型。在该系统的整个架构中服务器被分为两种类型,一种名为NameNode,这种类型的节点负责管理数据(元数据)的管理;另外一种名为DataNode,这种类型的服务器负责实际数据的管理。

在图1⁃1所示的分布式存储中,如果客户端需要从某个文件读取数据,首先从NameNode获取该文件的位置(具体在哪个DataNode),然后从该位置获取具体的数据。在该架构中NameNode通常是主备部署,而DataNode则是由大量节点构成的集群。由于元数据的访问频度和访问量相对数据都要小很多,因此NameNode通常不会成为性能瓶颈,而DataNode集群可以分散客户端的请求。因此,通过这种分布式存储架构可以通过横向扩展DataNode的数量来增加承载能力,也就实现了动态横向扩展的能力。

图示(https://www.daowen.com)

图1⁃1 HDFS架构模型

HDFS,作为Google File System(GFS)的实现,是Hadoop项目的核心子项目,是分布式计算中数据存储管理的基础,是基于流数据模式访问和处理超大文件的需求而开发的,可以运行于廉价的商用服务器上。它所具有的高容错、高可靠性、高可扩展性、高获得性、高吞吐率等特征为海量数据提供了不怕故障的存储,为超大数据集(Large Data Set)的应用处理带来了很多便利。

↑上一章 ↓下一章
关注公众号获取验证码
复制内容需要验证码(7.99元/天)