6.2 网络数据可视化
网络是由顶点构成的集合,这些顶点之间的连接称为边。在日常生活中存在很多的网络,如互联网、万维网、社交网络、不同世界组织之间的网络、公司的业务关系网以及人与人之间的关系网等。人类生活在一个充满各种网络结构的世界中,每个人作为单个的实体在网络中扮演不同的角色,发挥类似顶点的作用。大自然中也存在许许多多的网络,如新陈代谢网络、动物界的食物链网、蛋白质网络、神经网络等。以上这些网络由于其具有庞大数量的顶点和错综复杂的关系,研究人员将它们统一称为“复杂网络”。
对于复杂网络,由于其庞大的顶点数目和顶点之间复杂的连接关系,导致网络内部许多有价值的信息不能被研究人员及时发现。网络可视化技术作为信息可视化领域的一个分支,在帮助人们理解网络的过程中发挥着重要的作用,利用可视化技术将网络数据以图形、图像的形式展现出来,能够帮助人们高效方便地浏览网络的内部结构,挖掘网络背后有价值的信息。例如,从一个良好的网络可视化图形展示中,人们可以方便地观察到该网络整体和局部的结构、网络中顶点之间连边的紧密程度以及顶点形成的社团结构等,而上述信息都无法直接从枯燥的数据条目中获得。从20世纪90年代中期开始,网络可视化技术在Graph Drawing、Info Vis(IEEE Symposium on Information Visualization)、IV(International Conference on Information Visualization)等重要国际会议以及IEEE Transactions on Visualization and Computer Graphics等国际期刊中成为一个颇受关注的议题。越来越多的学者投身于网络可视化技术的研究当中,到目前为止取得了一定的进展并已将部分研究成果应用于网络数据分析领域。
随着互联网地迅速发展以及计算机存储能力、计算能力的日益增强,人们需要处理的网络数据信息量呈爆炸式增长。例如,截止到2016年第三季度,新浪微博月活跃用户为2.97亿,同比增长34%。但是对于微博这样巨大规模的网络直接进行可视化意义不大,因为很难从可视化效果中获得有价值的信息。因此对网络进行预处理,将网络的规模进行缩减处理然后再可视化是非常有必要的。(https://www.daowen.com)
然而,当网络规模过于庞大后,使用单机对网络数据进行预处理将变得十分困难,甚至当网络的规模达到一定程度时,传统的单机处理手段将失效。进入大数据时代后,大数据平台的出现使研究人员看到了处理这种大规模数据的希望。将传统的数据处理方法迁移至大数据平台,该过程需要研究人员对相关方法的原理作针对性地改进以适应于分布式环境下的生产工作。因此,将之前单机无法分析处理的网络数据在多机的分布式环境下运行,利用大数据平台的优势提高网络可视化的效率,这是研究人员目前所面临的一个挑战。
图的可视化是一个历史悠久的研究方向,它包括三个方面:网络布局、网络属性可视化和用户交互。其中网络布局确定图的结构关系,是最为核心的要素。本节主要关注网络数据的布局,最常用的布局方法有节点链接法和相邻矩阵布局法。两者之间没有绝对的优劣,在实际应用中针对不同的数据特征以及可视化需求选择不同的可视化表达方式,或采用混合表达方式。