7.1.4 文本关系的可视化
基于文本关系的可视化研究文本内外关系,帮助人们理解文本内容和发现规律;常用的可视化形式有树状图和节点连接的网络图。
(1)基于文本内在关系的可视化

文本字图、标签云的可视化
基于文本内在关系的可视化主要关注文本的内部结构和语义关系等。Contexter利用网络图呈现了新闻中的命名实体在同一文本中的同现关系;Word Tree结合后缀树的思想,以图7.4所示树状结构呈现了查询词的上下文关系。Netspeak以类似的形式展现了文本集中常见的上下文结构,帮助用户在写作时选择合适的词语。

图7.4 Word Tree
如图7.5所示,短语网络(Phrase Net)从语义层面分析并呈现命名实体在文本内的多种关系,如从属关系、并列关系等。图7.6所示文件散(DocuBurst)以类似的形式让词语通过Wordnet中的上下位关系以放射状径向排列,其中字体大小表示词语在文档中的频度。

图7.5 Phrase Net(https://www.daowen.com)
(2)基于文本外在关系的可视化
外在关系可视化的内容包括文本间的引用关系、网页的超链接关系等直接关系,以及主题相似性等潜在关系。许多对于文本间直接关系的可视化研究都以网络图作为呈现形式。例如,在对文本集的引用关系的可视化中,利用网络节点代表文本,用有向的线段表示引用关系。

图7.6 DocuBurst
大规模文本集合的主题关系是外在关系更为常见的可视化场景,一般主要基于聚类算法呈现主题分布,并展示与特定主题相关的关键词,多应用于信息检索、主题检测、话题演变等方面。在前面提到的标签云的生成过程中,文字几乎都是随机排列的,不能保证语义或上下文相关的文字能够按照某种规律排列。Hassan-Montero在最传统的按行排列的标签云的基础上,以Jaccard系数衡量标签的同现关系来作为聚类依据,同一行文字表示同一类别,相邻行的类别表示意义相近。文本主题关系分析除以上基于统计的方法外,更为常见的是特征降维技术。该技术首先用高维的VSM表示复杂的文本,然后通过投影的方式对文本特征向量进行降维处理,使信息能够在2D或3D的空间里进行可视化呈现。常用降维方法包括基于奇异值分解的潜在语义索引、主成分分析、对应分析、多维尺度分析以及基于人工神经网络的自组织映射图网络。
在基于特征降维技术的可视化中,图7.7所示文本地图是广泛应用的形式。ProjCloud进行特征降维时,利用K-Means算法对文本进行聚类,并结合标签云呈现了文本集合的相似关系和相似文本集合的关键词。然而,由于降维过程存在信息丢失,导致基于特征降维的可视化也存在一些问题,例如缺乏可扩展性、图形通常过于复杂、文字标签缺乏可读性等。
因此,研究者进而考虑分层次进行文本信息可视化的方案。Tree Map巧妙地使用嵌套的长方形来表示不同层次,以长方形的方向表示不同层次的变换,并以长方形的大小来表示节点的重要性。

图7.7 Galaxy形式的聚类(模拟星系的位置布局)