7.1.3 文本内容的可视化
文本内容的可视化主要关注的是如何快速获取文本内容的重点,主要可以分为基于词频的可视化和基于词汇分布的可视化。基于文本内容的可视化可以应用于单个文本,也适用于较大的文本集。通过这些基本统计结果的可视化呈现,能使用户快速地了解文本的大体内容,这对于进一步的分析具有重要的向导意义。
当面对海量文本时,人们需要对每个文本或者整个文本集合的主要内容进行快速浏览,因此需要基于词频的文本可视化。最常用的文本可视化的思路是将文本看作一个词汇的集合(词袋模型),利用词频信息来呈现文本特征。其中,经常被采用的词频计算方法是TF-IDF,最典型的可视化形式是“标签云”。标签云将关键词按照一定顺序和规律排列,如频度递减、字母顺序等,并以文字的大小代表词语的重要性。最初的标签云大多都采用将文字一行一行地水平排列的方式,后来渐渐遵循更加美观复杂的布局规则,图7.2所示的Wordle便是其中被广泛采用的代表之一。在Wordle中,词语的布局遵循了严格的条件,使得文字间的空隙得以充分地利用,可视化结果更加美观。Wordle自出现就被广泛应用于报纸、杂志等传统媒体,以及互联网,甚至T恤等实物中。
在Wordle的基础上,图7.3所示的可视化图遵循了更为美观和复杂的布局,允许用户选择不同的文字轮廓甚至自定义轮廓,用于表示某个具体领域。例如,图7.3展示的是航空领域,因此布局上以飞机轮廓为主,而将相应的文字可视化到其中。
然而,由于标签云只是对文本中高频词汇的简单罗列,无法提供连贯的上下文信息。为此,相关研究人员还设计了Document Card用于克服这一问题。它通过自动提取重要文字和图片,将文本信息综合到一系列信息连续的卡片上,使用户能够快速地了解文本的关键信息。另外,标签云也经常作为辅助的呈现方式出现在一些可视化方案中。(https://www.daowen.com)

图7.2 Wordle

图7.3 带形状含义的Wordle可视化