7.1.2 文本可视化工作流程
文本可视化涵盖了信息收集、数据预处理、知识表示、视觉呈现和交互等过程。其中,数据挖掘和自然语言处理等技术充分发挥计算机的自动处理能力,将无结构的文本信息自动转换为可视的有结构信息;而可视化呈现使人类视觉认知、关联、推理能力得到充分发挥。因此,文本可视化有效地综合了机器智能和人类智能,为人们更好地理解文本和发现知识提供了新的有效途径。图7.1展示了人们利用文本可视化系统对文本进行分析和理解的基本过程。总的来说,文本可视化系统主要包括3个部分:①产生可视化所需数据的文本分析过程;②可视化呈现,即包含文档、事件、关系、时间等文本信息的低维信息图(通常是2D或3D图);③用户与信息图的交互。

图7.1 文本可视化基本框架
(1)文本分析
文本可视化依赖于自然语言处理,因此词袋模型、命名实体识别、关键词抽取、主题分析、情感分析等是较常用的文本分析技术。文本分析的过程主要包括特征提取,通过分词、抽取、归一化等操作提取出文本词汇级的内容;利用特征构建向量空间模型(vector space mode,VSM)并进行降维,以便将其呈现在低维空间,或者利用主题模型处理特征;最终以灵活有效的形式表示这些处理过的数据,以便进行可视化呈现和交互。(https://www.daowen.com)
(2)可视化呈现
信息图中,文本内容的视觉编码主要涉及尺寸、颜色、形状、方位、纹理等,文本间关系的视觉编码主要涉及网络图、维恩图、树状图、坐标轴等。文本可视化的一个重要任务是选择合适的视觉编码呈现文本信息的各种特征。例如,词语的频度通常由字体的大小表示,不同的命名实体类别用颜色加以区分。如何快速创建符合人们先验认知的视觉呈现一直是可视化研究者关心的问题,对于视觉编码有效性的研究与认知科学息息相关。
(3)交互
为了使用户能够通过可视化有效地发现文本信息的特征和规律,通常会根据使用场景为系统设置一定程度的交互功能。文本可视化中,主要应用到的交互方式有高亮、缩放、动态转换、关联更新、焦点加上下文等。