11.1.4 语义分析概括
语义分析(Semantic Analysis)指运用各种机器学习方法,学习与理解一段文本所表示的语义内容。语义分析是一个非常广的概念,任何对语言的理解都可以归为语义分析的范畴。一段文本通常由词、句子和段落来构成,根据理解对象的语言单位不同,语义分析又可进一步分解为词汇级语义分析、句子级语义分析以及篇章级语义分析。一般来说,词汇级语义分析关注的是如何获取或区别单词的语义,句子级语义分析则试图分析整个句子所表达的语义,而篇章语义分析旨在研究自然语言文本的内在结构并理解文本单元(可以是句子从句或段落)间的语义关系。
简单地讲,语义分析的目标就是通过建立有效的模型和系统,实现在各个语言单位(包括词汇、句子和篇章等)的自动语义分析,从而实现理解整个文本表达的真实语义。
在应用上,语义分析一直是自然语言处理的核心问题,它有助于促进其他自然语言处理任务的快速发展。读者可以通过以下案例看出语义分析在实际应用中的重要性。
案例&知识:
比如:语义分析在机器翻译任务中有着重大的应用。在过去20 多年的发展历史中,统计机器翻译主要经历了基于词、基于短语和基于句法树的翻译模型。目前已有相关研究将词汇级语义应用于统计机器翻译,并取得一定的性能提高,基于句子级、甚至篇章级语义的统计翻译一直是未来的研究方向。
再比如,基于语义的搜索一直是搜索追求的目标。所谓语义搜索,是指搜索引擎的工作不再拘泥于用户所输入请求语句的字面本身,而是透过现象看本质,准确地捕捉到用户所输入语句后面的真正意图,并以此来进行搜索,从而更准确地向用户返回最符合其需求的搜索结果。
这种基于语义的搜索无疑为搜索引擎提供了一个很好的发展方向,以后读者可以基于语义进行搜索,毫无疑问能够提高搜索覆盖率。(https://www.daowen.com)
语义分析同时还是实现大数据的理解与价值发现的有效手段。伴随着互联网技术的迅猛发展和普及以及用户规模的爆发式增长,互联网已经步入了“大数据”时代,大数据已成为我们面临的常态问题,语义分析与大数据在某种程度上其实是互为基础的。一方面,如果想得到更准确的语义分析结果,需要大数据的支持,即从大数据中挖掘并形成更大、更齐全、更准确的知识库,而知识库对语义分析的性能有着重要的影响。另一方面,如果想从大数据库中挖掘出更多、更有用的信息,人们需要用到语义分析等自然语言处理技术。总的来说,大数据为语义分析的发展提供了契机,但离开语义分析,基于大数据的信息获取、挖掘、分析和决策等其他应用,也将变得寸步难行。
语义分析分为词汇级、句子级、篇章级语义分析3种类型。那么每一种类型需要完成的任务是什么呢?接下来,将简单的介绍每种类型主要需要实现的内容。
词汇级的语义分析主要体现在如何理解某个词汇的含义,主要包含两个方面:第一,在自然语言中,一个词具有两种或更多含义的现象非常普遍。如何自动获悉某个词存在着多种含义,以及假设已知某个词具有多种含义,如何根据上下文确认其含义,这些都是词汇级语义研究的内容。在自然语言处理领域,这又称为词义消歧。第二,如何表示并学习一个词的语义,以便于计算机能够有效地计算两个词之间的相似度。
句子级的语义分析试图根据句子的句法结构和句中词的词义等信息,推导出能够反映这个句子意义的某种形式化表示。根据句子级语义分析的深浅,又可以进一步划分为浅层语义分析和深层语义分析。
篇章级语义分析是指由一系列连续的子句、句子或语段构成的语言整体单位,在一个篇章中,子句、句子或语段间具有一定的层次结构和语义关系,篇章结构分析旨在分析出其中的层次结构和语义关系。具体来说,给定一段文本,其任务是自动识别出该文本中的所有篇章结构,其中每个篇章结构由连接词,两个相应的论元,以及篇章关系类别构成。篇章结构可进一步分为显式和隐式,显式篇章关系指连接词存在于文本中,而隐式篇章关系指连接词不存在于文本中,但可以根据上下文语境推导出合适的连接词。对于显式篇章关系类别,连接词为判断篇章关系类别提供了重要依据,关系识别准确率较高;但对于隐式篇章关系,由于连接词未知,关系类别判定较为困难,这也是篇章分析中的一个重要研究内容和难点。
讲解了那么多语义分析相关的基础知识后,相信读者一定会有这样的疑惑:这些内容对于需求工程的语义分析有什么具体的联系吗?它们之间是怎么协同工作的呢?读者不必慌张,在接下来的学习中,本书带领读者学习需求工程的语义分析。