3.1.3 自然语言处理研究的内容及现状
随着互联网的广泛普及,语言信息处理的社会需求越来越大,人们迫切需要用自动化的手段处理海量的语言信息。网络上的不同自然语言之间的计算机自动处理变得越来越迫切,网络上的机器翻译、信息获取和信息搜索正在迅猛地发展,自然语言处理的各种应用技术事实上已经成为了互联网技术的重要支柱。
下面从概述的角度,给出自然语言处理研究的内容分类。
1.从大方向上对自然语言处理研究内容的划分
自然语言处理涉及的部门很多,从大的方向可以分为如图3-4所示的四个方向。

图3-4 自然语言处理研究内容划分(大方向)
(1)语言学方向
把自然语言处理作为语言学的分支来研究,它只研究语言及语言处理与计算相关的方面,而不管其在计算机上的具体实现。这个方向最重要的研究领域是语法形式化理论和数学理论。
(2)数据处理方向
把自然语言处理作为开发语言研究相关程序以及语言数据处理的学科来研究。这一方向早期的研究有术语数据库的建设、各种机器可读的电子词典的开发,近年来又有大规模语料库的涌现。
(3)人工智能和认知科学方向
把自然语言处理作为在计算机上实现自然语言能力的学科来研究,探索自然语言理解的智能机制和认知机制,这一方向的研究与人工智能以及认知科学关系密切。
(4)语言工程方向
把自然语言处理作为面向实践的、工程化的语言软件开发来研究。这一方向的研究一般称为人类语言技术(Human Language Technique,简称HLT),或者称为“语言工程”(Language Engineering)[3]。
2.按照应用目标对自然语言处理研究内容的划分
按照应用目标则可把自然语言处理研究内容大致细化为十二个具体研究领域,如图3-5所示。

图3-5 自然语言处理研究内容划分(应用角度)
(1)机器翻译(Machine Translation,MT)
实现一种语言到另一种语言的自动翻译。机器翻译研究在过去的五十多年中发展经历曲折,既有希望也有失望,但机器翻译作为一个科学问题在被学术界不断深入研究的同时,企业家们已经从市场上获得了相应的利润。有专家认为,在机器翻译研究中实现人机共生(man-machine symbiosis),人机互助比追求完全自动的高质量的翻译(Full Automatic High Quality Translation,FAHQT)更现实、更切合实际;我们需要的是计算机帮助人类完成某些翻译工作,而不是完全替代人,人与机器翻译系统之间应该是互补的关系,而不是相互竞争。机器翻译主要应用在文献翻译、网页翻译和辅助浏览等方面。
(2)信息检索(Information Retrieval)
信息检索也称情报检索,就是利用计算机系统从大量文档中找到符合用户需要的相关信息。面向多语言的信息检索叫做跨语言信息检索(Cross-language/Trans-lingual information retrieval)。如:百度ht-tp://www.baidu.com
(3)自动文摘(Automatic Summarization/Automatic Abstracting)(https://www.daowen.com)
将原文档的主要内容或某方面的信息自动提取出来,并形成原文档的摘要或缩写。主要应用在电子图书管理、情报获取等。
(4)文档分类(Document Categorization)
文档分类也叫文本自动分类(Text Categorization/Classification)或信息分类(Information Categorization/Classification),其目的就是利用计算机系统对大量的文档按照一定的分类标准(如根据主题或内容划分等)实现自动归类。主要应用在图书管理、内容管理、信息监控等。
(5)问答系统(Question-Answering System)
通过计算机系统对人提出的问题的理解,利用自动推理等手段,在有关知识资源中自动求解答案并做出相应的回答。问答技术有时与语音技术和多模态输入/输出技术以及人机交互技术等相结合,构成人机对话系统(man-computer dialogue system)。主要应用在人机对话系统、信息检索等。
(6)信息过滤(Information Filtering)
通过计算机系统自动识别和过滤那些满足特定条件的文档信息。主要应用在网络有害信息过滤、信息安全等。
(7)语言教学(Language Teaching)
借助计算机辅助教学工具,进行语言教学、操练和辅导等。主要应用在语言学习等方面。
(8)文字识别(Character Recognition)
通过计算机系统对印刷体或手写体等文字进行自动识别,将其转换成计算机可以处理的电子文本。主要应用在文字输入、识别等。
(9)文字编辑和自动校对(Automatic Proofreading)
对文字拼写、用词、甚至语法、文档格式等进行自动检查、校对和编排。主要应用在排版、印刷和书籍编撰等。
(10)语音识别(Speech Recognition)
将输入计算机的语音信号识别转换成书面语表示。语音识别也称自动语音识别(Automatic Speech Recognition,ASR)。由于大量存在的同音词、近音词、集外词、口音等等,致使该领域的研究存在困难。例如,输入美欧贸易摩擦升级;识别结果为美欧贸易摩擦生机。主要应用在文字录入、人机通信、语音翻译等等。
(11)文语转换(text-to-speech)
将书面文本自动转换成对应的语音表征。应用在朗读系统、人机语音接口等。
(12)说话人识别/认同/验证(Speaker Recognition/Identification/Verification)
对一言语样品做声学分析,依此推断(确定或验证)说话人的身份。主要应用在信息安全、防伪等等。
3.自然语言处理研究现状
尽管现在自然语言处理已经在人们的生活和工作中发挥着巨大的作用,但因自然语言是极其复杂的符号系统,其结构复杂多样,并且在自然语言中充满了歧义,所以迄今为止,还没有一种简单而通用的途径可以清楚地描述一种语言的构成规律、意义的表达规律和语言使用的规律。同时,自然语言又是发展的。随着社会的发展,在人们互相交流、互相影响中发生着变化,这种变化表现在语言的词汇、结构、意义等各个方面。自然语言的这些特点导致利用计算机处理自然语言时不可避免地会遇到巨大的困难。
到目前为止,自然语言处理仍然缺乏理论基础。在词汇句法方面的问题尚未解决,但已开始挑战语义知识等深层课题。语音识别中采用的统计语言模型推动了自然语言处理的发展,目前的统计模型在向语言深层发展。从应用角度,无论哪个领域的问题都没有完全解决,许多技术离真正实用的目标还有相当的距离,但有一部分问题已经解决,能为人类提供辅助性帮助,如专业领域文档翻译、电子词典、搜索引擎、文字录入等。在关键性基础问题研究方面的进展还甚微,如汉语分词、句法分析、语义表示和语义计算等。