7.1 中文信息处理
更新于 2026年10月10日
版权声明
7.1 中文信息处理
自然语言处理在研究中尽管存在着巨大的困难,但已经取得了令人瞩目的成就,目前在人们的日常生活和工作中发挥着巨大的作用。汉语作为国际上第二大语言,在世界上具有重要的影响,但由于汉语自身特点,在自然语言处理研究中面临较英语等其他语言更大的困难,导致中文信息处理与国际水平还有很大差距,这已经成为中国信息安全中一个重要的问题,也间接影响着数字出版中提供语言服务的范围和质量。
自从人类使用计算机处理语言以来,50多年过去了,中文信息处理理论研究的脚步从来都没有停止过。我国中文信息处理领域的专家学者付出了艰苦的努力,在一系列基础研究和应用研究方面取得了标志性成果。进入20世纪80年代以后,汉语分词与词性标注方法研究得到了快速发展。在20世纪80年代中期到90年代初期,我国的机器翻译研究开始走向繁荣[1]。但是,尽管中文信息处理已经取得了不少成绩,但与国际水平相比,差距还是很大,希望在不久的将来中文信息处理能取得更大的进步。(https://www.daowen.com)
中文信息处理通常指以计算机为工具,采用可计算的方法对中文信息进行自动加工处理。从技术路线上分为基于规则的研究方法和基于统计的研究方法;按语言处理对象的不同,语言处理技术可分为字处理技术、词处理技术、语句处理技术、篇章处理技术等。由于在计算机出现后,中文信息处理首先遇到的困难是汉字处理,然后在自然语言处理研究中遇到的障碍主要是词处理技术,所以本节只对汉语的字处理和词处理及语料库情况进行简介。