2.3.1 词典编纂过程
有史以来,词典编纂一直是一个繁重的工作,其过程也很复杂。但从本质上看词典编纂过程可分为四个阶段,如图2-1所示。

图2-1 词典编纂过程
第一阶段:决定词典的目标用户与词典的使用方式。
第二阶段:收集语料。
第三阶段:分析语料。
第四阶段:根据上述三个阶段的研究结果,编写词典文本。
第一个阶段至关重要,但是相对来说比较容易做,而剩下的三个阶段一直以来都是一块非常难啃的硬骨头,使词典编纂成为一项耗资巨大的苦差事。计算机技术的发展、语言工程界的最新研究以及词典编纂者与计算语言学家的密切合作为词典语料的收集和词典编纂带来了一场革命。如今,我们可以在很短的时间内,用较少的资金建成大型的语言数据库,并可以用非常先进的方法对数据库中的数据进行有效的分析。
1.词典语料的收集(https://www.daowen.com)
在过去几百年间,这项工作意味着要通过艰苦的“阅读与标记”过程从文本中收集引例。例如,《牛津英语词典》(Oxford English Dic-tionary)的第一版和第二版(1928年版和1989年版)就是根据几百万张语料卡片上所记录的引例编纂而成的,每张卡片上都有一段简短的引文,标示语词的使用情况。这些引例是大批志愿读者从19世纪60年代开始用几十年的时间收集起来的,它们具有极大的语言学价值。然而,其中大部分工作如今都可以用计算机来完成,需要人工做的部分已经很少[9]。
到20世纪末,这种收集语料的方法已经在很大程度上被电子语料库——一种存储在计算机中的文本集所取代。但是,这是一个渐进的过程。从第一个英语语料库——20世纪60年代建立的拥有一百万词的布朗语料库到约翰·辛克莱(John Sinclair)在伯明翰建立的大型语料库之间相隔了二十年,早期语料库建设需要付出非常艰辛的努力。即使是像BNC(英国国家语料库)这样比较“成熟”的语料库,也花了三年多的时间才建成。该语料库建于上世纪90年代初,由多家词典出版社和学术机构合作建设,耗资达数百万英镑。
如今,因特网的出现以及网页文本定位、提取和处理等软件工具的开发给语料库带来了第二次革命。这些技术使我们能够用较少的投资快速地建设比“传统”方式所能收集到的任何语料集都大得多的语料库。英国的词典编纂者通常可使用收词达20亿的各种英语语料库,不仅如此,他们还拥有现成的或正在开发的汉语、日语、阿拉伯语、大部分欧洲语言语料库和其他类似的资源。拥有了庞大的语料库资源后,我们就可以轻松、准确地确定语词的使用频率或语言特征。
2.分析语料
词典编纂过程的第三个阶段,即分析语言数据的工作也经历了类似的变化。传统的做法是词典编纂者将第二阶段所收集的引例卡片进行分类、比较和反复推敲,直到从中得出语词意义和用法的明显证据。过去建成这类资源要投入数年的辛勤劳作,而如今同样的工作只需短短几秒钟就能完成。过去与现在相比真是天壤之别。在收集词条的语料时,如今的词典编纂者能够在几秒钟之内对几十亿词的语料库进行各种复杂的检索。
3.根据研究结果,编写词典文本
虽然近年来语言数据的收集和分析变容易了许多,词典编纂过程的最后一个阶段,即编写准确反映可观察的语言行为和适应目标用户需求的词典文本,仍然是一项需要大量人工编辑的艰巨任务[1]。