检索语言的分类
信息检索语言按照不同的需要和规范,可以分为不同的类型。
(一)按照检索语言规范化程度划分
1.规范语言
规范语言(controlled language)又叫受控语言或人工语言(artificial language),是人为地对标引词或检索词进行控制和规范的语言,简单地说是一种由主题词表或者分类词表控制的语言,主题语言中的叙词、分类语言中的分类类目和标题词等都属于规范语言的范畴。这些语言经过规范化处理,每个词只能对应一个概念,使用规范语言检索不需要考虑概念的所有同义词或近义词,也可减少输入检索词的次数,降低出错的可能性,能有效地避免漏检、误检,但对文献加工人员和检索用户在选词上要求比较严格。
2.非规范语言
非规范语言(uncontrolled language)又叫自然语言(natural language),是直接从原始信息中抽取出来的,未经人工控制的自由词(符号或语词等),比如主题语言中的关键词和单元词等。除了一般事物名称、科学术语外,还包括一些俗名、商品型号和缩写等。非规范语言不需要编制词表,检索用户可以自拟词语进行检索,选词方便、灵活性大、专指性强,能表达新事物的准确概念和规范词难以解释的特定概念。但非规范语言缺乏对词汇的控制能力,也很难揭示概念之间的关系,存在含义模糊的现象。
(二)按照标识的组配方式划分
1.先组式语言
先组式语言是指用来描述信息主题概念的标识在检索之前就已经组配好,如体系分类语言、标题语言等,这种语言系统性较好、标识明确,适用于传统的目录索引,是信息检索人员比较习惯的形式。
2.后组式语言
后组式语言是指用来描述信息主题概念的标识在检索之前未事先组配,而是到检索时才依据检索的实际需要,按照一定规则进行组配的标识系统。如叙词语言、单元词语言均属此类。这种语言采用概念划分与综合的原理,可实行多因素、多途径检索乃至精确检索,适用于标识单元方式的检索设备。优点是使用灵活、检索效率高;缺点是标识明确性较差,不方便使用。
(三)按照所描述的文献信息特征划分
按描述文献特征的不同,检索语言可分为描述文献外部特征的检索语言和描述文献内容特征的检索语言,结构示意图如图3-1所示。描述文献外部特征的检索语言包括题名(书名、篇名)、著者姓名、号码(专利号、报告号、标准号等)和引文语言(被引用著者姓名和被引用文献的出处)等;描述文献内容特征的检索语言包括分类语言、主题词语言和代码语言。
(https://www.daowen.com)
图3-1 检索途径、检索语言的类型
1.描述文献外部特征的检索语言
描述文献外部特征的检索语言是依据文献外部特征如文献上记载的篇名、著者、刊名等作为文献存储和检索的标识而设计的检索语言。可以依据署名的著者、编者、译者等姓名或团体机构名称作为检索标识建立著者索引系统;也可以依据文献特有的序号作为检索标识建立文献序号索引系统,如科技报告号索引和专利号索引等;还可以依据文献的参考文献的外部特征建立引文索引系统等,方便检索用户从文献的外部特征入手查找相关信息。
2.描述文献内容特征的检索语言
描述文献内容特征的检索语言是依据文献内容中所论述的主题、方法、观点和结论等作为文献存储和检索的标识而设计的检索语言,主要有以下3种。
(1)分类语言。分类语言也称分类法语言。它是用分类号作为标识符号系统来表达文献的各种属性的概念,并将其按照学科体系进行划分或排列而形成的检索语言。分类语言又分为体系分类语言和组配分类语言两种。分类语言组成的索引并不多见,它主要用于检索工具文摘题录的组织编排,但在专利文献检索中,分类索引则是检索方法中最主要的索引。
①体系分类语言是用等级列举的方法,层层纵横次第展开文献类目的一种人工检索语言,它是一种传统的分类语言。体系分类语言的依据是各种体系分类法或分类表。体系分类法是一种直接体现知识分类的等级概念的标识系统,它以科学分类为基础,以文献内容的学科性质为对象,运用概念划分与综合的方法,按照知识门类的逻辑次序,从总体到部分、从一般到具体、从简单到复杂,进行层层划分。每划分一次,产生许多类目;逐级划分,就产生许多不同级别的类目。所有不同级别的类目层层隶属,形成一个严格有序的知识分类体系:每个类目都用分类号做分类标识,每个分类号是表达特定知识概念的词汇,从而展开为层累制的编号体系。《杜威十进分类法》是体系分类法的典型代表,我国广泛使用的《中国图书馆分类法》也是依据体系分类语言编制的。
②组配分类语言。组配分类语言是在体系分类语言的基础上发展而来的,也叫组面分类语言。它是将若干概念单元组配起来,表达一个复杂概念的分类语言,所以它打破了体系分类语言等级列举式的局限性,概念分析深入,类目包罗能力较强,组配灵活,适用于多维检索。组配分类语言源于组配式文献分类法。它的基本方法是按照科学范畴划分若干组面,每个组面内列出相关技术术语,即类目,每个类目表达一个简单的主题概念,用分类符号作为组面和类目的标记。检索文献时,按照文献的主题内容选择相应的组面和术语(类目),然后将这些术语的符号按照一定的次序排列起来,构成检索文献的分类号。
(2)主题语言。主题语言是用语词来表达各种概念,这种语言不用考虑各概念之间的相互关系,而是将各概念完全按字顺排列。主题语言具有直接性和专指性的特点,根据不同形式又可分为标题词语言、单元词语言、关键词语言和叙词语言,其中关键词语言和叙词语言应用得较多。
①标题词语言是使用最早的检索语言。“标题”是主题标目的简称,它是直接表达文献主题的标识。其使用的词汇不是篇名或书名,而是来自文献内容特征。标题法的检索标识在编表时就固定组配好,是先组式的语言,故灵活性较差。
②单元词语言。单元词是最小的语词单位,概念上不能再分,单元词语言是一种非规范语言。它的检索标识一般是在检索时才组配起来,即所谓后组式的,例如“肝肿瘤”不是单元词,而分成的“肝”和“肿瘤”才是单元词。单元词的组配可以表达复杂的主题概念,使用灵活。
③关键词语言是指直接以关键词作为主题标识组织检索系统。所谓关键词是指从文献题名、文摘或正文中直接提取出来的并具有实质意义的、能表达文献主题内容的词语。关键词法将描述主题内容的词语抽出,不进行规范化处理,按字顺排列提供检索。常规的做法是编制一个“非关键词表”,分别列出介词、冠词、代词、连词等无实际意义的词。在标引或检索时,只要避开这些无检索意义的词,其余的词都可以作为关键词的备选词。关键词语言易于掌握、灵活性强、检索方便,广泛应用于计算机检索并且可以用于查找最新出现的专业名词术语。但关键词语言未经规范化处理,有时会出现同一主题内容被不同的关键词所描述,导致该主题的相关文献被分散,在检索时无法匹配到所有符合条件的文章,造成漏检,影响查全率。
④叙词语言又称主题词语言。叙词语言是从文献的内容特征入手,经过严格规范化处理的能反映事物的主题概念的专业术语或词组。该检索语言在检索工具或检索系统中常以“主题词索引”作为索引标识。叙词语言的主要特点如下:第一,采用参照系统揭示某些主题词之间的相互关系或主题词与非主题词之间的等同关系,以便正确选择检索词;第二,它将描述同一主题概念的同义词、近义词等适当规范化,以保证词语与概念的一一对应,避免重复检索;第三,同一篇文献的每个主题词都可以进行检索,为检索用户提供多个检索入口,便于查找;第四,主题词分类索引能体现各主题词之间的隶属关系,用户可通过查看索引表查找更专指的主题词。两个或两个以上的主题词组配在一起,可以形成一个新概念,从而提高了文献标引和检索的专指性和灵活性。但是主题词语言的使用难度较大,需要检索用户对主题词有一定了解才能检索出令人满意的结果。常用的《医学主题词表》就是依据叙词语言编制而来。
(3)代码语言。代码语言一般只就事物某一方面的特征,用某种代码系统来加以标引和排列。例如,化合物的分子式索引系统、环状化合物的环系索引系统,有机化合物的威斯韦塞尔线性标注法代码系统等。美国《化学文摘》的化合物分子式索引即是此类检索语言。