信息检索的发展历程
(一)手工检索阶段(1876—1954年)
信息检索起源于对传统纸质文献进行的手工检索和图书馆参考咨询。文献信息日益多样化,用户信息需求也愈发个性化,手工检索在文献编目等方面取得了丰硕成果,主要表现有以下两个方面:
一是一批高质量的文献型检索工具的出现。如1884年美国工程信息公司的《工程索引》(Engineering Index,EI)、1898年英国电气工程师学会的《科学文摘》(Science Abstracts,SA)、1907年美国化学文摘社的《化学文摘》(Chemical Abstracts,CA)、1926年美国生物科学信息服务社的《生物学文摘》(Biological Abstracts,BA)、1961年美国科学信息研究所的《科学引文索引》(Science Citation Index,SCI)等。
二是手工检索分类方法和分类语言的相继出现。在手工检索分类方法方面,如1876年美国学者杜威创造的《图书馆图书小册子排架及编目适用的分类法和主题索引》,也就是后来的《杜威十进分类法》(Dewey Decimal Classification,DDC),该分类法也是目前世界上应用最为广泛的分类法;1901年在时任美国国会图书馆馆长普特南的主持下编制而成的《美国国会图书馆分类法》(Library of Congress Classification,LLC);1907年由比利时学者奥特莱和拉封丹在《杜威十进分类法》的基础上改编而成的《国际十进分类法》(Universal Decimal Classification,UDC)。在手工检索分类语言方面,先后出现了先组式语言、后组式语言、叙词语言等。以上成果为计算机信息检索的发展奠定了坚实的理论基础。
手工检索虽然具有操作简单、费用低廉、查准率高等优点,但也存在着检索效率低、查全率低等缺点,并且随着科学技术的迅速发展,对传统的纸质文献进行手工检索的方式早已不能满足用户个性化的信息需求,该检索方式很快被计算机检索所取代。
(二)计算机检索阶段(1954年至今)
二十世纪四十年代,诞生了世界上第一台计算机,随着计算机在信息检索领域的应用,传统的手工检索阶段进入了计算机检索阶段。计算机凭借着强大的信息存储能力、快速的检索能力、稳定可靠的信息输入能力,使人们能够快速、准确地从海量信息中获取满足自身需求的特定信息。
计算机信息检索是将信息组织和存储在磁盘或光盘上成为数据库,用户利用计算机从数据库文档中找出所需的信息。广义的计算机检索包括信息存储和信息检索两个过程,狭义的计算机信息检索仅包含检索过程。不论是广义的还是狭义的,其检索原理都是:将用户检索提问标识输入计算机检索系统,后者将前者与数据库中的存储特征标识进行匹配,若用户提问标识与数据库中的存储特征匹配,即为命中信息,并由计算机检索系统通过一定形式反馈给用户。
计算机信息检索具有其独特的优势:
(1)检索速度快 传统手工检索方式在查找一个课题时往往需要花几天甚至十几天时间,而计算机检索只需几秒或几分钟即可完成。随着计算机处理技术和网络传输性能的提升,检索速度会更快,效率会更高。
(2)检索内容新 目前论文发表均提供电子文档,已被录用的论文需要首先录入数据库进行标引供用户检索,然后再以纸质版形式形成检索工具。从录入数据库进行标引到纸质版形式的检索工具,其时间较长,通常情况下是两个月到半年。
(3)检索途径多 限于篇幅,手工检索工具一般提供索引、目录、文摘、年鉴、手册等检索方式,而计算机检索系统可以对所有外部形式和内容特征进行标引,并且后者还提供布尔逻辑检索、截词检索(或通配符检索)、字段检索、词组检索、加权检索等多种技术方法。
(4)资源共知共享 借助网络,用户可以不受任何时空限制,联机查询网上信息资源,检索世界上任意主机上的免费数据库,获取OA资源,实现全球资源的共享。
(5)输出方式多样 对于检索结果,计算机可提供屏幕浏览、打印、存盘等多种输出方式,还可以对结果进行再次筛选和排序,对每一条记录也可以限定输出某些具体字段。
随着计算机技术、通信技术以及存储介质的不断进步,计算机检索同样经历了由低级阶段到高级阶段的发展历程,即脱机检索、联机实时检索、光盘检索、网络化检索四个阶段。(https://www.daowen.com)
1.脱机检索阶段(1954—1964年)
脱机检索系统是计算机检索初期使用的一种检索系统,其利用独立计算机的输入和输出装置进行检索,用磁带作存储介质。在使用该系统检索文献时,计算机只能按照一定的顺序检索磁带上记录的信息,每一次检索都必须从头到尾读取磁带上面的信息,耗费了大量时间。因此,检索工作人员不得不以批处理方式来进行查找。
首先,需要脱机检索用户先填写检索申请单,再由检索工作人员将其转换为计算机可读形式,批量输入计算机中进行查找。因此,脱机检索通常也被称为脱机批处理检索。20世纪50年代中期到60年代中期,具有代表性的脱机检索系统有:1954年美国海军建成的世界上第一个试验性计算机检索系统,1959年美国人卢恩利用IBM650电子计算机建成的世界上第一个定题检索系统,1961年美国化学文摘社第一次利用计算机来处理书目信息编制而成的《化学题录》。脱机检索的编印索引、书目、回溯检索和定题检索服务虽然在各个学科领域得到了广泛使用,但由于早期的计算机数据需要批量输入,命令需用穿孔卡片或纸带,存储介质主要是磁带,采用遍历式顺序的检索技术,缺少信息的输出终端,导致人机交互性不强、受时空限制等弊端,这些弊端极大地限制了脱机检索技术的发展。
2.联机实时检索阶段(1965—1975年)
20世纪60年代后期,随着计算机集成电路技术的发展,尤其是具有高密度存储等特点的磁盘和突破了时空限制的通信、操作系统等信息技术的相继出现,信息检索由此从脱机批处理阶段进入了联机实时检索阶段。人们可以在磁盘上建立起直接读取和存储的随机文件,并开发了一台主机通过通信线路连接到多个终端的联机检索系统。用户可借助于命令式的检索程序通过用户终端以“即问即答”的方式与计算机交互,从而实现跨时空的检索,最终满足自己的信息需求。
联机检索系统主要由用户终端、通信网络、计算机及数据库组成。用户利用计算机终端设备,通过通信线路与存储数据库的中央计算机相连,直接进行人机对话。联机检索直接面向最终用户,检索过程通过人机对话交互方式可随时修改检索策略,能及时获取检索结果。该阶段的主要成就有:1969年,NASA开发的第一个大规模联机检索系统RECON全面投入运行;1970年,美国洛克希德公司和美国系统发展公司分别开发了DIALOG系统和ORBIT系统,同年,美国国立医学图书馆将MEDLARS系统发展为医学文献分析与联机检索系统;1973年,欧洲宇航局建成的ESA-IRS(Europe Space Agency Information Retrieval System)系统等投入运行,是欧洲最大的联机情报检索系统。
联机实时检索系统虽然取得了丰硕的成果,但存在很多缺点,如指令复杂,检索工作必须依赖专业人员完成,联机检索收费高,国际通信费用昂贵等。该检索系统随着信息技术的飞速发展,尤其是集成电路技术的不断发展,逐渐发展为光盘检索系统。
3.光盘检索阶段(1976—1990年)
20世纪70年代中后期,出现了以娱乐为主的光盘(compact disc,CD),直到80世纪中期,相关研究人员才开发出第一种有关信息检索的光盘,并将其逐步应用到信息检索领域,逐渐形成了光盘检索系统。该检索系统在早期发展阶段只是单机驱动和单用户检索,为满足多用户同时检索的需求以及同一数据库同时检索多张光盘的要求,陆续出现了光盘塔、光盘库及光盘网络等技术,这些技术的发展使信息检索发生了革命性的改变。
光盘检索是以光盘作为存储介质,通过光盘驱动器来查找信息的一种检索方式,将检索软件及数据存储在光盘上,任何一台安装有光驱的计算机,都能在光盘数据库的支持下,成为光盘检索系统。该检索系统具有以下优点:存储容量大但体积微小,不需通信联系,不受时空限制,使用简单,易于操作,无须专业知识即可安装和检索,设备投资少,检索价格低廉(一次购买,无限次检索),节省大量通信费用,易存储,使用寿命长,内容丰富(可将文本、图像、音频等存储在一起)。其缺点主要有:信息获取比国际联机慢(回溯检索需多次换盘),信息更新不及时。
4.互联网检索阶段(1991年至今)
自20世纪90年代起,随着互联网技术的飞速发展,基于互联网技术的信息检索系统开始出现,特别是世界各国的计算机网络普遍采用TCP/IP通信协议,使得不同主机之间的信息交换成为可能。同时许多检索系统相继进入网络,各检索系统的主机成了网络上的节点,而每个节点又连接着许多终端,构成了一个庞大的网络化检索系统。
互联网检索是指利用公用信息网或卫星微波系统,借助相关专用设备,将终端设备与计算机网络相连,用户可不受时空限制访问远程信息资源。网络上的用户既是网络资源的索取者,同时也是网络资源的提供者,真正实现了信息资源的共享。目前,用户不仅可以利用自己的终端访问世界上任何已接入互联网的数据库,还能够检索网上数字图书馆的信息资源,信息检索的广度和深度有了极大的飞跃,互联网使计算机信息检索进入全新的发展阶段。
与手工检索相比,计算机检索的优点主要表现在:①检索速度快,仅几秒或十几秒即可以从成千上万条,甚至上亿条记录中找出所需信息;②检索范围广,可以更加全面地浏览任何学科的信息,可以同时检索到各学科的各类型信息;③检索途径多样化,除了手工检索阶段的目录、题录、文摘等途径,还可通过题名、作者、关键词、主题词、机构、基金、摘要等多种途径进行检索;④交互性好,拥有友好的交互页面,可以随时随地实现互动和反馈;⑤更新速度快,通信技术、高密度存储技术和计算机技术的高度融合,实现了实时更新。但其同样存在着较为明显的弊端:①检索准确率低,信息垃圾较多;②回溯性文献少,尤其是对于较早的文献,不能及时检索到;③用户需要掌握一定的信息检索方面的知识,计算机检索尤其是互联网检索,不仅要求用户具备一定的信息检索相关理论知识,还要求熟练掌握检索策略,这些都会增加用户的负担;④投资相对较高,需要用户拥有一定的检索设备,如网络、个人电脑或者公共电脑等,会额外增加用户的经济压力。