mobile wallpaper 1
6792 字
18 分钟
信息检索与Web数据挖掘 - 课程大纲与总结
2026-06-28

第 1 章 绪论#

本章主要介绍信息检索的基础概念,探讨信息社会环境下的信息素质要求,以及信息资源的构成与特征。

1.1 信息社会与信息环境#

要想深入理解信息检索,首先要明确信息、知识与文献这几个核心概念。

  • 信息 (Information):是物质存在的一种方式或运动状态。在控制论中,维纳认为信息是人与外部世界交换内容的名称;在信息论中,申农指出信息是“用来消除不确定性的东西”。信息具有客观性普遍性时效性传递性共享性增值性等特征。
  • 知识 (Knowledge):是信息被人脑接收并经理性加工后,形成的系统化成果。知识可分为显性知识(易于编码和传播,如专利、论文)和隐性知识(基于个人经验,难以公式化,如技术诀窍)。
  • 文献 (Document):是记录有知识的一切载体。信息、知识与文献的关系可以概括为:信息通过人脑加工变成知识,知识被记录在载体上形成文献
  • 信息源:包括个人信息源(口头交流,具及时性和主观性)、实物信息源(直观真实但零散)和文献信息源(系统稳定,是科学传播的主要手段)。

随着信息技术的发展,我们步入了信息社会。当前的信息环境呈现出诸多新特征:

  • 信息超载:信息呈爆炸式增长,人们难以消化。
  • 信息失衡:“马太效应”导致信息富国与穷国的两极分化。
  • 信息污染:虚假、有害等不良信息充斥网络。
  • 信息障碍信息犯罪日益严重。

为此,我们需要通过政策法规、技术手段和信息教育来净化环境并提升个人的信息素质。

1.2 信息素质#

信息素质 (Information Literacy)是指人们敏锐察觉信息需求,并能对信息进行检索、评价和有效利用的能力。大学生的信息素质要求主要体现在五个方面:明确信息需求、高效获取信息、客观评价信息、有效利用信息以及遵守信息道德。 信息素质的核心构成包括:信息意识(对信息的敏感度)、信息能力(查询、获取与处理能力)以及信息道德(遵循的法律与伦理规范)。

1.3 信息资源的构成#

为了更好地进行检索,我们需要了解信息资源的构成方式,其核心分类如下:

  1. 按载体形式分
    • 印刷型文献:纸质文献,便于阅读但存储密度低。
    • 缩微型文献:如胶卷,存储密度高。
    • 声像型文献:录音录像等直观多媒体。
    • 机读型文献:即数字信息资源,如光盘、网络数据库,存取快且密度高。
  2. 按加工程度分
    • 零次文献:未经公开发表的灰色文献(如手稿、笔记)。
    • 一次文献:原始研究成果(如期刊论文、专著、专利)。
    • 二次文献:对一次文献加工整理的检索工具(如目录、题录、文摘、索引)。
    • 三次文献:在二次文献基础上深度分析的参考性文献(如综述、百科全书)。
  3. 按出版形式分:图书、期刊、报纸、学位论文、会议文献、专利文献、标准文献、科技报告等。

1.4 信息资源的特征#

  • 传统信息资源:数量大、增长快;分布既集中又分散;时效性强;内容交叉重复;载体与语种日益增多。
  • 网络信息资源:数量巨大且来源广;缺乏组织,分散无序;更新快且信息污染严重;形式多样但质量参差不齐。

【复习思考题 - 第 1 章】

  1. 信息、知识与文献三者之间存在怎样的演化关系?
  2. 按照加工程度划分,文献分为哪四个层级?它们在检索中各有什么作用?
  3. 当代信息环境存在哪些主要问题?我们应如何提升自身的信息素质以应对这些挑战?

第 2 章 信息检索原理#

本章主要阐述信息检索的核心原理,包括检索途径、检索语言、系统类型以及基本的检索策略。

2.1 信息检索的概念及类型#

  • 信息检索 (Information Retrieval):狭义上指从信息集合中查找特定信息的过程;广义上包括信息存储检索两个互逆的过程。其实质是将用户的“提问特征”与系统的“检索标识”进行匹配。
  • 按检索内容划分,可分为:文献型检索(查线索或全文)、事实型检索(查特定客观事实如人物、事件)和数据型检索(查数值或图表)。
  • 按系统组织方式划分,可分为:全文检索超文本检索(非线性的网状关联)和超媒体检索

2.2 检索途径与检索语言#

为了准确匹配信息,我们需要依赖特定的途径和人工编制的语言。

  • 检索途径
    • 外部特征途径:通过题名、著者(个人或团体)、代码(专利号、ISBN 等)进行检索。
    • 内容特征途径:通过分类途径(按学科体系查找,适合族性检索)和主题途径(按具体讨论的主题词查找,直接且精确)进行检索。
  • 检索语言:专供信息存储和检索使用的人工语言,用于沟通系统与用户。主要分为分类语言(表达学科体系)和主题语言(规范化的主题词汇)。

2.3 检索系统与检索方法#

  • 检索系统:是信息记录的有序集合。按照著录格式,可分为目录、题录(提供线索)、文摘(附带摘要)、索引和全文检索系统。
  • 检索方法主要包括:
    • 常用法:利用检索工具查找,分为顺查法(由远及近)、倒查法(由近及远)和抽查法(针对核心年代)。
    • 引文法(追溯法):利用文献后附的参考文献进行追踪。
    • 综合法:结合常用法和引文法进行全面检索。

2.4 检索技术与检索效果#

  • 常见检索技术
    • 布尔逻辑检索:使用 AND (与,缩小范围)、OR (或,扩大范围)、NOT (非,排除) 进行组配。
    • 截词检索:利用通配符(如 *?)检索词根相同的一类词,可防止漏检。
    • 邻近检索 (位置检索):规定检索词在文中的相对位置要求。
    • 字段限制检索:将检索词限定在特定字段(如仅在“题名”或“摘要”中匹配)。
  • 检索效果的评价指标
    • 查全率 (Recall):检出的相关文献量 / 系统中总的相关文献量。
    • 查准率 (Precision):检出的相关文献量 / 检出的文献总量。 两者呈反比关系。此外还有漏检率和误检率。

2.5 检索步骤与检索策略#

一个完整的检索流程如下:

  1. 分析课题:明确目的,提炼核心概念。
  2. 选择检索系统和数据库:根据学科和文献类型挑选。
  3. 确定检索词并构建检索式:利用布尔逻辑、截词等技术。
  4. 调整检索策略:若查全率低,则用 OR 扩展或截词;若查准率低,则用 AND 限制或字段限定。
  5. 输出并评估结果

【复习思考题 - 第 2 章】

  1. 简述信息检索的实质是什么?
  2. 查全率与查准率之间有何关系?如何通过调整检索式来提高查准率?
  3. 比较“分类途径”与“主题途径”的异同与适用场景。

第 3 章 馆藏信息资源的利用#

本章主要介绍图书馆馆藏资源的构成、图书的整序与查检方法,以及数字图书馆的服务与功能。

3.1 图书馆馆藏资源#

图书馆馆藏资源主要分为两类:

  • 馆藏实体资源:图书馆物理上拥有的资源,如印刷文献、缩微资料、声像资料、光盘文献及本地服务器上的数据库资源。
  • 馆藏网络虚拟资源:图书馆不具有所有权但拥有使用权的资源,即通过网络使用的外部电子信息资源。

3.2 图书的整序及查检方法#

  • 图书整序:图书馆依据图书分类法对藏书进行整序。图书按**索书号(分类号 + 书次号)**排架,先按分类号排序,相同分类号再按书次号排序。
  • 查检方法:普遍采用 OPAC (联机公共查询目录) 系统。读者可以通过 OPAC 进行馆藏书目简单检索、全文检索、多字段检索,还可以获取新书通报、管理“我的图书馆”、预约图书以及续借图书。

3.3 图书馆的服务#

现代图书馆除了传统的外借和阅览服务外,还提供:

  • 网络信息资源服务与信息咨询服务。
  • 文献检索与文献传递服务。
  • 定题服务与信息推送服务。
  • 科技查新服务、用户辅导及文献复制打印等。

3.4 数字图书馆#

数字图书馆 (Digital Library) 是用数字技术处理和存储各种图文并茂文献的分布式信息系统,是一个“没有围墙的虚拟图书馆”。

  • 特征:信息资源数字化、信息组织网状化、信息传播网络化、信息资源共享化、信息检索智能化、信息服务个性化。
  • 功能:包括内容获取与创建、存储与管理、访问查询、权限管理和信息发布。此外还具备网络资源连接、联机书目查询、电子出版物利用等功能。
  • 我国主要的数字图书馆
    • CALIS (中国高等教育文献保障体系):包含 e 读学术搜索、外文期刊网等,支持馆际互借。
    • NSTL (国家科技图书文献中心):提供丰富的外文科技文献和开放获取资源。

【复习思考题 - 第 3 章】

  1. 什么是 OPAC?它能为读者提供哪些主要功能?
  2. 数字图书馆相较于传统图书馆,具有哪些显著的特征?
  3. 简述索书号的构成及其在图书馆排架中的作用。

第 4 章 国内主要的中文数据库#

本章介绍国内主要的中文学术数据库及其基本检索功能。

4.1 中国知网 (CNKI)#

中国知网 (CNKI) 是国内最权威的综合性文献数据库之一。

  • 主要资源:《中国学术期刊(网络版)》、博士/硕士学位论文全文数据库、重要会议论文、重要报纸等。
  • 检索功能
    • 文献检索:支持中外文混检和跨库检索。
    • 知识元检索:支持对概念、方法、统计数据等知识单元的检索。
    • 引文检索:追踪文献的被引情况。
  • 结果处理:可对检索结果进行分组筛选、显示节点文献(分析文献的引证关系)以及全文下载。

4.2 万方数据知识服务平台#

万方数据 (Wanfang Data) 同样是国内重要的学术资源平台。

  • 主要资源:涵盖学位论文、学术期刊、会议论文、外文文献、中外专利、标准、科技成果等。
  • 检索功能:提供直接检索、跨库检索、高级检索、经典检索和专业检索。
  • 结果显示:检索结果可按相关度、出版时间、被引次数排序,并支持按学科、年份等进行分组筛选。

4.3 维普期刊资源整合服务平台#

维普资讯 (VIP) 侧重于科技类期刊文献。

  • 主要资源:《中文科技期刊数据库》(含引文版)、《外文科技期刊数据库》以及中国科技经济新闻数据库等。
  • 特色:以收录自然科学和工程技术领域的中文学术期刊见长,提供灵活的检索与文献分析功能。

(注:部分数据库的使用和高级功能需根据各平台具体更新情况而定。)


【复习思考题 - 第 4 章】

  1. 列举中国知网(CNKI)的三种主要检索入口,并简述“引文检索”的作用。
  2. 比较 CNKI、万方和维普三大中文数据库在资源侧重点上的异同。
  3. 简述在大型数据库中,如何通过“分组筛选”功能快速定位所需文献。

第 5 章 常用的国外全文数据库#

本章主要介绍获取国外高质量原版文献的途径,包括外文电子图书、电子期刊、学位论文、专利与标准。

5.1 电子图书 (eBooks)#

常用的外文电子图书数据库包括:

  • EBSCO eBook Collection(原 NetLibrary):全球最大的电子图书提供商之一。
  • Ebrary:覆盖商业、社科、科技等多个领域,由三大著名出版公司组建。
  • Safari:主要由著名的 IT 出版商 O’Reilly 和 Pearson 联合推出,全面覆盖 IT 技术学科。
  • SpringerJohn Wiley:全球著名的专业科技出版商,提供各自出版的权威电子图书。
  • 不列颠百科全书 (Encyclopedia Britannica):享誉世界的学术性综合百科全书。

5.2 电子期刊 (eJournals)#

外文电子期刊是获取最新国际科研成果的核心:

  • Elsevier SDOS (ScienceDirect):全球最大的科技文献出版商,是全学科的全文数据库。
  • Springer Link:全球第二大学术期刊出版社,涵盖 STM (自然科学、工程技术和医学) 领域。
  • EBSCO (ASP+BSP):ASP (学术期刊精华) 偏向综合性,BSP (商业资源精华) 是最常用的商业研究数据库。
  • Wiley-Blackwell:在化学、生命科学、医学和材料学等领域的学术文献极具权威性。
  • Emerald:世界最大的管理学期刊出版社之一。
  • IEL (IEEE/IEE Electronic Library):电机、电子、计算机科学与通信领域的权威数据库。
  • 综合顶级期刊:《Science》周刊与《Nature》杂志,代表了全球科技领域最重要的突破。

5.3 国外学位论文#

  • ProQuest:世界上最大、最完备的优秀博硕士论文全文数据库,涵盖北美地区大部分高校。
  • NDLTD (网络博士、硕士论文数字图书馆):支持全球范围内电子论文的共建共享,提供部分免费摘要和全文。

5.4 美国及欧洲专利数据库#

  • USPTO (美国专利数据库):美国专利商标局免费向公众提供的全文数据库,提供授权专利及公开专利申请。
  • EPO (欧洲专利数据库/espacenet):综合性的免费专利检索网站,可检索世界多国的专利信息。
  • DII (德温特专利数据库):全球最权威的专利情报平台,将“世界专利索引(WPI)”和“专利引文索引(PCI)”整合,支持化学结构检索及专利被引检索。

5.5 国外标准数据库#

获取工业发展和技术水平规范的途径:

  • NSSN:美国国家标准协会 (ANSI) 维护的全球标准化资料库引擎。
  • Techstreet:世界最大的工业标准集之一。
  • 主要的国际/区域标准机构如:ISO (国际标准化组织)、IEC (国际电工委员会)、ITU (国际电信联盟)。

【复习思考题 - 第 5 章】

  1. 试列举三个你所学专业最常用的外文电子期刊数据库,并指出它们的学科侧重点。
  2. 要查阅北美高校最新的博士学位论文全文,首选哪一个数据库?
  3. DII (德温特专利数据库) 相比于免费的专利检索平台,有何独特的优势和高级检索功能?

第 6 章 常用的国外文摘数据库#

对于文献的系统性追踪和评价,文摘型数据库 (如索引库) 扮演着不可替代的作用。

6.1 美国《科学引文索引》 (SCI)#

SCI (Science Citation Index) 由 ISI 编制,是国际公认的权威综合检索工具,以严格的选刊标准和独特的引文索引功能著称。其网络版为 Web of Science (SCIE),不仅可以检索文献本身,还能通过被引参考文献检索功能,追溯科学理论的发展脉络。

6.2 美国《工程索引》 (EI)#

EI (The Engineering Index) 是著名的工程技术领域的综合性检索工具。其网络版为 EI Compendex Web (依托 Engineering Village 平台)。EI 以收录全球高质量工程技术文献闻名。

6.3 会议录引文索引 (ISI Proceedings)#

会议文献是获取前沿学术信息的重要渠道。CPCI-S (原 ISTP) 和 CPCI-SSH (原 ISSHP) 汇集了全球最新的会议录资料,也是 Web of Science 平台的核心合集之一。

6.4 英国《科学文摘》 (INSPEC)#

INSPEC 是全球著名的科技文摘数据库,涵盖物理、电气、电子工程、计算机科学与控制技术等五大学科,在这些领域的文献覆盖率极高。

6.5 美国《化学文摘》 (CA)#

CA (Chemical Abstracts) 是世界上最富盛名、引用最广的化学化工文献检索工具。其网络版 SciFinder 提供了特有的物质检索反应检索功能,支持通过绘制化学结构图来查找相关文献。


【复习思考题 - 第 6 章】

  1. 简述 SCI 的“引文检索”功能如何帮助研究人员追踪某一课题的发展脉络?
  2. 在工程技术领域和化学领域,分别最具权威的文摘数据库是什么?
  3. 什么是“世界三大检索系统”?它们各自侧重什么类型的文献?

第 7 章 网络信息资源检索#

本章介绍网络信息资源的特点、搜索引擎的使用以及“看不见的网络”的挖掘。

7.1 网络信息资源的概述#

  • 网络信息资源是指以数字化形式记录,以多媒体形式表达,存储在网络计算机磁介质、光介质等存储介质上,并通过计算机网络通信方式进行传递的信息集合。
  • 特点:信息量巨大、更新速度快、形式多样、分布广泛、但质量良莠不齐。

7.2 搜索引擎及检索技巧#

搜索引擎是获取网络信息资源最主要的工具。

  • 主要搜索引擎:Google (谷歌)、Baidu (百度)、Bing (必应) 等。
  • 学术搜索引擎Google Scholar (提供学术论文、学位论文等的搜索,支持引文检索) 和 百度学术
  • 检索技巧
    • 使用布尔逻辑 (AND, OR, NOT) 组合关键词。
    • 使用双引号 ("") 进行精确短语检索。
    • 使用特定的检索指令,如 site: (限定站点)、filetype: (限定文件格式如 pdf, ppt)、intitle: (限定标题)。

7.3 “看不见的网络” (Invisible Web)#

看不见的网络 (也称深网 Deep Web) 是指那些无法被通用搜索引擎 (如 Google, Baidu) 通过常规链接抓取到的网页内容。

  • 成因:由于需要动态查询数据库生成、需要权限/密码访问、或是特殊的文件格式等原因,通用搜索引擎蜘蛛无法抓取。
  • 挖掘方法:利用专业搜索引擎 (如 Scirus 等)、“看不见的网络”导航网站 (如 CompletePlanet)、以及直接访问各大专业数据库主页进行检索。

【复习思考题 - 第 7 章】

  1. 什么是“看不见的网络”?为何通用搜索引擎无法抓取它们?
  2. 试举例说明如何利用 site:filetype: 语法提高检索的精准度。
  3. 比较 Google 学术搜索 (Google Scholar) 与普通 Google 搜索在信息结果上的主要差异。

第 8 章 信息的综合利用#

本章讲解如何将检索到的信息进行搜集、整理、分析,以及学术论文和文献综述的撰写规范。

8.1 信息的搜集、整理与分析#

  • 信息搜集途径:包括直接获取 (如实验、考察) 和间接获取 (通过一次文献和二次文献查阅)。
  • 信息提炼方法:汇编法、摘要法、综述法。
  • 信息分析方法:逻辑分析方法 (如分析与综合、抽象与概括、归纳与演绎) 和统计分析方法 (如相关分析、信息评估)。

8.2 学术论文的撰写#

  • 表现形式:期刊论文、会议论文、学位论文。
  • 论文选题:选题应当是当前科技发展的“热点”,新颖实用,与作者知识水平及兴趣一致,并具备完成课题的客观条件。
  • 结构规范
    • 前置部分:篇名 (准确简明醒目)、作者信息、摘要 (独立于正文的短文,交代背景、内容、成果及意义)、关键词 (3-8 个)。
    • 主体部分:引言 (目的、背景)、正文 (核心创造性成果)、结论 (总结)、致谢、参考文献

8.3 文献综述及开题报告#

  • 文献综述是对某一时期内某一学科所取得的研究成果、水平和发展趋势的综合叙述。
  • 特点:以综合叙述为主,没有首创性,指明发展演变规律和趋势。
  • 撰写步骤:选题 -> 检索和阅读文献 -> 撰写综述 (注意文献代表性、科学性,忠实原文献内容)。

8.4 学术规范与合理使用#

  • 学术道德:坚持实事求是,尊重知识产权,不剽窃、不篡改。
  • 合理使用:在特定条件下,允许个人或特定组织在未经版权人许可的情况下无偿使用版权作品,如为个人学习、研究或教学目的少量引用。

8.5 个人文献管理软件#

用于帮助用户组织、管理参考文献,并自动按出版社要求生成参考文献目录。

  • 国外常用EndNote (单机版/网络版)、MendeleyZotero
  • 国内常用NoteExpressNoteFirst

【复习思考题 - 第 8 章】

  1. 简述学术论文的前置部分包含哪些关键要素?
  2. 文献综述与一般学术论文的最大区别是什么?
  3. 在学术写作中,如何界定“合理使用”与“学术剽窃”?

附录:网络爬虫实战 (Web Crawler)#

现代信息检索往往需要通过自动化手段大批量抓取网络数据,这就需要用到网络爬虫。

A.1 网络爬虫基本原理#

网络爬虫是自动从互联网上抓取数据的程序。它基于 HTTP 协议 (发起 GET/POST 请求),获取 HTML/JSON 响应,并通过解析提取数据。

A.2 Python 爬虫核心技术#

  • 发起请求:使用 requests 库 (pip install requests),通过 requests.get() 模拟浏览器请求。
  • 解析页面:使用 BeautifulSoup4 库 (pip install beautifulsoup4) 解析 HTML/XML,或者使用 XPath / CSS Selector 定位元素。
  • 爬虫框架:对于复杂的项目,常使用功能强大的 Scrapy 框架。

A.3 高级进阶与应对反爬#

  • 应对动态网页:对于由 JavaScript 动态加载的网页,传统爬虫无法获取内容,需要使用浏览器自动化工具如 Selenium
  • 应对反封禁:使用代理 IP 隐藏真实 IP 地址,并合理控制爬取频率,减轻服务器压力。

A.4 道德与法律边界#

  • Robots 协议 (robots.txt):网站根目录下的标准文件,规定了爬虫哪些页面可以抓取,必须严格遵守。
  • 隐私与版权:抓取数据时绝不可泄露用户隐私,也不得侵犯网站版权,以免引起法律纠纷。
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

信息检索与Web数据挖掘 - 课程大纲与总结
https://blog.sopak.space/posts/study/computer-science/ir-wdm/overview/
作者
Xxxhite
发布于
2026-06-28
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录