内容简介
第1章 概述
1.1 引言
1.2 信息获取与数据获取
1.3 信息获取技术的发展
1.4 信息获取基本概念
1.5 信息获取系统的过去、现在和将来
1.6 信息获取的过程
1.7 本书的结构
1.8 本章小结
第2章 信息获取模型
2.1 引言
2.2 布尔模型
2.3 向量模型
2.4 概率论模型
2.5 神经网络模型
2.6 基于命题逻辑的模型及其应用
2.6.1 基本概念不相交及其与向量模型的关系
2.6.2 基本概念相交及其与布尔模型的关系
2.7 本章小结
第3章 标记语言与文本操作
3.1 引言
3.2 标记语言
3.2.1 HTML语言
3.2.2 XML语言
3.3 文本预处理
3.3.1 文本的词法分析
3.3.2 中文分词技术
3.3.4 词干提取技术
3.3.3 无用词汇的删除
3.3.5 索引词条的选择
3.3.6 词典
3.4 文档聚类
3.5 文本压缩
3.5.1 基本概念
3.5.2 统计方法
3.5.3 字典方法
3.5.4 倒排文件压缩
3.5.5 文本压缩方法比较
3.6 本章小结
第4章 索引和搜索
4.1 引言
4.2 倒排文件
4.2.1 倒排文件的搜索
4.2.2 倒排文件的构造
4.3 后缀树与后缀数组
4.4 布尔查询
4.5 顺序查询
4.6 结构化查询
4.7 对压缩文本的搜索
4.8 模式匹配
4.8.1 容错匹配
4.8.2 正规表达式和扩展模式
4.8.3 利用索引进行模式匹配
4.9 本章小结
第5章 信息获取系统评价
5.1 引言
5.2 相关性
5.3 召回率和精度
5.3.1 召回率与精度的计算
5.3.2 汇聚技术
5.4 复合度量
5.5 本章小结
第6章 查询处理
6.1 引言
6.2 基于用户反馈信息的查询扩展
6.2.1 向量模型的查询扩展和词条权重重新计算
6.2.2 概率论模型中的词条权重重新计算
6.3 自动局部分析
6.3.1 通过局部聚集进行查询扩展
6.3.1.1 关联聚集
6.3.1.2 距离聚集
6.3.1.3 标量聚集
6.3.1.4 搜索表达式的改变
6.3.2 通过局部上下文分析进行查询扩展
6.4 自动全局分析
6.4.1 基于相似词典的查询扩展
6.4.2 基于统计词典的查询扩展
6.5 本章小结
第7章 目录式检索服务与聚类分析
7.1 引言
7.2 目录检索服务的构成
7.2.1 网页采集过程
7.2.2 网页分类方法
7.3.1.1 相似度
7.3.1 文档关联度的衡量
7.3 聚类过程
7.3.1.2 相异度
7.3.2 文档聚类
7.3.2.1 基于相似度的分类过程
7.3.2.2 基于相异度的分类过程
7.4 基于聚类的信息获取
7.5 本章小结
第8章 基于因特网的搜索引擎
8.1 引言
8.2 基于因特网的搜索引擎的构成
8.3 搜索引擎的主要指标及其分析
8.3.1 搜索引擎的精度
8.3.2 搜索引擎受欢迎的程度
8.3.3 搜索引擎相关性考虑
8.4 搜索引擎的数据结构
8.4.1 Bigfile文件系统
8.4.2 信息库
8.4.3 文本索引
8.4.4 词典
8.4.5 采样表
8.4.6 前向索引
8.4.7 后向索引
8.5 网页的获取
8.6 建立索引的方法和过程
8.6.1 搜索引擎建立索引的方法
8.6.2 索引的过程
8.7 搜索过程
8.8 搜索结果排序方法
8.9 搜索引擎的发展趋势
8.10 本章小结
第9章 元搜索引擎
9.1 引言
9.2 基本构成
9.3 元搜索引擎分类
9.4 与独立搜索引擎的比较
9.5 主要指标及其分析
9.6 元搜索引擎面临的问题、对策和发展趋势
9.6.1 查询预处理
9.6.2 搜索结果集成
9.7 元搜索引擎调度策略研究
9.7.1 GSE基本思想
9.7.2 遗传算法在元搜索引擎调度中的应用
9.7.2.1 编码方法
9.7.2.2 适应函数和选择
9.7.2.3 初始化种群
9.7.2.4 重组
9.7.2.5 变异
9.7.3 GSE中的智能调度器
9.7.4 实验——自适应过程运行周期的确定
9.8 文档选择
9.8.1 用户决定法
9.8.2 权重分配法
9.8.3 基于学习的方法
9.8.4 确保取回法
9.9 结果归并
9.9.1 基本定义
9.9.2.1 几种常用元搜索引擎结果集成方法及其存在问题
9.9.2 元搜索引擎结果集成方法
9.9.2.2 摘要排序法
9.9.2.3 位置排序法
9.9.2.4 摘要/位置排序法
9.9.3 搜索结果集成技术比较
9.9.4 实验分析
9.9.5 元搜索引擎搜索结果集成技术展望
9.10 元搜索引擎可扩展性
9.10.1 XML与XSL语言
9.10.2 可扩展元搜索引擎的基本结构
9.10.3 元查询映射
9.10.4 结果归并
9.10.5 搜索引擎接入元搜索引擎的过程
9.11 本章小结
10.1 利用代理个性化搜索结果
第10章 基于客户端的个性化应用研究
10.1.1 用户兴趣模型
10.1.1.1 个性化信息抽取与兴趣生成树
10.1.1.2 词干抽取与信息预处理
10.1.1.3 用户个人兴趣模型
10.1.1.4 共同兴趣模型
10.1.2 个性化搜索代理系统PSA
10.1.2.1 用户个人兴趣代理
10.1.2.2 共同兴趣代理
10.1.2.3 利用兴趣剖像过滤搜索结果
10.1.3 工作流程
10.1.4 性能分析
10.2 数据挖掘技术在Web预取中的应用研究
10.2.1 简化WWW数据模型
10.2.2 兴趣关联知识库与用户行为预测
10.2.3 数据挖掘技术
10.2.4 基于代理的Web预取技术
10.2.5 实例研究
10.3 本章小结
第11章 基于服务器端的个性化应用研究
11.1 引言
11.2 带反馈自适应搜索引擎系统
11.3 数据采集与反馈信息库的生成
11.3.1 数据采集
11.3.2 反馈信息库的生成及其算法
11.4 反馈响应过程
11.5.1 一个实验性带反馈自适应搜索引擎ASE
11.5 自适应搜索引擎系统原型设计与实验
11.5.2 实验
11.6 本章小结
第12章 搜索引擎策略——站点角度
12.1 引言
12.2 提高网站在搜索引擎中的排名位置的方法
12.2.1 了解不同的搜索引擎
12.2.2 关键词的选择
12.2.3 标题
12.2.4 Meta值的使用
12.2.5 提升自己网站排名的技巧
12.2.5.1 隐藏的表单input
12.3 如何提交自己的网站
12.3.1 提交工具
12.2.5.2 不可见关键词堆砌
12.3.2 如何跟踪
12.4 阻止网络检索器索引网页
12.4.1 阻止网络检索器的方法
12.4.2 文件Robots.txt的格式
12.4.3 Robots.txt使用实例分析
12.5 本章小结
第13章 搜索引擎策略——用户角度
13.1 引言
13.2 数学命令在搜索中应用
13.2.1 查询条件具体化
13.2.2 使用加号+
13.2.3 使用减号-
13.2.4 使用引号“”
13.2.5 组合符号
13.3 增强的搜索命令
13.3.1 搜索标题
13.3.2 搜索网站
13.3.3 百搭命令(?)
13.4 搜索引擎的辅助功能
13.4.1 相关搜索
13.4.2 搜索结果重组
13.4.3 相近搜索
13.4.4 延伸搜索条件
13.5 搜索引擎功能特点分析图表
13.6 本章小结
附录1 搜索引擎导航
附录2 术语
参考文献