内容简介
第1章 概览
1.1文档数据库(document databases)
1.2压缩(compression)
1.3索引(indexes)
1.4文档索引
1.5 MG海量文档管理系统
第2章 文本压缩
2.1模型
2.2自适应模型
2.3哈夫曼编码
范式哈夫曼编码
计算哈夫曼编码长度
总结
2.4算术编码
算术编码是如何工作的
实现算术编码
保存累积计数
2.5符号模型
部分匹配预测
块排序压缩
动态马尔科夫压缩
基于单字的压缩
2.6字典模型
自适应字典编码器的LZ77系列
LZ77的Gzip变体
自适应字典编码器的LZ78系列
LZ78的LZW变体
2.7同步
创造同步点
自同步编码
2.8性能比较
压缩性能
压缩速度
其他性能方面的考虑
第3章 索引
3.1样本文档集合
3.2倒排文件索引
3.3压缩倒排文件
无参模型(Nonparameterized models)
全局贝努里模型
全局观测频率模型(Global observed frequency model)
局部贝努里模型(Local Bernoulli model)
有偏贝努里模型(Skewed Bernoulli model)
局部双曲模型(Local hyperbolic model)
局部观测频率模型(Local observed frequency model)
上下文相关压缩(Context-sensitive compression)
3.4索引压缩方法的效果
3.5签名文件和位图
签名文件
位片签名文件(Bitsliced signature files)
签名文件分析
位图
签名文件和位图的压缩
3.6索引方法的比较
3.7大小写折叠、词根化和停用词
大小写折叠
词根化
影响索引长度的因素
停用词(stop word)
第4章 查询
4.1访问字典的方法
访问数据结构
前端编码(Front coding)
最小完美哈希函数
完美哈希函数的设计
基于磁盘的字典存储
4.2部分指定的查询术语
字符串暴力匹配(Brute-force string matching)
用n-gram索引
循环字典(Rotated lexicon)
4.3布尔查询(BooLEAN QUERY)
合取查询(conjunctive query)
术语处理顺序
随机访问和快速查找
分块倒排索引
非合取查询(Nonconjunctive Query)
4.4信息检索和排名
坐标匹配(Coordinate matching)
内积相似度
向量空间模型
4.5检索效果评价
召回率和精确率
召回率——精确率曲线
TREC项目
万维网搜索(World Wide Web Searching)
其他有效性评价方法
4.6余弦法实现
文档内频率
余弦值的计算方法
文档权重所需的内存
累加器内存
快速查询处理
按频率排序的索引
排序
4.7交互式检索
相关性反馈
概率模型
4.8分布式检索
第5章 索引构造
计算模型
索引构造方法概览
5.1基于内存的倒排
5.2基于排序的倒排
5.3索引压缩
压缩临时文件
多路归并
原地多路归并
5.4压缩的内存内倒排
大内存倒排
基于字典的切分(Lexicon-based partitioning)
基于文本的切分
5.5倒排方法的比较
5.6构造签名文件和位图
5.7动态文档集合
扩展文本(Expanding the text)
索引扩展(Expanding the index)
第6章 图像压缩
6.1图像类型
6.2 CCITT二值图像的传真标准
6.3二值图像的上下文压缩
上下文模型
二值上下文模型
“超视力”压缩(Clairvoyant compression)
6.4 JBIG:二值图像标准
分辨率降低(Resolution reduction)
模板和自适应模板
编码及概率估计
6.5连续色调图像的无损压缩
GIF和PNG无损图像格式
FELICS:快速、有效且无损图像压缩系统
CALIC:基于上下文自适应无损图像解码器
JPEG-LS:无损图像压缩新标准
6.6 JPEG:连续色调图像标准
6.7图像的递增传输
金字塔编码
金字塔编码的压缩
中位数聚合
误差模型
6.8图像压缩技术总结
第7章 文本图像
7.1文本图像压缩概念
7.2有损压缩和无损压缩
7.3标记抽取
跟踪标记的边界
清除图像中的标记
按自然阅读顺序排序标记
7.4模板匹配
全局模板匹配
局部模板匹配
基于压缩的模板匹配
库模板筛法
评价模板匹配方法
7.5从标记到符号
库构造
符号及其偏移量
7.6编码文本图像分量
库
符号数
符号偏移
原始图像
7.7效果:有损和无损的模式
7.8系统考虑
7.9 JBIG2:图像文本压缩标准
第8章 混合图文
8.1方向
用Hough变换检测直线
左侧留白查找
投影轮廓
从斜率直方图到文本谱
8.2切分
自下向上的切分方法
自上向下的组合的切分方法
基于标记的切分
使用短文本字符串切分
利用文本句法切分
8.3分类
第9章 系统实现
9.1文本压缩
选择压缩模型
选择编码器
哈夫曼编码的限制
长度限制的编码
9.2文本压缩效果
压缩有效性
解压速度
解压内存
动态文档集合
9.3图像和文本图像
压缩二值图像
压缩灰度图像
压缩文本图像
9.4构造索引
9.5索引压缩
9.6查询处理
布尔查询
排名查询
附录A mg系统指南
A.1安装MG系统
A.2一个简单的存储和检索例子
A.3数据库创建
A.4对一个索引文档集合进行查询
A.5非文本文件
A.6图像压缩程序
附录B 新西兰图书馆
B.1什么是NZDL
计算机科学报告(Computer Science Technical Reports)
其他文档集合
文档集合的发展
音频集合(audio collections)
音调索引(Melody Index)
B.2 NZDL是如何工作的
原始文档
搜索和索引
B.3影响
参考文献