主页 详情

《管理海量数据-压缩、索引和查询 第2版》_(美)IanH·Witten(美)AlistairMoffat(美)TimothyC·Bell著;梁斌杨青译_13

【书名】:《管理海量数据-压缩、索引和查询 第2版》
【作者】:(美)IanH·Witten(美)AlistairMoffat(美)TimothyC·Bell著;梁斌杨青译
【出版社】:北京:电子工业出版社
【时间】:2014
【页数】:514
【ISBN】:7121219337
【SS码】:13456195

最新查询

内容简介

第1章 概览

1.1文档数据库(document databases)

1.2压缩(compression)

1.3索引(indexes)

1.4文档索引

1.5 MG海量文档管理系统

第2章 文本压缩

2.1模型

2.2自适应模型

2.3哈夫曼编码

范式哈夫曼编码

计算哈夫曼编码长度

总结

2.4算术编码

算术编码是如何工作的

实现算术编码

保存累积计数

2.5符号模型

部分匹配预测

块排序压缩

动态马尔科夫压缩

基于单字的压缩

2.6字典模型

自适应字典编码器的LZ77系列

LZ77的Gzip变体

自适应字典编码器的LZ78系列

LZ78的LZW变体

2.7同步

创造同步点

自同步编码

2.8性能比较

压缩性能

压缩速度

其他性能方面的考虑

第3章 索引

3.1样本文档集合

3.2倒排文件索引

3.3压缩倒排文件

无参模型(Nonparameterized models)

全局贝努里模型

全局观测频率模型(Global observed frequency model)

局部贝努里模型(Local Bernoulli model)

有偏贝努里模型(Skewed Bernoulli model)

局部双曲模型(Local hyperbolic model)

局部观测频率模型(Local observed frequency model)

上下文相关压缩(Context-sensitive compression)

3.4索引压缩方法的效果

3.5签名文件和位图

签名文件

位片签名文件(Bitsliced signature files)

签名文件分析

位图

签名文件和位图的压缩

3.6索引方法的比较

3.7大小写折叠、词根化和停用词

大小写折叠

词根化

影响索引长度的因素

停用词(stop word)

第4章 查询

4.1访问字典的方法

访问数据结构

前端编码(Front coding)

最小完美哈希函数

完美哈希函数的设计

基于磁盘的字典存储

4.2部分指定的查询术语

字符串暴力匹配(Brute-force string matching)

用n-gram索引

循环字典(Rotated lexicon)

4.3布尔查询(BooLEAN QUERY)

合取查询(conjunctive query)

术语处理顺序

随机访问和快速查找

分块倒排索引

非合取查询(Nonconjunctive Query)

4.4信息检索和排名

坐标匹配(Coordinate matching)

内积相似度

向量空间模型

4.5检索效果评价

召回率和精确率

召回率——精确率曲线

TREC项目

万维网搜索(World Wide Web Searching)

其他有效性评价方法

4.6余弦法实现

文档内频率

余弦值的计算方法

文档权重所需的内存

累加器内存

快速查询处理

按频率排序的索引

排序

4.7交互式检索

相关性反馈

概率模型

4.8分布式检索

第5章 索引构造

计算模型

索引构造方法概览

5.1基于内存的倒排

5.2基于排序的倒排

5.3索引压缩

压缩临时文件

多路归并

原地多路归并

5.4压缩的内存内倒排

大内存倒排

基于字典的切分(Lexicon-based partitioning)

基于文本的切分

5.5倒排方法的比较

5.6构造签名文件和位图

5.7动态文档集合

扩展文本(Expanding the text)

索引扩展(Expanding the index)

第6章 图像压缩

6.1图像类型

6.2 CCITT二值图像的传真标准

6.3二值图像的上下文压缩

上下文模型

二值上下文模型

“超视力”压缩(Clairvoyant compression)

6.4 JBIG:二值图像标准

分辨率降低(Resolution reduction)

模板和自适应模板

编码及概率估计

6.5连续色调图像的无损压缩

GIF和PNG无损图像格式

FELICS:快速、有效且无损图像压缩系统

CALIC:基于上下文自适应无损图像解码器

JPEG-LS:无损图像压缩新标准

6.6 JPEG:连续色调图像标准

6.7图像的递增传输

金字塔编码

金字塔编码的压缩

中位数聚合

误差模型

6.8图像压缩技术总结

第7章 文本图像

7.1文本图像压缩概念

7.2有损压缩和无损压缩

7.3标记抽取

跟踪标记的边界

清除图像中的标记

按自然阅读顺序排序标记

7.4模板匹配

全局模板匹配

局部模板匹配

基于压缩的模板匹配

库模板筛法

评价模板匹配方法

7.5从标记到符号

库构造

符号及其偏移量

7.6编码文本图像分量

符号数

符号偏移

原始图像

7.7效果:有损和无损的模式

7.8系统考虑

7.9 JBIG2:图像文本压缩标准

第8章 混合图文

8.1方向

用Hough变换检测直线

左侧留白查找

投影轮廓

从斜率直方图到文本谱

8.2切分

自下向上的切分方法

自上向下的组合的切分方法

基于标记的切分

使用短文本字符串切分

利用文本句法切分

8.3分类

第9章 系统实现

9.1文本压缩

选择压缩模型

选择编码器

哈夫曼编码的限制

长度限制的编码

9.2文本压缩效果

压缩有效性

解压速度

解压内存

动态文档集合

9.3图像和文本图像

压缩二值图像

压缩灰度图像

压缩文本图像

9.4构造索引

9.5索引压缩

9.6查询处理

布尔查询

排名查询

附录A mg系统指南

A.1安装MG系统

A.2一个简单的存储和检索例子

A.3数据库创建

A.4对一个索引文档集合进行查询

A.5非文本文件

A.6图像压缩程序

附录B 新西兰图书馆

B.1什么是NZDL

计算机科学报告(Computer Science Technical Reports)

其他文档集合

文档集合的发展

音频集合(audio collections)

音调索引(Melody Index)

B.2 NZDL是如何工作的

原始文档

搜索和索引

B.3影响

参考文献


书查询(www.shuchaxun.com)本网页唯一编码:
e945b16995ceaf69ba55d396a9fe4253#a1e78d48de28e247420cf385dc1380fe#245440233#13456195_管理海量数据:压缩、索引和查询(第2版).zip