主页 详情

《大数据搜索与挖掘》_张华平,黄河燕,赵燕平著_13572130_9787030403186

【书名】:《大数据搜索与挖掘》
【作者】:张华平,黄河燕,赵燕平著
【出版社】:北京:科学出版社
【时间】:2014
【页数】:292
【ISBN】:9787030403186
【SS码】:13572130

最新查询

内容简介

第1章 绪论

1.1大数据

1.2云计算及Hadoop简介

1.3 Web搜索、全文索引与Lucene简介

1.3.1 Web搜索

1.3.2全文索引

1.3.3 Lucene简介

1.4大数据挖掘

1.5本书主要内容及其知识点

1.6本章小结

参考文献

第2章 大数据搜索挖掘综述

2.1常用的信息检索模型

2.1.1传统布尔检索与扩展布尔检索模型

2.1.2向量空间模型

2.1.3概率检索模型

2.1.4语言模型

2.2自然语言理解与处理概述

2.3中文词法分析中的分词处理

2.3.1基于词典和规则的汉字分词

2.3.2基于大规模语料库的统计学习的分词方法

2.3.3规则和统计方法相结合的汉字分词方法

2.4未登录词及其识别

2.4.1命名实体及其识别

2.4.2未登录词与新词识别

2.5有意义串及其识别

2.6词典组织与管理

2.6.1基于Trie索引树的词典管理

2.6.2基于哈希表的词典管理

2.7文本分类

2.8文本聚类

2.8.1文本表示

2.8.2相似度度量

2.8.3聚类算法体系

2.9话题识别与跟踪

2.10句子及其检索

2.10.1传统的文档检索方法

2.10.2信息过滤方法

2.10.3分类方法

2.10.4语义比较方法

2.10.5隐马尔可夫模型方法

2.10.6自动文摘方法

2.11句子级新信息检测

2.11.1词重叠度

2.11.2最大区间相关度

2.11.3余弦冗余度

2.11.4命名实体触发方法

2.11.5统计机器翻译模型

2.11.6 LexRank方法

2.12本章小结

参考文献

第3章 大数据检索与分词

3.1概述

3.2分词对中文信息检索的影响

3.3分词精度与检索性能的关系

3.4大数据应用环境下中文信息检索的分词算法及其特点

3.4.1分词算法的时间性能要求高

3.4.2分词正确率的提高并不一定带来检索性能的提高

3.4.3分词切分粒度需在查询扩展层面进行相关处理

3.4.4未登录词识别的准确率要比召回率更重要

3.5基于双数组Trie树优化算法的词典

3.5.1双数组Trie树算法介绍及其优化

3.5.2利用优化的双数组Trie树算法组织词典

3.5.3实验结果与分析

3.6本章小结

参考文献

第4章 基于层次隐马尔可夫模型的浅层词法分析

4.1概述

4.2英文浅层分析的实现

4.2.1英文断句与词汇切分

4.2.2词性标注

4.2.3词干抽取与词形还原

4.3停用词处理与特征词选择

4.3.1停用词处理

4.3.2特征词选择

4.4基于层次隐马尔可夫模型的汉语浅层分析及其应用

4.4.1层次隐马尔可夫模型

4.4.2基于类的隐马尔可夫分词算法

4.4.3 N最短路径的切分排歧策略

4.4.4未登录词的隐马尔可夫识别方法

4.5汉语词法分析系统ICTCLAS性能实验与分析

4.5.1词法分析与层次隐马尔可夫模型

4.5.2 ICTCLAS在973评测中的测试结果

4.5.3第一届国际分词大赛的评测结果

4.6基于单字位置成词概率识别未登录词的算法

4.6.1字的位置成词概率

4.6.2局部二元串频统计

4.6.3有关未登录词识别的实验结果

4.7本章小结

参考文献

第5章 大数据语言新特征发现

5.1概述

5.2基于上下文邻接分析和语言模型的有意义串提取

5.2.1上下文邻接分析

5.2.2语言模型分析

5.2.3重复串发现及处理流程

5.2.4实验设计及结果分析

5.3基于局部性原理的低频有意义串提取

5.3.1有意义串的局部性

5.3.2局部性度量

5.3.3算法流程

5.3.4实验结果与分析

5.4基于伪相关反馈模型的有意义串提取

5.4.1算法的基本思想

5.4.2相关度的定义

5.4.3位置成词概率PWP的更新

5.4.4算法流程

5.4.5实验结果及分析

5.5本章小结

参考文献

第6章 大数据聚类与分类

6.1概述

6.2基于关键词提取的搜索结果聚类

6.2.1相关术语简介

6.2.2关键词提取

6.2.3基于关键词的检索结果聚类方法

6.2.4实验结果及分析

6.3基于K-means算法的有意义串主题聚类算法

6.4基于邻接串种类的有意义串语境聚类

6.5有意义串对分类的改进

6.6本章小结

参考文献

第7章 大数据文本自动摘要

7.1概述

7.2相关工作综述

7.2.1基于抽取的自动文摘

7.2.2基于理解的自动文摘

7.3基于关键词提取的自动摘要

7.3.1文本预处理

7.3.2停用词处理

7.3.3双数组Trie树

7.3.4关键词提取

7.3.5句子切分

7.3.6句子相似度计算

7.4面向主题的自动摘要

7.4.1改进的最大边缘相关度方法

7.4.2面向主题的词特征统计

7.4.3领域主题词表

7.4.4句子间的包含关系

7.5实验与分析

7.5.1稳定性测试

7.5.2时间性能

7.5.3文摘质量

7.6自动摘要应用场景分析及大数据搜索与挖掘软件应用示例

7.7本章小结

参考文献

第8章JZSearch大数据精准搜索引擎

8.1概述

8.2 JZSearch大数据搜索引擎系统架构

8.3 JZSearch索引关键技术

8.3.1索引字段类型

8.3.2索引词项的设计

8.3.3索引压缩技术

8.3.4内存交换

8.3.5增量索引

8.3.6数据库检索

8.4 JZSearch搜索技术

8.4.1 JZSearch排序算法

8.4.2 JZSearch结果格式

8.4.3 JZSearch检索语法说明

8.5 JZSearch搜索引擎管理

8.5.1搜索引擎可视化管理客户端

8.5.2客户端管理命令语法

8.6 JZSearch大数据搜索应用案例

8.6.1中国邮政集团名址信息中心首页的邮址垂直搜索

8.6.2河北省标准化研究院的标准搜索

8.6.3中国对外承包工程商会的知识搜索门户

8.6.4富基融通的商品比价搜索

8.6.5微博人物搜索

8.6.6维吾尔语搜索

8.7本章小结

参考文献

第9章 面向大数据的句子检索与新颖性监测

9.1概述

9.2句子检索的查询扩展方法

9.2.1语义扩展

9.2.2伪相关反馈扩展

9.2.3局部共现扩展

9.3语言模型检索

9.3.1概述

9.3.2句子级语言模型及其改进

9.4句子检索实验与分析

9.4.1浅层语言分析的贡献度

9.4.2三种句子检索模型的基准实验

9.4.3查询扩展实验

9.5新信息检测

9.5.1词重叠度及其扩展

9.5.2相似度比较方法

9.5.3信息增强评价方法

9.5.4其他方法

9.5.5新信息检测实验与分析

9.6监督学习条件下的句子检索与新信息检测

9.6.1监督学习环境下的参数调整与阈值设置

9.6.2基于分类的句子检索与新信息检测方法

9.6.3实验与分析

9.7本章小结

参考文献

第10章 人物追踪中的数据预处理与属性抽取

10.1概述

10.1.1研究背景

10.1.2人物追踪及其处理流程

10.2数据预处理

10.2.1数据预处理的主要流程

10.2.2网页正文提取与噪声过滤

10.2.3人名识别

10.2.4人名指代处理

10.2.5人物对应语段的确定

10.2.6时间和时序标签的确定

10.3人物属性抽取

10.3.1人物属性抽取的总体框架

10.3.2标注人物属性抽取语料

10.3.3分类器模型

10.4本章小结

参考文献

第11章 人物模型组织与基于事件的信息处理

11.1概述

11.2人物模型的特征表示

11.2.1属性特征的表示

11.2.2数值特征的表示

11.2.3各项特征的分布规律

11.3人物模型的相似度计算方法

11.3.1基本属性的相似度计算

11.3.2介绍性属性的相似度计算

11.3.3词场的相似度计算

11.3.4人物模型相似度计算

11.4人物模型的同一性判别与合并

11.5实验结果与分析

11.5.1数据集与评测方法

11.5.2实验结果

11.6基于宏观粒度的事件组织

11.6.1宏观粒度事件的特征

11.6.2针对事件特点的话题识别方法

11.6.3基于多层聚类的话题层次化组织方法

11.6.4实验结果与分析

11.7本章小结

参考文献

附录A ICTCLAS/NLPIR 2014汉语分词系统介绍

附录B NLPIR大数据搜索与挖掘共享开发平台


书查询(www.shuchaxun.com)本网页唯一编码:
0de2bfc6bba4c9832f38ddf9ca4697c2#8aacaa36df0f30ae70e8b76ba4590753#60454367#大数据搜索与挖掘_13572130.zip