内容简介
基础篇
1 大数据背景
1.1 大数据时代的到来
1.2 大数据定义及特征
1.3 大数据价值
1.4 大数据备受关注
1.5 大数据带来的挑战
2 大数据基础
2.1 云计算
2.1.1 云计算概述
2.1.2 云计算与大数据的联系
2.2 物联网
2.2.1 物联网概述
2.2.2 物联网与大数据
2.3 数据中心
2.3.1 数据中心概述
2.3.2 数据中心与大数据
进阶篇
3 大数据的生成和采集
3.1 大数据生成
3.1.1 企业内部数据
3.1.2 物联网数据
3.1.3 互联网数据
3.1.4 生物医疗数据
3.1.5 其他科学数据
3.2 大数据采集
3.2.1 数据收集
3.2.2 数据传输
3.2.3 数据预处理
4 大数据存储
4.1 海量存储系统
4.2 分布式存储系统
4.3 大数据存储机制
4.3.1 数据库技术
4.3.2 数据库编程模型
5 大数据分析
5.1 传统数据分析方法
5.2 大数据分析方法
5.3 大数据分析架构
5.4 大数据挖掘和分析软件
实践篇
6 大数据整体解决方案
6.1 大数据解决方案方法论
6.1.1 大数据解决方案参考模型
6.1.2 大数据解决方案分类
6.2 大数据硬件平台
6.2.1 可扩展性设计
6.2.2 可定制性设计
6.3 大数据软件系统
6.3.1 大数据处理系统核心模块
6.3.2 发行版增强功能、企业应用优化和增值服务
6.3.3 基于内存计算的大数据处理系统
6.4 大数据典型处理流程
6.5 大数据一体化解决方案比较
7 分布式文件系统HDFS
7.1 Hadoop I/O操作
7.1.1 I/O操作中的数据检查
7.1.2 数据的压缩
7.1.3 数据的I/O中序列化操作
7.2 Hadoop文件系统
7.3 HDFS体系结构
7.3.1 HDFS的特点和局限
7.3.2 HDFS相关概念
7.3.3 HDFS架构
7.4 HDFS文件结构
7.4.1 NameNode的文件结构
7.4.2 编辑日志(edit log)及文件系统映像(filesystem image)
7.4.3 Secondary NameNode的目录结构
7.4.4 Data Node的目录结构
7.5 HDFS读/写数据流
7.5.1 文件的读取
7.5.2 文件的写入
7.5.3 一致性模型
7.6 HDFS命令详解
7.6.1 通过distcp进行并行复制
7.6.2 HDFS平衡
7.6.3 其他命令
8 并行编程模型MapReduce
8.1 MapReduce体系结构
8.1.1 MapReduce基本模型
8.1.2 MapReduce作业执行流程
8.2 MapReduce关键流程详解
8.2.1 partiton过程
8.2.2 combine过程
8.2.3 shuffle过程
8.3 MapReduce高级应用
8.3.1 二次排序
8.3.2 全排序
8.3.3 分布式缓存
8.3.4 MapReduce小文件处理与文件压缩
8.3.5 MapReduce负载均衡
9 NoSQL数据库HBase
9.1 HBase体系结构
9.2 RowKey的设计与数据访问
9.3 过滤器
9.3.1 比较过滤器
9.3.2 专用过滤器
9.3.3 附加过滤器
9.3.4 FilterList
9.3.5 自定义过滤器
9.4 HBase多维数据访问
9.4.1 通过Filter实现
9.4.2 通过设计RowKey实现
9.5 协处理器Coprocessor
9.5.1 Coprocessor类
9.5.2 协处理器的加载
9.5.3 观察者
9.5.4 终端
9.6 二级索引
9.6.1 全局索引(global index)
9.6.2 本地索引(local index)
10 交互式查询语言Hive
10.1 Hive体系结构
10.1.1 Hive客户端
10.1.2 Metastore
10.2 Hive数据类型
10.2.1 基本类型
10.2.2 复杂类型
10.3 Hive存储方式和压缩类型
10.3.1 托管表和外部表
10.3.2 存储方式
10.4 Hive关键技术
10.4.1 HiveQL简介
10.4.2 Hive表的创建
10.4.3 Hive表的数据加载
10.4.4 Hive表的查询
10.4.5 Hive表的更改
10.4.6 Hive表的删除
10.4.7 Hive表的分区
10.4.8 Hive表的分桶
10.4.9 用户定义函数
10.5 Hive优化技术
10.5.1 Join优化
10.5.2 数据倾斜优化
10.5.3 Map和Reduce个数控制
11 资源管理和调度框架——YARN
11.1 MRv1架构面临的问题
11.2 YARN架构
11.2.1 YARN整体架构
11.2.2 RM组件的作用
11.2.3 AM组件的作用
11.2.4 NM组件的作用
11.2.5 运行在YARN上的计算框架
11.2.6 在YARN上定制计算框架
11.3 YARN管理后台简介
11.4 YARN资源调度
12 内存计算引擎Spark
12.1 Spark简介
12.2 Spark整体架构
12.3 Spark核心概念
12.3.1 弹性分布式数据集
12.3.2 RDD模型的优点
12.3.3 Spark DAG
12.4 Spark编程模型
12.4.1 Spark初始化
12.4.2 RDDs
12.4.3 Shared Variables
12.5 Spark相关组件
12.6 Spark应用实例
12.6.1 In-Memory Analytics
12.6.2 Traffic Modeling
12.6.3 Twitter Spam Classification
应用篇
13 大数据应用
13.1 大数据应用演化
13.2 大数据分析的关键领域
13.2.1 结构化数据分析
13.2.2 文本分析
13.2.3 Web分析
13.2.4 多媒体分析
13.2.5 网络分析
13.2.6 移动分析
14 大数据案例分析
14.1 物联网大数据
14.1.1 物联网大数据的表示
14.1.2 物联网大数据的预处理
14.1.3 物联网大数据的快速处理
14.1.4 物联网大数据的并行分析
14.1.5 物联网大数据处理平台的搭建
14.2 其他大数据的典型应用
14.2.1 企业级应用
14.2.2 社交网络大数据
14.2.3 医疗健康
14.2.4 群智感知
14.2.5 智能电网
15 总结
15.1 大数据的研究热点及研究方向
15.1.1 基础理论研究
15.1.2 关键技术研究
15.1.3 应用实践研究
15.1.4 数据安全研究
15.2 展望
参考文献