主页 详情

《大数据技术基础》_中科普开编著_14075202_9787302437574

【书名】:《大数据技术基础》
【作者】:中科普开编著
【出版社】:北京:清华大学出版社
【时间】:2016
【页数】:248
【ISBN】:9787302437574
【SS码】:14075202

最新查询

内容简介

第1章 大数据概论

1.1 大数据时代背景

1.1.1 大数据的数据源

1.1.2 大数据的价值和影响

1.1.3 大数据技术应用场景

1.1.4 大数据技术的发展前景

1.2 大数据基本概念

1.2.1 大数据定义

1.2.2 大数据结构类型

1.2.3 大数据核心特征

1.2.4 大数据技术

1.2.5 行业应用大数据实例

1.3 大数据系统

1.3.1 设计目标和原则

1.3.2 当前大数据系统

1.4 大数据与企业

1.4.1 大数据对企业的挑战性

1.4.2 企业大数据的发展方向

1.4.3 企业大数据观

本章小结

习题

第2章 初识Hadoop

2.1 Hadoop简介

2.1.1 Hadoop概况

2.1.2 Hadoop的功能和作用

2.1.3 Hadoop的优势

2.1.4 Hadoop的发展史

2.1.5 Hadoop的应用前景

2.2 深入了解Hadoop

2.2.1 Hadoop的体系结构

2.2.2 Hadoop与分布式开发

2.2.3 Hadoop生态系统

2.3 Hadoop与其他系统

2.3.1 Hadoop与关系型数据库管理系统

2.3.2 Hadoop与云计算

2.4 Hadoop应用案例

2.4.1 Hadoop在百度的应用

2.4.2 Hadoop在Yahoo!的应用

2.4.3 Hadoop在eBay的应用

本章小结

习题

第3章 认识HDFS

3.1 HDFS简介

3.2 HDFS的特性和设计目标

3.2.1 HDFS的特性

3.2.2 HDFS的设计目标

3.3 HDFS的核心设计

3.3.1 数据块

3.3.2 数据复制

3.3.3 数据副本的存放策略

3.3.4 机架感知

3.3.5 安全模式

3.3.6 负载均衡

3.3.7 心跳机制

3.4 HDFS的体系结构

3.4.1 Master/Slave架构

3.4.2 NameNode、SecondaryNameNode、DataNode

本章小结

习题

第4章 HDFS的运行机制

4.1 HDFS中数据流的读写

4.1.1 RPC实现流程

4.1.2 RPC实现模型

4.1.3 文件的读取

4.1.4 文件的写入

4.1.5 文件的一致模型

4.2 HDFS的HA机制

4.2.1 为什么有HA机制

4.2.2 HA集群和架构

4.3 HDFS的Federation机制

4.3.1 为什么引入Federation机制

4.3.2 Federation架构

4.3.3 多命名空间管理

本章小结

习题

第5章 访问HDFS

5.1 命令行常用接口

5.1.1 HDFS操作体验

5.1.2 HDFS常用命令

5.2 Java接口

5.2.1 从Hadoop URL中读取数据

5.2.2 通过FileSystem API读取数据

5.2.3 写入数据

5.2.4 创建目录

5.2.5 查询文件系统

5.2.6 删除数据

5.3 其他常用接口

5.3.1 Thrift

5.3.2 C语言

5.3.3 HTTP

本章小结

习题

第6章 Hadoop I/O详解

6.1 数据完整性

6.1.1 HDFS的数据完整性

6.1.2 验证数据完整性

6.2 文件压缩

6.2.1 Hadoop支持的压缩格式

6.2.2 压缩-解压缩算法codec

6.2.3 压缩和输入分片

6.3 文件序列化

6.3.1 Writable接口

6.3.2 WritableComparable接口

6.3.3 Writable实现类

6.3.4 自定义Writable接口

6.3.5 序列化框架

6.4 Hadoop文件的数据结构

6.4.1 SequenceFile存储

6.4.2 MapFile存储

本章小结

习题

第7章 识识MapReduce编程模型

7.1 MapReduce编程模型简介

7.1.1 什么是MapReduce

7.1.2 MapReduce程序的设计方法

7.1.3 新旧MapReduce简介

7.1.4 Hadoop MapReduce架构

7.1.5 MapReduce的优缺点

7.2 WordCount编程实例

7.2.1 WordCount的设计思路

7.2.2 编写WordCount代码

7.2.3 运行程序

7.2.4 代码讲解

7.3 MapReduce的编程

7.3.1 配置开发环境

7.3.2 编写Mapper类

7.3.3 编写Reducer类

7.3.4 编写main函数

7.4 MapReduce在集群上的运作

7.4.1 作业的打包和启动

7.4.2 MapReduce的Web界面

7.4.3 获取结果

本章小结

习题

第8章 MapReduce应用编程开发

8.1 MapReduce类型与格式

8.1.1 MapReduce的类型

8.1.2 输入格式

8.1.3 输出格式

8.2 Java API解析

8.2.1 作业配置与提交

8.2.2 InputFormat接口的设计与实现

8.2.3 OutputFormat接口的设计与实现

8.2.4 Mapper与Reducer解析

本章小结

习题

第9 MapReduce的工作机制与YARN平台

9.1 YARN平台简介

9.1.1 YARN的诞生

9.1.2 YARN的作用

9.2 YARN的架构

9.2.1 ResourceManager

9.2.2 ApplicationMaster

9.2.3 NodeManager

9.2.4 资源模型

9.2.5 ResourceRequest和Container

9.2.6 Container规范

9.3 剖析MapReduce作业运行机制

9.4 基于YARN的运行机制剖析

9.5 Shuffle和排序

9.5.1 map端

9.5.2 reduce端

9.6 任务的执行

9.6.1 任务执行环境

9.6.2 推测执行

9.6.3 关于OutputCommitters

9.6.4 任务JVM重用

9.6.5 跳过坏记录

9.7 作业的调度

9.7.1 公平调度器

9.7.2 容量调度器

9.8 在YARN上运行MapReduce实例

9.8.1 运行Pi实例

9.8.2 使用Web GUI监控实例

本章小结

习题

第10章 MapReduce高级开发

10.1 计数器

10.1.1 内置计数器

10.1.2 自定义的Java计数器

10.2 数据去重

10.2.1 实例描述

10.2.2 设计思路

10.2.3 程序代码

10.3 排序

10.3.1 实例描述

10.3.2 设计思路

10.3.3 程序代码

10.4 二次排序

10.4.1 二次排序原理

10.4.2 二次排序的算法流程

10.4.3 代码实现

10.5 平均值

10.5.1 实例描述

10.5.2 设计思路

10.5.3 程序代码

10.6 Join联接

10.6.1 Map端Join

10.6.2 Reduce端Join

10.6.3 Join实现表关联

10.7 倒排索引

10.7.1 倒排索引的分析和设计

10.7.2 倒排索引完整源码

10.7.3 运行代码结果

本章小结

习题

第11章 MapReduce实例

11.1 搜索引擎日志处理

11.1.1 背景介绍

11.1.2 数据收集

11.1.3 数据结构

11.1.4 需求分析

11.1.5 MapReduce编码实现

11.2 汽车销售数据分析

11.2.1 背景介绍

11.2.2 数据收集

11.2.3 数据结构

11.2.4 需求分析

11.2.5 MapReduce编码实现

11.3 农产品价格分析

11.3.1 背景介绍

11.3.2 数据收集

11.3.3 数据结构

11.3.4 需求分析

11.3.5 MapReduce编码实现

参考文献


书查询(www.shuchaxun.com)本网页唯一编码:
0271bb13588f68c20e384c55c89881dc#b6b09908b40c52a66837d35b08d9c9be#61738060#14075202.pdf