内容简介
第1章 数据仓库简介
1.1什么是数据仓库
1.1.1数据仓库的定义
1.1.2建立数据仓库的原因
1.2操作型系统与分析型系统
1.2.1操作型系统
1.2.2分析型系统
1.2.3操作型系统和分析型系统对比
1.3数据仓库架构
1.3.1基本架构
1.3.2主要数据仓库架构
1.3.3操作数据存储
1.4抽取-转换-装载
1.4.1数据抽取
1.4.2数据转换
1.4.3数据装载
1.4.4开发ETL系统的方法
1.4.5常见ETL工具
1.5数据仓库需求
1.5.1基本需求
1.5.2数据需求
1.6小结
第2章 数据仓库设计基础
2.1关系数据模型
2.1.1关系数据模型中的结构
2.1.2关系完整性
2.1.3规范化
2.1.4关系数据模型与数据仓库
2.2维度数据模型
2.2.1维度数据模型建模过程
2.2.2维度规范化
2.2.3维度数据模型的特点
2.2.4星型模式
2.2.5雪花模式
2.3 Data Vault模型
2.3.1 Data Vault模型简介
2.3.2 Data Vault模型的组成部分
2.3.3 Data Vault模型的特点
2.3.4 Data Vault模型的构建
2.3.5 Data Vault模型实例
2.4数据集市
2.4.1数据集市的概念
2.4.2数据集市与数据仓库的区别
2.4.3数据集市设计
2.5数据仓库实施步骤
2.6小结
第3章 Hadoop生态圈与数据仓库
3.1大数据定义
3.2 Hadoop简介
3.2.1 Hadoop的构成
3.2.2 Hadoop的主要特点
3.2.3 Hadoop架构
3.3 Hadoop基本组件
3.3.1 HDFS
3.3.2 MapReduce
3.3.3 YARN
3.4 Hadoop生态圈的其他组件
3.5 Hadoop与数据仓库
3.5.1关系数据库的可扩展性瓶颈
3.5.2 CAP理论
3.5.3 Hadoop数据仓库工具
3.6小结
第4章 安装Hadoop
4.1 Hadoop主要发行版本
4.1.1 Cloudera Distribution for Hadoop(CDH)
4.1.2 Hortonworks Data Platform (HDP)
4.1.3 MapR Hadoop
4.2安装Apache Hadoop
4.2.1安装环境
4.2.2安装前准备
4.2.3安装配置Hadoop
4.2.4安装后配置
4.2.5初始化及运行
4.3配置HDFS Federation
4.4离线安装CDH及其所需的服务
4.4.1 CDH安装概述
4.4.2安装环境
4.4.3安装配置
4.4.4 Cloudera Manager许可证管理
4.5小结
第5章 Kettle与Hadoop
5.1 Kettle概述
5.2 Kettle连接Hadoop
5.2.1连接HDFS
5.2.2连接Hive
5.3导出导入Hadoop集群数据
5.3.1把数据从HDFS抽取到RDBMS
5.3.2向Hive表导入数据
5.4执行Hive的HiveQL语句
5.5 MapReduce转换示例
5.6 Kettle提交Spark作业
5.6.1安装Spark
5.6.2配置Kettle向Spark集群提交作业
5.7小结
第6章 建立数据仓库示例模型
6.1业务场景
6.2 Hive相关配置
6.2.1选择文件格式
6.2.2支持行级更新
6.2.3 Hive事务支持的限制
6.3 Hive表分类
6.4向Hive表装载数据
6.5建立数据库表
6.6装载日期维度数据
6.7小结
第7章 数据抽取
7.1逻辑数据映射
7.2数据抽取方式
7.3导出成文本文件
7.4分布式查询
7.5使用Sqoop抽取数据
7.5.1 Sqoop简介
7.5.2 CDH 5.7.0中的Sqoop
7.5.3使用Sqoop抽取数据
7.5.4 Sqoop优化
7.6小结
第8章 数据转换与装载
8.1数据清洗
8.2 Hive简介
8.2.1 Hive的体系结构
8.2.2 Hive的工作流程
8.2.3 Hive服务器
8.2.4 Hive客户端
8.3初始装载
8.4定期装载
8.5 Hive优化
8.6小结
第9章 定期自动执行ETL作业
9.1 crontab
9.2 Oozie简介
9.2.1 Oozie的体系结构
9.2.2 CDH 5.7.0中的Oozie
9.3建立定期装载工作流
9.4建立协调器作业定期自动执行工作流
9.5 Oozie优化
9.6小结
第10章 维度表技术
10.1增加列
10.2维度子集
10.3角色扮演维度
10.4层次维度
10.4.1固定深度的层次
10.4.2递归
10.4.3多路径层次
10.4.4参差不齐的层次
10.5退化维度
10.6杂项维度
10.7维度合并
10.8分段维度
10.9小结
第11章 事实表技术
11.1事实表概述
11.2周期快照
11.3累积快照
11.4无事实的事实表
11.5迟到的事实
11.6累积度量
11.7小结
第12章 联机分析处理
12.1联机分析处理简介
12.1.1概念
12.1.2分类
12.1.3性能
12.2 Impala简介
12.3 Hive、SparkSQL、Impala比较
12.3.1 Spark SQL简介
12.3.2 Hive、Spark SQL、Impala比较
12.3.3 Hive、Spark SQL、Impala性能对比
12.4联机分析处理实例
12.5 Apache Kylin与OLAP
12.5.1 Apache Kylin架构
12.5.2 Apache Kylin安装
12.6小结
第13章 数据可视化
13.1数据可视化简介
13.2 Hue简介
13.2.1 Hue功能快速预览
13.2.2配置元数据存储
13.3 Zeppelin简介
13.3.1 Zeppelin架构
13.3.2 Zeppelin安装配置
13.3.3在Zeppelin中添加MySQL翻译器
13.4 Hue、Zeppelin比较
13.5数据可视化实例
13.6小结