内容简介
第1章 统计分析与并行计算
1.1 并行计算与并行计算机
1.2 统计计算的并行原理——以矩阵乘法为例
1.3 基于R的单机并行计算
1.4 基于Python的单机并行计算
1.5 大数据背景下的数据采集和存储
1.6 参考文献
第2章 Hadoop基础
2.1 Hadoop历史、生态系统
2.2 Hadoop的分布式文件系统(HDFS)
2.3 MapReduce工作原理
2.4 Hadoop上运行MapReduce
2.5 MapReduce实例:分层随机抽样
2.6 MapReduce实例:聚类分析
2.7 参考文献
第3章 基于Hadoop的分布式算法和模型实现
3.1 R中实现Hadoop分布式计算
3.2 Mahout与大数据机器学习
3.3 利用Mahout进行数据挖掘
3.4 Mahout实例:Logistics回归和随机森林分类算法
3.5 Mahout实例:随机森林的分布式实现
3.6 参考文献
第4章 统计模型的MapReduce实现详解
4.1 泊松回归模型:付费搜索广告分析
4.2 判别分析:气象因素对雾霾影响分析
4.3 分块Logistics回归
4.4 文本分类
4.5 朴素贝叶斯模型
4.6 岭回归模型
4.7 推荐系统
4.8 参考文献
第5章 分布式文件访问与计算
5.1 Hive基础
5.2 HiveQL数据定义(DDL)
5.3 HBase
5.4 Hive实例:FoodMart案例
5.5 Hive实例:Hive Streaming交互计算
5.6 参考文献
第6章 Spark与统计模型
6.1 Spark简介
6.2 Spark工作原理介绍
6.3 Pyspark命令介绍
6.4 Spark实例:通过Word Count了解Spark工作流程
6.5 Spark实例:二分类学习
6.6 Spark实例:决策树模型
6.7 参考文献
附录A Hadoop安装运行
A.1 单机伪分布式安装
A.2 全分布式集群
附录B Mahout安装与运行
附录C Hive安装运行
C.1 准备
C.2 安装Hive
C.3 配置Hive
附录D HBase安装运行
D.1 安装配置HBase
D.2 启动HBase
附录E Spark的配置与安装
E.1 安装配置Scala
E.2 安装配置Spark