内容简介
第一部分 引论
第1章 引论
1.1 序言
1.2 数据科学简述
1.2.1 数据科学的定义
1.2.2 数据科学的由来
1.2.3 数据科学的研究范畴
1.2.4 数据科学的学习意义
1.3 本书结构
第二部分 大数据及其产生根源
第2章 数据
2.1 数据的定义
2.1.1 数据的定义
2.1.2 其他相关概念
2.2 数据简史
第3章 大数据的概念和特征
3.1 大数据的概念
3.2 大数据的4V特性
3.2.1 体量(Volume)
3.2.2 多样性(Variety)
3.2.3 价值/真实性(Value/Veracity)
3.2.4 速度(Velocity)
3.2.5 对4V特性的体会
第4章 大数据的产生根源
4.1 大数据的产生根源
4.1.1 大数据时代出现的技术基础
4.1.2 大数据时代出现的数据基础
4.2 大数据简史
4.3 大数据时代的挑战
4.3.1 数据规模
4.3.2 数据的多样性和异构性
4.3.3 数据的不可靠问题
4.3.4 数据的实时性要求
4.3.5 数据隐私问题
4.3.6 人机协作问题
4.3.7 数据的访问与共享
4.3.8 数据运用的合理性
4.3.9 小结
第三部分 大数据研究的重要性
第5章 大数据研究的现状
5.1 政府篇
5.1.1 联合国的大数据研究
5.1.2 美国的大数据研究
5.1.3 欧盟的大数据研究
5.2 企业篇
5.2.1 谷歌
5.2.2 IBM
5.2.3 百度
5.2.4 阿里巴巴
5.2.5 腾讯
第6章 关联分析
6.1 啤酒与尿布
6.1.1 案例详析
6.1.2 购物篮分析法
6.1.3 商品间相关性分析
6.1.4 外界因素的影响
6.1.5 思维启示
6.2 亚马逊的个性化推荐
6.2.1 案例详析
6.2.2 亚马逊的推荐方式
6.2.3 推荐算法
6.3 潘多拉音乐组计划
6.3.1 案例详析
6.3.2 标签的运用
6.4 塔吉特的大数据营销
6.4.1 案例详析
6.4.2 思维启示——数据应用已经渗入生活的方方面面
第7章 趋势预测
7.1 “搜索+比价”
7.1.1 Farecast案例详析
7.1.2 Decide案例详析
7.1.3 思维启示
7.2 Twitter与对冲基金
7.2.1 案例详析
7.2.2 思维启示:数据可以预测趋势与规律
7.3 疾病预测
7.3.1 谷歌流感趋势
7.3.2 其他案例
7.3.3 思维启示
7.4 电影票房预测
7.4.1 案例详析
7.4.2 工作模式
7.4.3 思维启示:简单的就是最好的
7.5 奥斯卡预测
7.5.1 案例详析
7.5.2 思维启示:大数据可以做预测
第8章 决策支持
8.1 《纸牌屋》
8.1.1 案例详析
8.1.2 大数据的运用方式
8.1.3 思维启示
8.2 美国总统大选
8.2.1 案例详析
8.2.2 大数据的运用方式
8.2.3 思维启示
第9章 模式创新
9.1 大数据与反恐
9.1.1 美国“棱镜”计划
9.1.2 加拿大的“棱镜门”
9.1.3 思维启示
9.2 利用大数据打击犯罪
9.2.1 “先知”系统
9.2.2 “犯罪数据分析和趋势预测系统”
9.3 大数据与破案
9.3.1 《源代码》
9.4 大数据的其他运用方式
9.4.1 大数据与纽约沙井盖维护
9.4.2 大数据帮助寻根问祖
第四部分 数据科学的研究方式
第10章 数据密集型研究方法
10.1 范式和范式的演化过程
10.1.1 范式的定义
10.1.2 范式的演变过程
10.2 第四范式兴起的社会根源
10.2.1 数据洪流的到来
10.2.2 科学界对海量数据的关注
10.2.3 关联数据运动
10.2.4 政府数据开放运动
10.3 对第四范式的分析
10.3.1 科学数据与科学研究的问题
10.3.2 解决方案
10.4 数据科学研究的一般流程
第11章 数据的获取和预处理
11.1 数据的获取
11.1.1 数据的类型
11.1.2 网络爬虫技术
11.2 数据预处理的目的
11.3 数据清洗
11.3.1 填补空缺值
11.3.2 平滑噪声数据
11.4 数据集成
11.4.1 多信息源的匹配
11.4.2 冗余数据的处理
11.5 数据变换
11.5.1 数据规范化
11.6 数据归约
11.6.1 数据立方体聚集
11.6.2 维归约
11.6.3 特征值归约
第12章 数据的存储与管理
12.1 数据的存储
12.1.1 数据存储的发展
12.1.2 大数据对存储带来的挑战
12.1.3 云存储方式
12.2 数据的管理
12.2.1 数据管理的发展阶段
12.2.2 大数据时代数据管理的特点
12.2.3 非关系型数据
12.2.4 开源的NoSQL数据库软件
第13章 数据的处理
13.1 Hadoop
13.1.1 Hadoop的起源
13.1.2 优点
13.1.3 架构
13.1.4 MapReduce流程
13.2 Spark
13.2.1 概述
13.2.2 Spark的特点
13.2.3 编程模型
13.2.4 运行和调度
第14章 数据的可视化
14.1 概述
14.2 可视化工具
14.2.1 Excel
14.2.2 Raphael
14.2.3 Visual.ly
14.2.4 Crossfilter
14.2.5 Polymaps
14.2.6 Kartograph
14.2.7 Processing
14.2.8 R
14.2.9 Weka
14.2.10 Gephi
第五部分 数据与未来
第15章 大数据与智慧城市
15.1 概述
15.1.1 智慧城市的定义
15.1.2 智慧城市产生背景
15.2 大数据与智慧城市
15.2.1 智慧城市的基本特征与层次构成
15.2.2 智慧城市建设中所应用的数据科学技术
15.3 智慧城市案例
15.3.1 韩国
15.3.2 日本
15.3.3 美国
15.3.4 爱沙尼亚
15.3.5 荷兰
15.3.6 英国
15.3.7 巴西
第16章 大数据与智慧医疗
16.1 概述
16.2 智慧医疗的范畴
16.2.1 临床操作
16.2.2 付款/定价
16.2.3 研发
16.2.4 新的商业模式
16.2.5 公众健康
16.2.6 给我们的思维模式启示
16.3 大数据与智慧医疗
16.3.1 大数据服务心脏病患者
16.3.2 “魔毯”病人的监控
16.3.3 大数据监测脑外伤病人恢复
16.3.4 大数据帮助实现个性化用药和诊断
16.4 可穿戴技术
16.4.1 可穿戴技术的概念
16.4.2 可穿戴设备简析
16.4.3 可穿戴设备与智慧医疗
16.4.4 思维启示——可穿戴设备的缺陷
第17章 大数据与未来生活
17.1 数据科学家
17.1.1 数据科学家的定义
17.1.2 数据科学家的从业前景
17.2 对未来数据科学发展的探讨
17.2.1 数据不是万能
17.2.2 提防进入数据误区