内容简介
第0章 引言
0.1大数据的定义
0.2大数据VS小数据
0.3大数据在哪里
0.4大数据最常见的目的是产生小数据
0.5机会
0.6大数据成为信息宇宙的中心
第1章 为非结构化数据提供结构
1.1背景
1.2机器翻译
1.3自动编码
1.4索引
1.5术语提取
第2章 标识、去标识和重标识
2.1背景
2.2标识符系统的特征
2.3注册唯一对象标识符
2.4糟糕的标识方法
2.5在标识符中嵌入信息:不推荐
2.6单向哈希函数
2.7案例:医院登记
2.8去标识化
2.9数据清洗
2.10重标识
2.11经验教训
第3章 本体论和语义学
3.1背景
3.2分类:最简单的本体
3.3本体:有多个父类的类
3.4分类模型选择
3.5资源描述框架模式简介
3.6本体开发的常见陷阱
第4章 内省
4.1背景
4.2自我认知
4.3可扩展标记语言
4.4 meaning简介
4.5命名空间与有意义的声明集合体
4.6资源描述框架三元组
4.7映射
4.8案例:可信时间戳
4.9总结
第5章 数据集成和软件互操作性
5.1背景
5.2调查标准委员会
5.3标准轨迹
5.4规范与标准
5.5版本控制
5.6合规问题
5.7大数据资源接口
第6章 不变性和永久性
6.1背景
6.2不变性和标识符
6.3数据对象
6.4遗留数据
6.5数据产生数据
6.6跨机构协调标识符
6.7零知识协调
6.8管理者的负担
第7章 测量
7.1背景
7.2计数
7.3基因计数
7.4处理否定
7.5理解控制
7.6测量的实践意义
7.7强迫症:伟大数据管理员的标志
第8章 简单有效的大数据技术
8.1背景
8.2观察数据
8.3数据范围
8.4分母
8.5频率分布
8.6均值和标准差
8.7估计分析
8.8案例:用谷歌Ngram发现数据趋势
8.9案例:预测观众的电影偏好
第9章 分析
9.1背景
9.2分析任务
9.3聚类、分类、推荐和建模
9.3.1聚类算法
9.3.2分类算法
9.3.3推荐算法
9.3.4建模算法
9.4数据约简
9.5数据标准化和调整
9.6大数据软件:速度和可扩展性
9.7寻找关系而非相似之处
第10章 大数据分析中的特殊注意事项
10.1背景
10.2数据搜索理论
10.3理论搜索中的数据
10.4过度拟合
10.5巨大的偏差
10.6数据太多
10.7数据修复
10.8大数据的数据子集:不可加和不传递
10.9其他大数据缺陷
第11章 逐步走进大数据分析
11.1背景
11.2步骤1:制定一个问题
11.3步骤2:资源评价
11.4步骤3:重新制定一个问题
11.5步骤4:查询输出充分性
11.6步骤5:数据描述
11.7步骤6:数据约简
11.8步骤7:必要时选择算法
11.9步骤8:结果评估和结论断言
11.10步骤9:结论审查和验证
第12章 失败
12.1背景
12.2失败很常见
12.3失败的标准
12.4复杂性
12.5复杂性何时起作用
12.6冗余失败的情况
12.7保护钱,不保护无害信息
12.8失败之后
12.9案例:癌症生物医学信息学网格——遥远的桥
第13章 合法性
13.1背景
13.2对数据的准确性和合法性负责
13.3创建、使用和共享资源的权利
13.4因使用标准而招致的版权和专利侵权行为
13.5对个人的保护
13.6许可问题
13.7未经许可的数据
13.8好政策是有力保障
13.9案例:哈瓦苏派的故事
第14章 社会问题
14.1背景
14.2大数据感知
14.3数据共享
14.4用大数据降低成本和提高生产效率
14.5公众的疑虑
14.6从自己做起
14.7傲慢和夸张
第15章 未来
15.1背景
15.1.1大数据计算复杂,需要新一代超级计算机?
15.1.2大数据的复杂程度将超出我们完全理解或信任的能力范围?
15.1.3我们需要用超级计算中的最新技术训练出一支计算机科学家组成的团队吗?
15.1.4大数据会创建出那些目前没有训练程序的新型数据专业人员吗?
15.1.5是否有将数据表示方法通过统一的标准规范化,从而支持跨网络大数据资源的数据集成和软件互操作性的可能?
15.1.6大数据将向公众开放
15.1.7大数据弊大于利?
15.1.8我们可以预测大数据灾难会破坏至关重要的服务、削弱国家经济、破坏世界政治的稳定吗?
15.1.9大数据可以回答那些其他办法不能解决的问题吗?
15.2后记
术语表
参考文献
索引