内容简介
引子
第一篇 支持高效的运营
第1章 方案设计和技术选型:分类
1.1分类的基本概念
1.2分类任务的处理流程
1.3算法:朴素贝叶斯和K最近邻
1.3.1朴素贝叶斯
1.3.2 K最近邻
1.4分类效果评估
1.5相关软件:R和Mahout
1.5.1 R简介
1.5.2 Mahout简介
1.5.3 Hadoop简介
1.6案例实践
1.6.1实验环境设置
1.6.2中文分词
1.6.3使用R进行朴素贝叶斯分类
1.6.4使用R进行K最近邻分类
1.6.5单机环境使用Mahout运行朴素贝叶斯分类
1.6.6多机环境使用Mahout运行朴素贝叶斯分类
1.7更多的思考
第2章 方案设计和技术选型:聚类
2.1聚类的基本概念
2.2算法:K均值和层次型聚类
2.2.1 K均值聚类
2.2.2层次型聚类
2.3聚类的效果评估
2.4案例实践
2.4.1使用R进行K均值聚类
2.4.2使用Mahout进行K均值聚类
第3章 方案设计和技术选型:因变量连续的回归分析
3.1线性回归的基本概念
3.2案例实践
3.2.1实验环境设置
3.2.2 R中数据的标准化
3.2.3使用R的线性回归分析
第二篇 为顾客发现喜欢的商品:基础篇
第4章 方案设计和技术选型:搜索
4.1搜索引擎的基本概念
4.1.1相关性
4.1.2及时性
4.2搜索引擎的评估
4.3为什么不是数据库
4.4系统框架
4.4.1离线预处理
4.4.2在线查询
4.5常见的搜索引擎实现
4.5.1 Lucene简介
4.5.2 Solr简介
4.5.3 Elasticsearch简介
4.6案例实践
4.6.1实验环境设置
4.6.2基于Solr的实现
4.6.3基于Elasticsearch的实现
4.6.4统一的搜索API
第三篇 为顾客发现喜欢的商品:高级篇
第5章 方案设计和技术选型:NoSQL和搜索的整合
5.1问题分析
5.2 HBase简介
5.3结合HBase和搜索引擎
5.4案例实践
5.4.1实验环境设置
5.4.2 HBase的部署
5.4.3 HBase和搜索引擎的集成
第6章 方案设计和技术选型:查询分类和搜索的整合
6.1问题分析
6.2结合分类器和搜索引擎
6.3案例实践
6.3.1实验环境设置
6.3.2构建查询分类器
6.3.3定制化的搜索排序
6.3.4整合查询分类和定制化排序
第7章 方案设计和技术选型:个性化搜索
7.1问题分析
7.2结合用户画像和搜索引擎
7.3案例实践
7.3.1用户画像的读取
7.3.2个性化搜索引擎
7.3.3结果对比
第8章 方案设计和技术选型:搜索分片
8.1问题分析
8.2利用搜索的分片机制
8.3案例实践
8.3.1 Solr路由的实现
8.3.2 Elasticsearch路由的实现
第9章 方案设计和技术选型:搜索提示
9.1问题分析
9.2案例实践:基础方案
9.2.1 Solr搜索建议和拼写纠错的实现
9.2.2 Elasticsearch搜索建议和拼写纠错的实现
9.3改进方案
9.4案例实践:改进方案
第10章 方案设计和技术选型:推荐
10.1推荐系统的基本概念
10.2推荐的核心要素
10.2.1系统角色
10.2.2相似度
10.2.3相似度传播框架
10.3推荐系统的分类
10.4混合模型
10.5系统架构
10.6 Mahout中的推荐算法
10.7电商常见的推荐系统方案
10.7.1电商常见的推荐系统方案
10.7.2相似度的计算
10.7.3协同过滤
10.7.4结果的查询
10.8案例实践
10.8.1基于内容特征的推荐
10.8.2基于行为特征的推荐
第四篇 获取数据,跟踪效果
第11章 方案设计和技术选型:行为跟踪
11.1基本概念
11.1.1网站的核心框架
11.1.2行为数据的类型
11.1.3行为数据的模式
11.1.4设计理念
11.2使用谷歌分析
11.3自行设计之Flume、 HDFS和Hive的整合
11.3.1数据的收集——Flume简介
11.3.2数据的存储——H adoopHDFS回顾
11.3.3批量数据分析——Hive简介
11.3.4 Flume、 HDFS和Hive的整合方案
11.4自行设计之Flume、 Kafka和Storm的整合
11.4.1实时性数据分析之Kafka简介
11.4.2实时性数据分析之Storm简介
11.4.3 Flume、Kafka和Storm的整合方案
11.5案例实践
11.5.1数据模式的设计
11.5.2实验环境设置
11.5.3谷歌分析实战
11.5.4自主设计实战之Flume、HDFS和Hive的整合
11.5.5自主设计实战之Flume、Kafka和Storm的整合
11.6更多的思考
后记