内容简介
第1篇 理论篇
第1章 数据挖掘简介
1.1 数据挖掘的起源、定义及目标
1.2 数据挖掘的发展历程
1.3 SPSS Modeler和Weka基础操作
1.3.1 SPSS Modeler软件简介
1.3.2 建立一个SPSS Modeler项目
1.3.3 Weka软件环境简介
1.3.4 Weka简单操作实例
第2章 数据挖掘方法论
2.1 数据挖掘方法论
2.1.1 CRISP-DM
2.1.2 SEMMA
2.2 数据库中的知识挖掘步骤
2.2.1 字段选择
2.2.2 数据清洗
2.2.3 字段扩充
2.2.4 数据编码
2.2.5 数据挖掘
2.2.6 结果呈现
2.3 案例:运用SPSS Modeler和Weka做客户的信用风险评分模型
2.3.1 案例说明
2.3.2 案例实操
2.3.3 运用SPSS Modeler进行初步的数据挖掘
2.3.4 运用Weka进行数据汇入
2.3.5 Weka自有数据存储格式arff简介
第3章 基本的数据挖掘技术
3.1 描述性统计
3.1.1 案例:通过数据判断客户是否需要新增电话线路
3.1.2 案例:运用描述性统计分析杂志社的客户特征
3.2 可视化技术
3.3 KNN原理及实例
3.3.1 KNN(K最近邻)算法
3.3.2 使用KNN算法计算距离
3.3.3 案例:使用KNN算法向用户推荐电影
3.4 案例:运用Weka的KNN算法对诊断结果进行预测
3.4.1 案例说明
3.4.2 运用Weka中的IBk模型进行预测
3.5 案例:运用SPSS Modeler的KNN算法预测客户是否接受人寿保险推销
3.5.1 案例说明
3.5.2 案例实操
第4章 数据挖掘进阶技术
4.1 数据挖掘的功能分类
4.1.1 描述型数据挖掘(无监督数据挖掘)
4.1.2 预测型数据挖掘(有监督数据挖掘)
4.2 数据挖掘的绩效增益
4.2.1 数据挖掘模型评估指标:正确率、响应率、查全率、F值
4.2.2 数据挖掘模型评估指标:Gain Chart
4.2.3 数据挖掘模型评估指标:Lift Chart
4.2.4 数据挖掘模型评估指标:Profit Chart
4.3 数据挖掘网站
4.3.1 KDnuggets
4.3.2 Kaggle
4.4 案例:评估新产品的促销活动效果
4.4.1 案例说明
4.4.2 数据及字段描述
4.4.3 效能评估方式
4.4.4 比赛结果排名
第2篇 准备篇
第5章 数据预处理
5.1 字段选择
5.1.1 数据整合
5.1.2 数据过滤
5.1.3 案例:运用SPSS Modeler过滤数据
5.2 数据清洗
5.2.1 错误值的检测及处理
5.2.2 案例:运用SPSS Modeler进行错误值的检测及处理
5.2.3 离群值的检测及处理
5.2.4 案例:运用SPSS Modeler进行离群值的检测及处理
5.2.5 缺失值的检测及处理
5.2.6 案例:运用SPSS Modeler进行缺失值的检测及处理
5.3 字段扩充
5.3.1 案例说明
5.3.2 案例:运用SPSS Modeler进行字段扩充及评估对效能的提升
5.4 数据编码
5.4.1 数据转换
5.4.2 数据精简
5.4.3 数据集的切割
第6章 关键变量挖掘技术
6.1 无效变量
6.2 统计方式的变量选择
6.2.1 卡方检验
6.2.2 方差分析(ANOVA检验)及t检验
6.2.3 案例:运用SPSS Modeler进行关键变量挖掘
6.3 模型方式的变量选择
6.3.1 决策树
6.3.2 Logistic回归
第7章 贝叶斯网络
7.1 朴素贝叶斯
7.1.1 独立性假设
7.1.2 概率的离散化
7.2 什么是贝叶斯网络
第8章 线性回归
8.1 简单线性回归
8.2 多元回归
8.3 相关系数
8.4 回归分析案例
8.5 线性回归模型评估
8.5.1 线性回归模型评估指标:MAE、MSE和RMSE
8.5.2 线性回归模型评估指标:R2
8.6 案例:运用SPSS Modeler建立线性回归模型
8.6.1 案例说明
8.6.2 案例实操
第9章 决策树
9.1 ID3决策树模型
9.2 ID3算法
9.2.1 ID3算法的字段选择方式
9.2.2 使用决策树进行分类
9.2.3 决策树与决策规则之间的关系
9.2.4 ID3算法的缺点
9.3 C5.0算法
9.3.1 C5.0算法的字段选择方式
9.3.2 C5.0算法的数值型字段处理方式
9.3.3 C5.0算法的剪枝方法
9.4 CART算法
9.4.1 分类树与回归树
9.4.2 CART分类树的字段选择方式
9.4.3 CART分类树的剪枝作法
9.5 CHAID算法
9.6 案例:运用SPSS Modeler和Weka建立决策树模型
9.6.1 案例说明
9.6.2 案例实操
9.6.3 运用SPSS Modeler建立交互式分类树模型
9.6.4 运用Weka建立交互式分类树模型
9.7 CART回归树算法
9.7.1 CART回归树的字段选择方式
9.7.2 利用模型树提升CART回归树的效率
9.8 案例:运用SPSS Modeler和Weka建立回归树模型
9.8.1 案例说明
9.8.2 案例实操
9.8.3 使用Weka对比“剪枝”前后的模型
第10章 神经网络
10.1 BP神经网络模型
10.1.1 BP神经网络模型的概念
10.1.2 BP神经网络模型的架构方式
10.2 神经元的组成
10.3 神经网络模型如何传递信息
10.4 修正神经网络模型的权重值及常数项
10.5 BP神经网络模型与Logistic回归、线性回归及非线性回归之间的关系
10.6 案例:运用SPSS Modeler建立类神经网络模型
第11章 Logistic回归
11.1 Logistic回归与BP神经网络的关系
11.2 Logistic回归的字段选择方式
11.2.1 前向法
11.2.2 后向法
11.2.3 逐步法
11.3 案例:运用SPSS Modeler建立Logistic回归模型
11.3.1 案例说明
11.3.2 案例实操
第12章 支持向量机
12.1 数据是线性可分的支持向量机
12.2 数据是线性不可分的支持向量机
12.3 案例:运用SPSS Modeler建立SVM模型
第3篇 关系篇
第13章 聚类分析
13.1 相似性度量
13.1.1 二元变量的相似性度量
13.1.2 类别型变量的相似性度量
13.1.3 数值型变量的相似性度量
13.2 聚类算法
13.2.1 互斥聚类与非互斥聚类算法
13.2.2 分层聚类算法
13.2.3 分割式聚类算法
13.3 分层聚类算法
13.3.1 单一连接法
13.3.2 完全连接法
13.3.3 平均连接法
13.3.4 中心法
13.3.5 Ward's法(华德法)
13.4 分割式聚类算法
13.4.1 K-Means算法
13.4.2 K-Medoids算法
13.4.3 SOM算法
13.4.4 两步法
13.5 集群判断
13.5.1 集群判断方法:R2
13.5.2 集群判断方法:半径R2
13.5.3 集群判断方法:均方根标准差(RMSSTD)
13.6 案例:运用SPSS Modeler建立聚类模型
13.6.1 案例说明
13.6.2 案例实操
第14章 关联规则
14.1 关联规则的概念
14.2 关联规则的评估指标
14.2.1 支持度
14.2.2 置信度
14.3 Apriori算法
14.3.1 暴力法的问题
14.3.2 Apriori算法的理论基础
14.4 Apriori算法实例说明
14.4.1 候选项目组合的产生
14.4.2 候选项目组合的删除
14.5 再谈评估指标
14.5.1 支持度与置信度的问题
14.5.2 提升度指标
14.6 关联规则的延伸
14.6.1 虚拟商品的加入
14.6.2 负向关联规则
14.7 案例:运用SPSS Modeler建立关联规则模型
14.7.1 案例说明
14.7.2 案例实操
第15章 序列模型
15.1 序列模型的概念
15.2 案例:运用SPSS Modeler建立序列模型
15.2.1 案例说明
15.2.2 案例实操