内容简介
第一部分 绪论
第1章 统计机器学习
1.1学习的类型
1.2机器学习任务举例
1.2.1监督学习
1.2.2非监督学习
1.2.3进一步的主题
1.3本书结构
第二部分 概率与统计
第2章 随机变量与概率分布
2.1数学基础
2.2概率
2.3随机变量和概率分布
2.4概率分布的性质
2.4.1期望、中位数和众数
2.4.2方差和标准差
2.4.3偏度、峰度和矩
2.5随便变量的变换
第3章 离散概率分布的实例
3.1离散均匀分布
3.2二项分布
3.3超几何分布
3.4泊松分布
3.5负二项分布
3.6几何分布
第4章 连续概率分布的实例
4.1连续均匀分布
4.2正态分布
4.3伽马分布、指数分布和卡方分布
4.4Beta分布
4.5柯西分布和拉普拉斯分布
4.6t分布和F分布
第5章 多维概率分布
5.1联合概率分布
5.2条件概率分布
5.3列联表
5.4贝叶斯定理
5.5协方差与相关性
5.6独立性
第6章 多维概率分布的实例
6.1多项分布
6.2多元正态分布
6.3狄利克雷分布
6.4威沙特分布
第7章 独立随机变量之和
7.1卷积
7.2再生性
7.3大数定律
7.4中心极限定理
第8章 概率不等式
8.1联合界
8.2概率不等式
8.2.1马尔可夫不等式和切尔诺夫不等式
8.2.2坎泰利不等式和切比雪夫不等式
8.3期望不等式
8.3.1琴生不等式
8.3.2赫尔德不等式和施瓦茨不等式
8.3.3闵可夫斯基不等式
8.3.4康托洛维奇不等式
8.4独立随机变量和的不等式
8.4.1切比雪夫不等式和切尔诺夫不等式
8.4.2霍夫丁不等式和伯恩斯坦不等式
8.4.3贝内特不等式
第9章 统计估计
9.1统计估计基础
9.2点估计
9.2.1参数密度估计
9.2.2非参数密度估计
9.2.3回归和分类
9.2.4模型选择
9.3区间估计
9.3.1基于正态样本期望的区间估计
9.3.2bootstrap置信区间
9.3.3贝叶斯置信区间
第10章 假设检验
10.1假设检验基础
10.2正态样本期望的检验
10.3尼曼-皮尔森引理
10.4列联表检验
10.5正态样本期望差值检验
10.5.1无对应关系的两组样本
10.5.2有对应关系的两组样本
10.6秩的无参检验
10.6.1无对应关系的两组样本
10.6.2有对应关系的两组样本
10.7蒙特卡罗检验
第三部分 统计模式识别的生成式方法
第11章 通过生成模型估计的模式识别
11.1模式识别的公式化
11.2统计模式识别
11.3分类器训练的准则
11.3.1最大后验概率规则
11.3.2最小错误分类率准则
11.3.3贝叶斯决策规则
11.3.4讨论
11.4生成式方法和判别式方法
第12章 极大似然估计
12.1定义
12.2高斯模型
12.3类-后验概率的计算
12.4Fisher线性判别分析
12.5手写数字识别
12.5.1预备知识
12.5.2线性判别分析的实现
12.5.3多分类器方法
第13章 极大似然估计的性质
13.1一致性
13.2渐近无偏性
13.3渐近有效性
13.3.1一维的情况
13.3.2多维的情况
13.4渐近正态性
13.5总结
第14章 极大似然估计的模型选择
14.1模型选择
14.2KL散度
14.3AIC信息论准则
14.4交叉检验
14.5讨论
第15章 高斯混合模型的极大似然估计
15.1高斯混合模型
15.2极大似然估计
15.3梯度上升算法
15.4EM算法
第16章 非参数估计
16.1直方图方法
16.2问题描述
16.3核密度估计
16.3.1Parzen窗法
16.3.2利用核的平滑
16.3.3带宽的选择
16.4最近邻密度估计
16.4.1最近邻距离
16.4.2最近邻分类器
第17章 贝叶斯推理
17.1贝叶斯预测分布
17.1.1定义
17.1.2与极大似然估计的比较
17.1.3计算问题
17.2共轭先验
17.3最大后验估计
17.4贝叶斯模型选择
第18章 边缘相似的解析近似
18.1拉普拉斯近似
18.1.1高斯密度估计
18.1.2例证
18.1.3应用于边际似然逼近
18.1.4贝叶斯信息准则
18.2变分近似
18.2.1变分贝叶斯最大期望算法
18.2.2与一般最大期望法的关系
第19章 预测分布的数值近似
19.1蒙特卡罗积分
19.2重要性采样
19.3采样算法
19.3.1逆变换采样
19.3.2拒绝采样
19.3.3马尔可夫链蒙特卡罗方法
第20章 贝叶斯混合模型
20.1高斯混合模型
20.1.1贝叶斯公式化
20.1.2变分推断
20.1.3吉布斯采样
20.2隐狄利克雷分配模型
20.2.1主题模型
20.2.2贝叶斯公式化
20.2.3吉布斯采样
第四部分 统计机器学习的判别式方法
第21章 学习模型
21.1线性参数模型
21.2核模型
21.3层次模型
第22章 最小二乘回归
22.1最小二乘法
22.2线性参数模型的解决方案
22.3最小二乘法的特性
22.4大规模数据的学习算法
22.5层次模型的学习算法
第23章 具有约束的最小二乘回归
23.1子空间约束的最小二乘
23.2l2约束的最小二乘
23.3模型选择
第24章 稀疏回归
24.1l1约束的最小二乘
24.2解决l1约束的最小二乘
24.3稀疏学习的特征选择
24.4若干扩展
24.4.1广义l1约束最小二乘
24.4.2lp约束最小二乘
24.4.3l1+l2约束最小二乘
24.4.4l1,2约束最小二乘
24.4.5迹范数约束最小二乘
第25章 稳健回归
25.1l2损失最小化的非稳健性
25.2l1损失最小化
25.3Huber损失最小化
25.3.1定义
25.3.2随机梯度算法
25.3.3迭代加权最小二乘
25.3.4l1约束Huber损失最小化
25.4Tukey损失最小化
第26章 最小二乘分类器
26.1基于最小二乘回归的分类器
26.2 0/1损失和间隔
26.3多类分类器
第27章 支持向量分类
27.1最大间隔分类
27.1.1硬间隔支持向量分类
27.1.2软间隔支持向量分类
27.2支持向量分类的对偶最优化问题
27.3对偶解的稀疏性
27.4使用核技巧的非线性模型
27.5多类扩展
27.6损失最小化观点
27.6.1Hinge损失最小化
27.6.2平方Hinge损失最小化
27.6.3Ramp损失最小化
第28章 概率分类法
28.1Logistic回归
28.1.1Logistic模型与极大似然估计
28.1.2损失最小化的观点
28.2最小二乘概率分类
第29章 结构化分类
29.1序列分类器
29.2序列的概率分类
29.2.1条件随机场
29.2.2极大似然估计
29.2.3递归计算
29.2.4新样本预测
29.3序列的确定性分类
第五部分 高级主题
第30章 集成学习
30.1决策树桩分类器
30.2bagging算法
30.3boosting算法
30.3.1adaboost算法
30.3.2损失最小化观点
30.4泛化集成学习
第31章 在线学习
31.1随机梯度下降法
31.2被动攻击学习
31.2.1分类
31.2.2回归
31.3加权向量的自适应正则化
31.3.1参数的不确定性
31.3.2分类
31.3.3回归
第32章 预测的置信度
32.1l2正则化最小二乘的预测方差
32.2bootstrap法置信区间估计
32.3应用
32.3.1时间序列预测
32.3.2调整参数的优化
第33章 半监督学习
33.1流形正则化
33.1.1输入样本的流形结构
33.1.2计算解决方案
33.2协变量移位的适应
33.2.1重要度加权学习
33.2.2相对重要度加权学习
33.2.3重要度加权交叉检验
33.2.4重要度估计
33.3类别平衡变化下的适应
33.3.1类别平衡加权学习
33.3.2类别平衡估计
第34章 多任务学习
34.1任务相似度正则化
34.1.1公式化
34.1.2解析解
34.1.3多任务的有效计算方法
34.2多维函数学习
34.2.1公式化
34.2.2有效的分析解决方案
34.3矩阵正则化
34.3.1参数矩阵正则化
34.3.2迹范数正则化的梯度法
第35章 线性降维
35.1维度灾难
35.2无监督降维法
35.2.1主成分分析
35.2.2局部保留投影
35.3分类的线性判别分析
35.3.1Fisher判别分析法
35.3.2局部Fisher判别分析法
35.3.3半监督局部Fisher判别分析法
35.4回归问题的充分降维
35.4.1信息论公式化
35.4.2直接导数估计
35.5矩阵插补
第36章 非线性降维
36.1利用核技巧的降维
36.1.1核主成分分析
36.1.2拉普拉斯特征映射
36.2通过神经网络的监督降维法
36.3通过自编码器的非监督降维法
36.3.1自编码器
36.3.2通过梯度下降法的训练
36.3.3稀疏自编码器
36.4通过受限玻尔兹曼机的非监督降维法
36.4.1模型
36.4.2通过梯度下降法的训练
36.5深度学习
第37章 聚类
37.1k均值聚类
37.2核k均值聚类
37.3谱聚类
37.4调谐参数的选择
第38章 异常检测
38.1密度估计和局部异常因子
38.2支持向量数据描述
38.3基于正常值的异常检测
第39章 变化检测
39.1基于分布模型的变化检测
39.1.1KL散度
39.1.2Pearson散度
39.1.3L2距离
39.1.4L1距离
39.1.5最大均值差异
39.1.6能量距离
39.1.7时序变化检测的应用
39.2基于结构模型的变化检测
39.2.1稀疏极大似然估计
39.2.2稀疏密度比估计
参考文献
索引