前言
我正在撰写一本异乎寻常的超长巨著,因为没有足够的时间撰写一本短小精悍的书。
布莱斯·帕斯卡
本书是《概率机器学习(基础篇)》\[Mur22\]的进阶篇,旨在对机器学习中的各种主题进行更深入的研究。《概率机器学习(基础篇)》主要聚集于学习形如f:XY的函数,其中f是非线性模型(例如深度神经网络),X是可能输入的集合(通常X=RD),并且Y={1,…,C}表示分类问题的标签集,或者Y=R表示回归问题。著名的人工智能研究专家Judea Pearl将这种机器学习称为美化曲线拟合的一种形式(引自文献\[Har18\])。
在本书中,我们扩展了机器学习的范围,以涵盖更具挑战性的问题。例如,我们将考虑在不同的分布下进行训练和测试;我们将考虑如何生成高维输出,例如图像、文本和图形,因此输出空间为Y=R256256;我们还将讨论基于潜在变量模型发现数据洞察力的方法;并讨论如何在不确定性条件下使用概率模型进行因果推理和决策。
本书假设读者之前接触过机器学习和其他相关的数学主题(例如,概率论、统计学、线性代数、优化方法)。有关这些方面的背景知识,可以参考《概率机器学习(基础篇)》\[Mur22\]以及其他若干优秀的参考读物(例如文献\[Lin+21b;DFO20\])。
本书提供的在线网址包含了重现本书中几乎所有图形的Python代码(主要基于JAX)。特别是,如果图题有例如生成该图的代码为gauss_plot_2d.ipynb的内容,那么读者可以在网址probml.github.io/notebooks#gauss_plot_2d.ipynb上找到相应的Jupyter Notebook,并轻松地重新生成相应的图形,还可以通过修改底层源代码更深入地了解其中所使用的方法。(使用Colab,读者可以访问一个免费的GPU,这对一些计算量较大的演示非常有效。)
除了在线代码外,probml.github.io/supp还包含一些额外的补充内容。若需与本书主题相关的练习题(以及相应的参考答案),可以参阅文献\[Gut22\]。
特约作者
本书是众多作者共同努力的结果。特别感谢以下撰写或共同撰写各个章节的同人:
●Alex Alemi(Google),与作者共同撰写了5.1节。
●Jeff Bilmes(华盛顿大学),撰写了6.9节。
●Peter Chang,与作者共同撰写了8.5.1节。
●Marco Cuturi(现任职于Apple公司),任职Google公司期间参与撰写工作,撰写了6.8节。
●Alexander DAmour(Google),与Veitch共同撰写了第36章。
●Finale Doshi-Velez(哈佛大学),与Kim共同撰写了第33章。
●Roy Frostig(Google),撰写了6.2节。
●Justin Gilmer(Google),撰写了19.8节。
●Giles Harper-Donnelly,撰写了8.2.4节。
●Been Kim(Google),与Doshi-Velez共同撰写了第33章。
●Durk Kingma(Google),与Song共同撰写了第24章。
●Simon Kornblith(Google),与Poole共同撰写了第32章。
●Balaji Lakshminarayanan(Google),与Papamakarios共同撰写了第23章,与Mohamed和Rosca共同撰写了第26章。
●Lihong Li(现任职于Amazon公司),任职Google公司期间参与撰写工作,与作者共同撰写了34.4节以及第35章。
●Xinglong Li(UBC),撰写了15.2.9节、29.4.4.1节和29.8.4.1节,以及在线补充资料的31.2.3节。
●Shakir Mohamed(Deepmind),与Lakshminarayanan和Rosca共同撰写了第26章。
●George Papamakarios(Deepmind),与Lakshminarayanan共同撰写了第23章。
●Zeel Patel(印度理工学院甘地纳格尔分校),与作者共同撰写了34.7节。
●Ben Poole(Google),与Kornblith共同撰写了第32章。
●Mihaela Rosca(Deepmind/UCL),共同撰写了第26章。
●Vinayak Rao(普渡大学),撰写了第31章。
●Yang Song(斯坦福大学),与Kingma共同撰写了第24章。
●Victor Veitch(Google/芝加哥大学),与DAmour共同撰写了第36章。
●Andrew Wilson(NYU),与作者共同撰写了第17章以及第18章。
其他贡献者
衷心感谢以下以各种其他方式提供帮助的人员:
●衷心感谢帮助创建和改进本书中图表的人员,包括Aman Atman、Vibhuti Bansal、Shobhit Belwal、Aadesh Desai、Vishal Ghoniya、Anand Hegde、Ankita Kumari Jain、Madhav Kanda、Aleyna Kara、Rohit Khoiwal、Taksh Panchal、Dhruv Patel、Prey Patel、Nitish Sharma、Hetvi Shastri、Mahmoud Soliman以及Gautam Vashishtha。特别感谢Zeel B Patel和Karm Patel,他们为提升图表质量付出了巨大努力。
●感谢2021年谷歌代码之夏(Google Summer of Code,GSOC)的参与者,包括Ming Liang Ang、Aleyna Kara、Gerardo Duran-Martin、Srikar Reddy Jilugu、Drishti Patel以及联合导师Mahmoud Soliman。
●感谢2022年谷歌代码之夏的参与者,包括Peter Chang、Giles Harper-Donnelly、Xinglong Li、Zeel B Patel、Karm Patel、Qingyao Sun,以及联合导师Nipun Batra和Scott Linderman。
●感谢许多其他贡献代码的人员(有关自动生成的列表,可以参阅 />●感谢参与校对本书部分内容的人员,包括阿尔托研讨会的学生们、Bill Behrman、Kay Brodersen、Peter Chang、Krzysztof Choromanski、Adrien Corenflos、Tom Dietterich、Gerardo Duran-Martin、Lehman Krunoslav、Ruiqi Gao、Amir Globerson、Giles Harper-Donnelly、Ravin Kumar、Junpeng Lao、Stephen Mandt、Norm Matloff、Simon Prince、Rif Saurous、Erik Sudderth、Donna Vakalis、Hal Varian、Chris Williams和Raymond Yeh、以及其他人员(有关列表可以参阅 Fearns,他校对了本书几乎所有关于数学方面的内容;特别感谢麻省理工学院出版社的编辑,他校对并确保本书在所有正确的地方使用牛津逗号。
凯文·P. 墨菲(Kevin P. Murphy),先后获得剑桥大学文学学士学位、宾夕法尼亚大学工程硕士学位以及加州大学伯克利分校博士学位。此后他在麻省理工学院完成博士后研究,并于2004至2012年间担任加拿大温哥华不列颠哥伦比亚大学计算机科学与统计学副教授。获得终身教职后,他在学术休假期间加入谷歌公司,最终选择留任。目前,凯文担任谷歌Deepmind首席研究科学家兼总监,领导着由28名研究人员和工程师组成的团队,专注生成模型(包括扩散模型和大语言模型)、强化学习、机器人技术、贝叶斯推断等前沿领域。他已在学术会议和期刊上发表140余篇论文,并于2012、2022和2023年通过麻省理工学院出版社出版了三部机器学习教材(Machine Learning: A Probabilistic Perspective,Probabilistic Machine Learning: An Introduction,Probabilistic Machine Learning: Advanced Topics),其中2012年版的本教材获得了统计科学领域最佳书籍的DeGroot奖。凯文曾于2014至2017年间担任机器学习领域顶级期刊Journal of Machine Learning Research(JMLR)联合主编,现任ACM/IMS期刊Data Science及期刊Foundations and Trends in Machine Learning高级编辑。
江红 华东师范大学副教授,博士。1994年毕业于复旦大学计算机系。1994年7月起,华东师范大学任教至今。曾荣获华东师范大学教学成果三等奖、华东师范大学第三届青年教师课堂教学大奖赛三等奖、华东师范大学优秀任课教师奖、华东师范大学优秀教学改革研究论文二等奖、华东师范大学青年教师岗位培训优秀学员、上海市高等学校优秀毕业生等荣誉。
目录
译者序
前言
第1章 导论1
第一部分 理论基础
第2章 概率论4
2.1 概述4
2.1.1 概率空间4
2.1.2 离散随机变量4
2.1.3 连续随机变量5
2.1.4 概率公理5
2.1.5 条件概率6
2.1.6 贝叶斯规则6
2.2 一些常见的概率分布7
2.2.1 离散分布7
2.2.2 实数上的连续分布8
2.2.3 正实数上的连续分布11
2.2.4 在\[0,1\]上的连续分布14
2.2.5 多元连续分布14
2.3 高斯联合分布18
2.3.1 多元高斯分布18
2.3.2 线性高斯系统23
2.3.3 线性高斯系统的通用微积分知识25
2.4 指数族27
2.4.1 定义28
2.4.2 示例28
2.4.3 对数配分函数是累积量生成函数32
2.4.4 规范化(自然)参数与均值(矩)参数33
2.4.5 指数族的最大似然估计33 2.4.6 指数分散族34
2.4.7 指数族的最大熵推导34
2.5 随机变量的变换35
2.5.1 可逆变换(双射)35
2.5.2 蒙特卡罗近似36
2.5.3 概率积分变换36
2.6 马尔可夫链37
2.6.1 参数化38
2.6.2 应用:语言建模39
2.6.3 参数估计39
2.6.4 马尔可夫链的平稳分布41
2.7 概率分布之间的散度度量44
2.7.1 f-散度45
2.7.2 积分概率度量46
2.7.3 最大均值差异47
2.7.4 总变差距离49
2.7.5 使用二元分类器的密度比估计49
第3章 统计学51
3.1 概述51
3.2 贝叶斯统计51
3.2.1 投掷硬币51
3.2.2 对更复杂的数据建模56
3.2.3 选择先验58
3.2.4 计算问题58
3.2.5 可交换性和de Finetti定理58
3.3 频率学派统计59
3.3.1 采样分布59
3.3.2 采样分布的自举法近似59
3.3.3 最大似然估计采样分布的渐近正态性61
3.3.4 Fisher信息矩阵61
3.3.5 频率学派统计的反直觉性质64
3.3.6 为什么有人不坚持贝叶斯学派统计理论67 3.4 共轭先验68
3.4.1 二项式模型68
3.4.2 多项式模型68
3.4.3 单变量高斯分布模型69
3.4.4 多元高斯分布模型73
3.4.5 指数族模型78
3.4.6 超越共轭先验79
3.5 无信息性的先验82
3.5.1 最大熵先验82
3.5.2 Jeffreys先验83
3.5.3 不变性先验85
3.5.4 参照先验86
3.6 层次先验86
3.6.1 层次二项式模型87
3.6.2 层次高斯分布模型89
3.6.3 层次条件模型91
3.7 经验贝叶斯91
3.7.1 层次二项式模型的经验贝叶斯92
3.7.2 层次高斯分布模型的经验贝叶斯92
3.7.3 马尔可夫模型的经验贝叶斯(n-元组平滑)93
3.7.4 非共轭模型的经验贝叶斯95
3.8 模型选择95
3.8.1 贝叶斯模型选择95
3.8.2 贝叶斯模型平均97
3.8.3 估计边缘似然97
3.8.4 交叉验证与边缘似然之间的联系98
3.8.5 条件边缘似然99
3.8.6 贝叶斯留一估计99
3.8.7 信息准则100
3.9 模型检查102
3.9.1 后验预测性检查102
3.9.2 贝叶斯p-值104
3.10 假设检验105 3.10.1 频率学派统计的方法105
3.10.2 贝叶斯方法105
3.10.3 常见的统计检验对应于线性模型中的推理109
3.11 缺失数据113
第4章 图模型115
4.1 概述115
4.2 有向图模型(贝叶斯网)115
4.2.1 表示联合分布115
4.2.2 示例116
4.2.3 高斯贝叶斯网119
4.2.4 条件独立性120
4.2.5 生成(采样)124
4.2.6 推理124
4.2.7 学习126
4.2.8 板块表示法130
4.3 无向图模型(马尔可夫随机场)131
4.3.1 表示联合分布132
4.3.2 完全可见的马尔可夫随机场133
4.3.3 具有潜在变量的马尔可夫随机场138
4.3.4 最大熵模型140
4.3.5 高斯马尔可夫随机场141
4.3.6 条件独立性143
4.3.7 生成(采样)144
4.3.8 推理145
4.3.9 学习145
4.4 条件随机场148
4.4.1 一维条件随机场149
4.4.2 二维条件随机场151
4.4.3 参数估计153
4.4.4 结构化预测的其他方法154
4.5 比较有向和无向概率图模型154
4.5.1 条件独立性质154
4.5.2 有向模型和无向模型之间的转换155
4.5.3 比较条件有向概率图模型和无向概率图模型与标签偏差问题156
4.5.4 有向图和无向图的组合157
4.5.5 比较有向高斯概率图模型和无向高斯概率图模型158
4.6 概率图模型扩展160
4.6.1 因子图160
4.6.2 概率电路162
4.6.3 有向关系概率图模型162
4.6.4 无向关系概率图模型164
4.6.5 开放宇宙概率模型167
4.6.6 作为概率模型的程序167
4.7 结构因果模型168
4.7.1 示例:教育对财富的因果影响168
4.7.2 结构方程模型169
4.7.3 do运算符和增强的有向无环图169
4.7.4 反事实推理170
第5章 信息论173
5.1 KL散度173
5.1.1 需求条件173
5.1.2 KL散度唯一满足需求条件175
5.1.3 关于KL散度的思考177
5.1.4 最小化KL散度178
5.1.5 KL散度的性质180
5.1.6 KL散度和最大似然估计182
5.1.7 KL散度和贝叶斯推理182
5.1.8 KL散度和指数族183
5.1.9 使用Fisher信息矩阵近似KL散度184
5.1.10 Bregman散度184
5.2 熵185
5.2.1 定义185
5.2.2 连续随机变量的微分熵186
5.2.3 典型集187
5.2.4 交叉熵与困惑度187
5.3 互信息188
5.3.1 定义188
5.3.2 解释188
5.3.3 数据处理不等式189
5.3.4 充分统计量189
5.3.5 多元互信息190
5.3.6 互信息的变分上下界192
5.3.7 相关性网络194
5.4 数据压缩(源编码)196
5.4.1 无损压缩196
5.4.2 有损压缩和数据率失真度的权衡196
5.4.3 比特反向编码198
5.5 纠错码(信道编码)199
5.6 信息瓶颈200
5.6.1 基本信息瓶颈200
5.6.2 变分信息瓶颈201
5.6.3 条件熵瓶颈203
第6章 优化204
6.1 概述204
6.2 自动微分204
6.2.1 函数形式的微分204
6.2.2 微分链、电路和程序207
6.3 随机优化212
6.3.1 随机梯度下降212
6.3.2 用于优化有限和目标的随机梯度下降213
6.3.3 用于优化分布参数的随机梯度下降214
6.3.4 得分函数估计器214
6.3.5 重新参数化的技巧215
6.3.6 Gumbel softmax技巧217
6.3.7 随机计算图218
6.3.8 直通式估计器218
6.4 自然梯度下降219
6.4.1 定义自然梯度219
6.4.2 自然梯度下降的解释220
6.4.3 自然梯度下降的优点220
6.4.4 近似自然梯度222
6.4.5 指数族的自然梯度222
6.5 边界优化算法224
6.5.1 通用算法224
6.5.2 示例:逻辑回归225
6.5.3 期望最大化算法226
6.5.4 示例:缺失数据多元正态分布的期望最大化算法228
6.5.5 示例:使用学生似然的稳健线性回归230
6.5.6 期望最大化算法的扩展231
6.6 贝叶斯优化方法233
6.6.1 基于序列模型的优化234
6.6.2 代理函数235
6.6.3 采集函数236
6.6.4 其他问题238
6.7 无导数优化239
6.7.1 本地搜索239
6.7.2 模拟退火242
6.7.3 进化算法242
6.7.4 分布估计算法244
6.7.5 交叉熵方法246
6.7.6 进化策略246
6.8 最优传输247
6.8.1 预热:最优匹配两个点族247
6.8.2 从最优匹配到Kantorovich和Monge公式248
6.8.3 求解最优传输250
6.9 子模优化254
6.9.1 直觉、示例和背景254
6.9.2 子模的基本定义256
6.9.3 子模函数示例257
6.9.4 子模优化方法260
6.9.5 子模在机器学习和人工智能中的应用263
6.9.6 草图、核心集、蒸馏、数据子集和特征选择263
6.9.7 组合信息函数266
6.9.8 聚类、数据划分和并行机器学习267
6.9.9 主动学习和半监督学习268
6.9.10 概率建模269
6.9.11 结构化范数和损失函数270
6.9.12 结论270
第二部分 推理
第7章 推理算法:综述272
7.1 概述272
7.2 常见推理模式273
7.2.1 全局潜在变量273
7.2.2 局部潜在变量273
7.2.3 局部和全局潜在变量274
7.3 精确推理算法274
7.4 近似推理算法275
7.4.1 最大后验估计近似及其问题275
7.4.2 网格近似276
7.4.3 拉普拉斯(二次型)近似277
7.4.4 变分推理278
7.4.5 马尔可夫链蒙特卡罗279
7.4.6 序列蒙特卡罗280
7.4.7 挑战后验概率281
7.5 评估近似推理算法281
第8章 高斯滤波与平滑282
8.1 概述282
8.1.1 推理目标282
8.1.2 贝叶斯滤波方程284
8.1.3 贝叶斯平滑方程284
8.1.4 高斯假设285
8.2 线性高斯状态空间模型的推理285
8.2.1 示例286
8.2.2 卡尔曼滤波器287
8.2.3 卡尔曼平滑器290
8.2.4 信息形式的滤波和平滑292
8.3 基于局部线性化的推理294
8.3.1 泰勒级数展开294
8.3.2 扩展卡尔曼滤波器295
8.3.3 扩展卡尔曼平滑器297
8.4 基于无迹变换的推理298
8.4.1 无迹变换298
8.4.2 无迹卡尔曼滤波器300
8.4.3 无迹卡尔曼平滑器300
8.5 卡尔曼滤波器的其他变体300
8.5.1 广义高斯滤波300
8.5.2 条件矩高斯滤波303
8.5.3 迭代滤波器和平滑器303
8.5.4 集成卡尔曼滤波器305
8.5.5 鲁棒卡尔曼滤波器306
8.5.6 双扩展卡尔曼滤波器306
8.6 假设密度滤波306
8.6.1 与高斯滤波的连接307
8.6.2 切换线性动力系统的假设密度滤波(高斯和滤波器)308
8.6.3 在线逻辑回归的假设密度滤波309
8.6.4 在线深度神经网络的假设密度滤波312
8.7 状态空间模型的其他推理方法312
8.7.1 基于网格的近似312
8.7.2 期望传播313
8.7.3 变分推理313
8.7.4 马尔可夫链蒙特卡罗314
8.7.5 粒子滤波314
第9章 消息传递算法315
9.1 概述315
9.2 链上的信念传播315
9.2.1 隐马尔可夫模型315
9.2.2 前向算法317
9.2.3 前向后向算法318
9.2.4 前向滤波后向平滑319
9.2.5 时间复杂度和空间复杂度320
9.2.6 Viterbi算法320
9.2.7 前向滤波后向采样323
9.3 树上的信念传播323
9.3.1 有向树与无向树323
9.3.2 和积算法324
9.3.3 最大乘积算法325
9.4 循环信念传播327
9.4.1 成对无向图的循环信念传播328
9.4.2 因子图的循环信念传播328
9.4.3 高斯信念传播329
9.4.4 收敛330
9.4.5 准确率332
9.4.6 广义信念传播332
9.4.7 凸信念传播333
9.4.8 应用:纠错码333
9.4.9 应用:近邻传播334
9.4.10 使用图神经网络模拟信念传播335
9.5 变量消除算法336
9.5.1 算法的推导336
9.5.2 变量消除的计算复杂度337
9.5.3 选择一个好的消除顺序339
9.5.4 精确推理的计算复杂度339
9.5.5 变量消除的缺点340
9.6 联结树算法341
9.7 作为优化的推理341
9.7.1 作为反向传播的推理341
9.7.2 扰动和最大后验估计342
第10章 变分推理344
10.1 概述344
10.1.1 变分目标344
10.1.2 变分后验的形式345
10.1.3 使用变分期望最大化的参数估计346
10.1.4 随机变分推理347
10.1.5 摊销变分推理348
10.1.6 半摊销推理348
10.2 基于梯度的变分推理349
10.2.1 重新参数化变分推理349
10.2.2 自动微分变分推理353
10.2.3 黑盒变分推理355
10.3 坐标上升变分推理356
10.3.1 坐标上升变分推理算法的推导356
10.3.2 示例:Ising模型的坐标上升变分推理358
10.3.3 变分贝叶斯359
10.3.4 示例:变分贝叶斯用于单变量高斯360
10.3.5 变分贝叶斯期望最大化362
10.3.6 示例:高斯混合模型的变分贝叶斯期望最大化363
10.3.7 变分消息传递368
10.3.8 autoconj368
10.4 更准确的变分后验368
10.4.1 结构化均值场368
10.4.2 层次(辅助变量)后验369
10.4.3 归一化流后验369
10.4.4 隐式后验369
10.4.5 将变分推理与马尔可夫链蒙特卡罗推理相结合370
10.5 更严格的下界370
10.5.1 多样本证据下界370
10.5.2 热力学变分目标371
10.5.3 最小化证据上界371
10.6 唤醒睡眠算法372
10.6.1 唤醒阶段372
10.6.2 睡眠阶段373
10.6.3 白日梦阶段373
10.6.4 算法总结374
10.7 期望传播375
10.7.1 期望传播的算法375
10.7.2 示例376
10.7.3 作为广义假设密度滤波的期望传播376
10.7.4 优化问题377
10.7.5 幂期望传播和阿尔法散度377
10.7.6 随机期望传播377
第11章 蒙特卡罗方法379
11.1 概述379
11.2 蒙特卡罗积分379
11.2.1 示例:通过蒙特卡罗积分估计379
11.2.2 蒙特卡罗积分的准确度380
11.3 从简单分布生成随机样本381
11.3.1 使用反向累积分布函数进行采样381
11.3.2 高斯采样(Box-Muller法)382
11.4 拒绝采样382
11.4.1 基本思想382
11.4.2 示例383
11.4.3 自适应拒绝采样384
11.4.4 高维空间中的拒绝采样384
11.5 重要性采样385
11.5.1 直接重要性采样385
11.5.2 自归一化重要性采样385
11.5.3 选择提议分布386
11.5.4 退火重要性采样387
11.6 控制蒙特卡罗方差388
11.6.1 常见随机数388
11.6.2 Rao-Blackwellization388
11.6.3 控制变量法389
11.6.4 对偶采样390
11.6.5 准蒙特卡罗390
第12章 马尔可夫链蒙特卡罗方法392
12.1 概述392
12.2 Metropolis-Hastings算法392
12.2.1 基本思想392
12.2.2 Metropolis-Hastings算法为什么有效394
12.2.3 提议分布395
12.2.4 初始化396
12.3 吉布斯采样397
12.3.1 基本思想397
12.3.2 吉布斯采样是Metropolis-Hastings的一种特殊情况397
12.3.3 示例:Ising模型的吉布斯采样398
12.3.4 示例:Potts模型的吉布斯采样399
12.3.5 示例:高斯混合模型的吉布斯采样399
12.3.6 吉布斯采样中的Metropolis算法401
12.3.7 分块吉布斯采样401
12.3.8 塌陷吉布斯采样402
12.4 辅助变量马尔可夫链蒙特卡罗方法404
12.4.1 切片采样404
12.4.2 Swendsen-Wang405
12.5 哈密尔顿蒙特卡罗方法406
12.5.1 哈密尔顿力学407
12.5.2 积分哈密尔顿方程407
12.5.3 哈密尔顿蒙特卡罗算法408
12.5.4 微调哈密尔顿蒙特卡罗方法409
12.5.5 黎曼流形哈密尔顿蒙特卡罗方法410
12.5.6 朗之万蒙特卡罗方法410
12.5.7 随机梯度下降和朗之万采样之间的联系411
12.5.8 将哈密尔顿蒙特卡罗方法应用于受约束的参数412
12.5.9 加速哈密尔顿蒙特卡罗方法413
12.6 马尔可夫链蒙特卡罗收敛413
12.6.1 马尔可夫链的混合率414
12.6.2 实用收敛诊断414
12.6.3 有效样本容量417
12.6.4 提高收敛速度419
12.6.5 非中心参数化和Neal漏斗419
12.7 随机梯度马尔可夫链蒙特卡罗方法420
12.7.1 随机梯度朗之万动力学420
12.7.2 预处理420
12.7.3 降低梯度估计的方差421
12.7.4 SG-HMC422
12.7.5 欠阻尼朗之万动力学422
12.8 可逆跳跃(跨维)马尔可夫链蒙特卡罗422
12.8.1 基本思想423
12.8.2 示例424
12.8.3 讨论425
12.9 退火方法426
12.9.1 模拟退火426
12.9.2 并行回火428
第13章 序列蒙特卡罗方法429
13.1 概述429
13.1.1 问题陈述429
13.1.2 状态空间模型的粒子滤波429
13.1.3 用于静态参数估计的序列蒙特卡罗采样器430
13.2 粒子滤波431
13.2.1 重要性采样431
13.2.2 序列重要性采样432
13.2.3 带重新采样的序列重要性采样433
13.2.4 重新采样方法435
13.2.5 自适应重新采样437
13.3 提议分布438
13.3.1 局部最优提议分布438
13.3.2 基于扩展无迹卡尔曼滤波器的提议分布439
13.3.3 基于拉普拉斯近似的提议分布439
13.3.4 基于序列蒙特卡罗的提议分布(嵌套序列蒙特卡罗)440
13.4 Rao-Blackwellized粒子滤波440
13.4.1 卡尔曼滤波器的混合441
13.4.2 示例:跟踪机动物体442
13.4.3 示例:FastSLAM444
13.5 粒子滤波器的扩展446
13.6 序列蒙特卡罗采样器446
13.6.1 序列蒙特卡罗采样器的成分446
13.6.2 似然回火(几何路径)447
13.6.3 数据回火449
13.6.4 罕见事件和极值的采样450
13.6.5 序列蒙特卡罗近似贝叶斯计算和无似然推理451
13.6.6 SMC2451
13.6.7 变分滤波序列蒙特卡罗方法451
13.6.8 变分平滑序列蒙特卡罗方法452
第三部分 预测
第14章 预测模型:概述456
14.1 概述456
14.1.1 预测模型的类型456
14.1.2 使用ERM、MLE和MAP的模型拟合457
14.1.3 使用贝叶斯、变分推理和广义贝叶斯的模型拟合457
14.2 评估预测模型458
14.2.1 适当的评分规则458
14.2.2 校准459
14.2.3 评估边缘概率以外的其他方法461
14.3 共形预测464
14.3.1 共形分类465
14.3.2 共形回归466
第15章 广义线性模型468
15.1 概述468
15.1.1 一些流行的广义线性模型468
15.1.2 具有非规范链接函数的广义线性模型470
15.1.3 最大似然估计471
15.1.4 贝叶斯推理471
15.2 线性回归472
15.2.1 普通最小二乘法472
15.2.2 共轭先验473
15.2.3 无信息性先验474
15.2.4 信息先验476
15.2.5 尖峰和平板先验477
15.2.6 拉普拉斯先验(贝叶斯套索)478
15.2.7 马蹄先验479
15.2.8 自动相关性确定480
15.2.9 多元线性回归482
15.3 逻辑回归483
15.3.1 二元逻辑回归484
15.3.2 多项式逻辑回归484
15.3.3 处理类别不平衡和长尾问题484
15.3.4 参数先验分布485
15.3.5 后验的拉普拉斯近似486
15.3.6 近似后验预测分布487
15.3.7 马尔可夫链蒙特卡罗推理488
15.3.8 其他近似推理方法490
15.3.9 案例研究:伯克利分校的录取是否对女性有偏见490
15.4 probit回归492
15.4.1 潜在变量解释493
15.4.2 最大似然估计493
15.4.3 贝叶斯推理494
15.4.4 有序probit回归495
15.4.5 多项式probit模型495
15.5 多级(分层)广义线性模型495
15.5.1 广义线性混合模型496
15.5.2 示例:氡回归496
第16章 深度神经网络499
16.1 概述499
16.2 可微电路的构建块499
16.2.1 线性层499
16.2.2 非线性现象500
16.2.3 卷积层500
16.2.4 残差(跳过)连接502
16.2.5 归一化层502
16.2.6 dropout层502
16.2.7 注意力层503
16.2.8 循环层505
16.2.9 乘法层505
16.2.10 隐式层506
16.3 神经网络的典型例子506
16.3.1 多层感知器506
16.3.2 卷积神经网络507
16.3.3 自动编码器508
16.3.4 循环神经网络508
16.3.5 Transformer509
16.3.6 图神经网络509ⅩⅨ
第17章 贝叶斯神经网络510
17.1 概述510
17.2 贝叶斯神经网络的先验510
17.2.1 高斯先验510
17.2.2 稀疏性提升先验512
17.2.3 学习先验512
17.2.4 函数空间中的先验512
17.2.5 架构先验513
17.3 贝叶斯神经网络的后验513
17.3.1 蒙特卡罗丢弃法513
17.3.2 拉普拉斯近似514
17.3.3 变分推理515
17.3.4 期望传播516
17.3.5 最后一层方法516
17.3.6 频谱归一化高斯过程516
17.3.7 马尔可夫链蒙特卡罗方法517
17.3.8 基于随机梯度下降轨迹的方法517
17.3.9 深度集成518
17.3.10 近似后验预测分布521
17.3.11 回火后验和冷却后验524
17.4 贝叶斯深度学习中的泛化525
17.4.1 尖锐与平坦的极小值525
17.4.2 模式连通性和损失景观526
17.4.3 模型的有效维度526
17.4.4 深度神经网络的假设空间527
17.4.5 PAC贝叶斯528
17.4.6 贝叶斯神经网络的分布外泛化528
17.4.7 贝叶斯神经网络的模型选择530
17.5 在线推理531
17.5.1 深度神经网络的序列拉普拉斯531
17.5.2 深度神经网络的扩展卡尔曼滤波531
17.5.3 深度神经网络的假设密度过滤533
17.5.4 深度神经网络的在线变分推理534
17.6 层次贝叶斯神经网络535
17.6.1 示例:多卫星分类535
第18章 高斯过程538
18.1 概述538
18.1.1 高斯过程的概念以及使用的原因538
18.2 Mercer核539
18.2.1 平稳核540
18.2.2 非平稳核544
18.2.3 非向量(结构化)输入的核544
18.2.4 从旧核中创建新核545
18.2.5 Mercer定理546
18.2.6 具有随机特征的近似核547
18.3 高斯似然的高斯过程547
18.3.1 使用无噪声观测的预测548
18.3.2 使用噪声观测的预测548
18.3.3 权重空间与函数空间549
18.3.4 半参数化高斯过程550
18.3.5 边缘似然550
18.3.6 计算和数值问题551
18.3.7 核岭回归551
18.4 具有非高斯似然的高斯过程554
18.4.1 二元分类554
18.4.2 多类别分类555
18.4.3 泊松回归的高斯过程(Cox过程)556
18.4.4 其他似然556
18.5 将高斯过程推理扩展到大型数据集557
18.5.1 数据子集557
18.5.2 Nystrm近似558
18.5.3 诱导点方法559
18.5.4 稀疏变分法562
18.5.5 通过核矩阵乘法利用并行化和结构564
18.5.6 将高斯过程转换为状态空间模型566
18.6 学习核567
18.6.1 核参数的经验贝叶斯567
18.6.2 核参数的贝叶斯推断569
18.6.3 加性核的多核学习571
18.6.4 组成核的自动搜索572
18.6.5 谱混合核学习573
18.6.6 深度核学习575
18.7 高斯过程和深度神经网络576
18.7.1 源自无限宽深度神经网络的核577
18.7.2 神经正切核578
18.7.3 深度高斯过程579
18.8 时间序列预测的高斯过程579
18.8.1 示例:Mauna Loa580ⅩⅩ
第19章 非独立同分布的假设581
19.1 概述581
19.2 分布偏移581
19.2.1 激励示例581
19.2.2 分布偏移的因果观582
19.2.3 分布偏移的4种主要类型583
19.2.4 选择偏差584
19.3 检测分布偏移585
19.3.1 使用双样本检验来检测偏移585
19.3.2 检测单个分布外输入586
19.3.3 选择性预测588
19.3.4 开放集识别和开放世界识别589
19.4 分布偏移的鲁棒性589
19.4.1 数据增强589
19.4.2 分布式鲁棒优化590
19.5 适应分布偏移590
19.5.1 使用迁移学习的监督适应590
19.5.2 协变量偏移的加权经验风险最小化591
19.5.3 协变量偏移的无监督领域自适应592
19.5.4 标签偏移的无监督技术593
19.5.5 测试时自适应594
19.6 从多种分布中学习594
19.6.1 多任务学习595
19.6.2 领域泛化596
19.6.3 不变风险最小化596
19.6.4 元学习597
19.7 持续学习599
19.7.1 领域漂移600
19.7.2 概念漂移600
19.7.3 任务增量学习601
19.7.4 灾难性遗忘602
19.7.5 在线学习604
19.8 对抗性样例605
19.8.1 白盒(基于梯度的)攻击605
19.8.2 黑盒(无梯度)攻击606
19.8.3 真实世界的对抗性攻击607
19.8.4 基于鲁棒优化的防御607
19.8.5 为什么模型具有对抗性样例608
第四部分 生成
第20章 生成模型:概述612
20.1 概述612
20.2 生成模型的类型612
20.3 生成式建模的目标614
20.3.1 生成数据614
20.3.2 密度估计615
20.3.3 插值616
20.3.4 结构发现617
20.3.5 潜在空间插值618
20.3.6 潜在空间算术运算618
20.3.7 生成式设计619
20.3.8 基于模型的强化学习619
20.3.9 表征学习619
20.3.10 数据压缩619
20.4 评估生成模型620
20.4.1 基于似然的评估620
20.4.2 特征空间中的距离和离散度621
20.4.3 精度和召回率指标622
20.4.4 统计测试623
20.4.5 使用预训练分类器的挑战623
20.4.6 使用模型样本训练分类器623
20.4.7 评估过拟合624
20.4.8 人工评估624
第21章 变分自动编码器625
21.1 概述625
21.2 变分自动编码器的基础知识625
21.2.1 建模假设625
21.2.2 模型拟合626
21.2.3 变分自动编码器和自动编码器的比较627
21.2.4 变分自动编码器在增强空间中优化627
21.3 变分自动编码器泛化629
21.3.1 -变分自动编码器629
21.3.2 InfoVAE631
21.3.3 多模态变分自动编码器632
21.3.4 半监督变分自动编码器634
21.3.5 带序列编码器/解码器的变分自动编码器635
21.4 避免后验塌陷637
21.4.1 KL退火638
21.4.2 限制速率下界638
21.4.3 免费比特638
21.4.4 添加跳跃连接639
21.4.5 改进的变分推理639
21.4.6 替代目标639
21.5 具有层次结构的变分自动编码器639
21.5.1 自底向上的推理和自顶向下的推理640
21.5.2 示例:超级深度变分自动编码器641
21.5.3 与自回归模型的联系642
21.5.4 变分剪枝643
21.5.5 关于优化的其他难点643
21.6 向量量化变分自动编码器644
21.6.1 带二元编码的自动编码器644
21.6.2 VQ-VAE模型644
21.6.3 学习先验知识646
21.6.4 层次扩展(VQ-VAE-2)646
21.6.5 离散变分自动编码器646
21.6.6 VQ-GAN647
第22章 自回归模型648
22.1 概述648
22.2 神经自回归密度估计器649
22.3 因果卷积神经网络649
22.3.1 一维因果卷积神经网络649
22.3.2 二维因果卷积神经网络650
22.4 Transformer650
22.4.1 文本生成651
22.4.2 图像生成652
22.4.3 其他应用653
第23章 归一化流654
23.1 概述654
23.1.1 准备工作654
23.1.2 如何训练流模型655
23.2 构造流656
23.2.1 仿射流656
23.2.2 逐元素流657
23.2.3 耦合流659
23.2.4 自回归流660
23.2.5 残差流664
23.2.6 连续时间流666
23.3 应用667
23.3.1 密度估算667
23.3.2 生成式建模668
23.3.3 推理668
第24章 基于能量的模型669
24.1 概述669
24.1.1 示例:专家乘积669
24.1.2 计算困难670
24.2 最大似然训练670
24.2.1 基于梯度的马尔可夫链蒙特卡罗方法671
24.2.2 对比散度671
24.3 得分匹配674
24.3.1 基本得分匹配674
24.3.2 去噪得分匹配675
24.3.3 切片得分匹配676
24.3.4 与对比散度的联系677
24.3.5 基于得分的生成模型678
24.4 噪声对比估计678
24.4.1 与得分匹配的联系679
24.5 其他方法680
24.5.1 最小化KL散度的差异/导数680
24.5.2 最小化Stein差异680
24.5.3 对抗性训练681
第25章 扩散模型683
25.1 概述683
25.2 去噪扩散概率模型683
25.2.1 编码器(前向扩散)684
25.2.2 解码器(反向扩散)685
25.2.3 模型拟合685
25.2.4 学习噪声调度计划687
25.2.5 示例:图像生成688
25.3 基于得分的生成模型688
25.3.1 示例689
25.3.2 在多个尺度上添加噪声689
25.3.3 等同于去噪扩散概率模型690
25.4 使用微分方程的连续时间模型690
25.4.1 前向扩散随机微分方程691
25.4.2 前向扩散常微分方程692
25.4.3 反向扩散随机微分方程692
25.4.4 反向扩散常微分方程693
25.4.5 随机微分方程和常微分方程方法的比较694
25.4.6 示例694
25.5 加速扩散模型695
25.5.1 DDIM采样器695
25.5.2 非高斯解码器网络695
25.5.3 蒸馏方法696
25.5.4 潜在空间扩散697
25.6 条件生成698
25.6.1 条件扩散模型698
25.6.2 分类器引导698
25.6.3 无分类器引导698
25.6.4 生成高分辨率图像699
25.7 离散状态空间的扩散700
25.7.1 离散去噪扩散概率模型700
25.7.2 前向过程的马尔可夫转移矩阵的选择701
25.7.3 反向过程的参数化702
25.7.4 噪声调度计划702
25.7.5 离散序列与其他概率模型的联系702Ⅹ
第26章 生成式对抗性网络704
26.1 概述704
26.2 通过比较进行学习705
26.2.1 指导原则705
26.2.2 使用二元分类器的密度比估计706
26.2.3 f-散度的边界708
26.2.4 积分概率度量709
26.2.5 矩匹配711
26.2.6 关于密度比和密度差异711
26.3 生成式对抗性网络的训练与优化713
26.3.1 从学习原理到损失函数713
26.3.2 梯度下降714
26.3.3 生成式对抗性网络训练面临的挑战715
26.3.4 改进生成式对抗性网络优化716
26.3.5 生成式对抗性网络训练的收敛性717
26.4 条件生成式对抗性网络719
26.5 生成式对抗性网络推理720
26.6 生成式对抗性网络中的神经架构721
26.6.1 判别器架构的重要性721
26.6.2 架构归纳偏置722
26.6.3 生成式对抗性网络中的注意力723
26.6.4 渐进式生成723
26.6.5 正则化724
26.6.6 扩展生成式对抗性网络模型725
26.7 应用725
26.7.1 图像生成的生成式对抗性网络725
26.7.2 视频生成728
26.7.3 音频生成728
26.7.4 文本生成728
26.7.5 模仿学习729
26.7.6 领域自适应729
26.7.7 设计、艺术和创意730
第五部分 发现
第27章 发现方法:概述732
27.1 概述732
27.2 第五部分的内容概述733
第28章 潜在因子模型734
28.1 概述734
28.2 混合模型734
28.2.1 高斯混合模型735
28.2.2 伯努利混合模型736
28.2.3 高斯尺度混合模型737
28.2.4 使用高斯混合模型作为逆成像问题的先验737
28.2.5 使用混合模型解决分类问题740
28.3 因子分析742
28.3.1 因子分析:基础742
28.3.2 概率主成分分析745
28.3.3 混合因子分析器747
28.3.4 成对数据的因子分析模型752
28.3.5 指数族似然的因子分析754
28.3.6 深度神经网络似然的因子分析756
28.3.7 高斯过程似然的因子分析756
28.4 具有非高斯先验的潜在因子模型757
28.4.1 非负矩阵分解757
28.4.2 多元主成分分析758
28.5 主题模型760
28.5.1 潜在狄利克雷分布760
28.5.2 相关主题模型763
28.5.3 动态主题模型763
28.5.4 LDA-HMM765
28.6 独立成分分析768
28.6.1 无噪声独立成分分析模型768
28.6.2 对非高斯先验的需求769
28.6.3 最大似然估计770
28.6.4 最大似然估计的替代方案770
28.6.5 稀疏编码771
28.6.6 非线性独立成分分析772
第29章 状态空间模型773
29.1 概述773
29.2 隐马尔可夫模型774
29.2.1 条件独立性774
29.2.2 状态转移模型774
29.2.3 离散似然774
29.2.4 高斯似然775
29.2.5 自回归似然776
29.2.6 神经网络似然777
29.3 隐马尔可夫模型:应用777
29.3.1 时间序列分割777
29.3.2 蛋白质序列比对779
29.3.3 拼写校正780
29.4 隐马尔可夫模型:参数学习782
29.4.1 Baum-Welch算法782
29.4.2 使用随机梯度下降的参数估计785
29.4.3 使用谱方法的参数估计786
29.4.4 贝叶斯隐马尔可夫模型786
29.5 隐马尔可夫模型:泛化787
29.5.1 隐半马尔可夫模型788
29.5.2 层次化隐马尔可夫模型790
29.5.3 因子化隐马尔可夫模型791
29.5.4 耦合隐马尔可夫模型792
29.5.5 动态贝叶斯网络792
29.5.6 变化点检测793
29.6 线性动力系统796
29.6.1 条件独立性796
29.6.2 参数化796
29.7 线性动力系统:应用796
29.7.1 目标跟踪和状态估计796
29.7.2 在线贝叶斯线性回归797
29.7.3 自适应滤波799
29.7.4 时间序列预测799
29.8 线性动力系统:参数学习799
29.8.1 线性动力系统中的期望最大化800
29.8.2 子空间识别方法801
29.8.3 确保动力系统的稳定性802
29.8.4 贝叶斯线性动力系统802
29.9 切换线性动力系统803
29.9.1 参数化803
29.9.2 后验推理803
29.9.3 应用:多目标跟踪804
29.10 非线性状态空间模型806
29.10.1 示例:目标跟踪和状态估计807
29.10.2 后验推理807
29.11 非高斯状态空间模型807
29.11.1 示例:尖峰序列建模807
29.11.2 示例:随机波动率模型808
29.11.3 后验推理809
29.12 结构时间序列模型809
29.12.1 概述809
29.12.2 结构化构建块810
29.12.3 模型拟合811
29.12.4 预测812
29.12.5 示例812
29.12.6 时间序列干预的因果影响815
29.12.7 Prophet818
29.12.8 神经预测方法819
29.13 深度状态空间模型820
29.13.1 深度马尔可夫模型820
29.13.2 循环状态空间模型821
29.13.3 改进多步骤预测821
29.13.4 变分循环神经网络822
第30章 图学习824
30.1 概述824
30.2 图的潜在变量模型824
30.3 图模型结构学习824
第31章 非参数化贝叶斯模型826
31.1 概述826
第32章 表征学习827
32.1 概述827
32.2 评估和比较学习到的表征827
32.2.1 下游性能828
32.2.2 表征相似性830
32.3 学习表征的方法833
32.3.1 监督的表征学习和迁移833
32.3.2 生成式表征学习834
32.3.3 自监督的表征学习837
32.3.4 多视图表征学习839
32.4 表征学习的理论842
32.4.1 可识别性843
32.4.2 信息最大化843
第33章 可解释性845
33.1 概述845
33.1.1 可解释性的作用:未知规范和弱规范845
33.1.2 术语和框架846
33.2 可解释的机器学习方法849
33.2.1 内在可解释的模型:模型就是其解释850
33.2.2 半内在可解释的模型:基于样例的方法851
33.2.3 事后训练或联合训练:解释给出模型的部分视图852
33.2.4 透明度和可视化855
33.3 属性:上下文和方法之间的抽象855
33.3.1 可解释机器学习中解释的属性856
33.3.2 认知科学中解释的属性858
33.4 可解释机器学习模型的评估858
33.4.1 计算评估:该方法是否具有所需的属性859
33.4.2 基于用户研究的评估:该方法是否有助于用户执行目标任务862
33.5 讨论:如何思考可解释的机器学习865
第六部分 行为
第34章 不确定性决策870
34.1 统计决策理论870
34.1.1 基础理论870
34.1.2 频率学派决策理论870
34.1.3 贝叶斯决策理论871
34.1.4 贝叶斯方法的频率学派最优性871
34.1.5 一次性决策问题示例872
34.2 决策(影响)图875
34.2.1 示例:石油勘探者875
34.2.2 信息弧876
34.2.3 信息价值877
34.2.4 计算最优策略878
34.3 A/B测试878
34.3.1 贝叶斯方法879
34.3.2 示例881
34.4 上下文游戏机882
34.4.1 游戏机的类型883
34.4.2 应用884
34.4.3 探索-利用权衡884
34.4.4 最优解885
34.4.5 置信区间上界886
34.4.6 汤普森采样888
34.4.7 策略遗憾889
34.5 马尔可夫决策问题890
34.5.1 基础理论890
34.5.2 部分可观测的马尔可夫决策过程891
34.5.3 剧集和回报892
34.5.4 价值函数893
34.5.5 最优价值函数和策略893
34.6 马尔可夫决策过程中的规划895
34.6.1 价值迭代895
34.6.2 策略迭代896
34.6.3 线性规划897
34.7 主动学习897
34.7.1 主动学习场景898
34.7.2 与其他形式的序列决策的关系898
34.7.3 采集策略899
34.7.4 批量主动学习901
第35章 强化学习904
35.1 概述904
35.1.1 方法概述904
35.1.2 基于价值的方法905
35.1.3 策略搜索方法906
35.1.4 基于模型的强化学习906
35.1.5 探索-利用权衡906
35.2 基于价值的强化学习908
35.2.1 蒙特卡罗强化学习908
35.2.2 时间差分学习909
35.2.3 资格迹的时间差分学习909
35.2.4 SARSA:同策略时间差分控制910
35.2.5 Q-学习:异策略时间差分控制910
35.2.6 深度Q-网络913
35.3 基于策略的强化学习914
35.3.1 策略梯度定理914
35.3.2 REINFORCE915
35.3.3 行动者-评论家方法916
35.3.4 边界优化方法917
35.3.5 确定性策略梯度方法918
35.3.6 无梯度方法919
35.4 基于模型的强化学习919
35.4.1 模型预测控制920
35.4.2 结合基于模型和无模型的强化学习921
35.4.3 使用高斯过程的基于模型的强化学习922
35.4.4 使用深度神经网络的基于模型的强化学习923
35.4.5 使用潜在变量模型的基于模型的强化学习923
35.4.6 模型误差的鲁棒性926
35.5 异策略学习926
35.5.1 基本技术927
35.5.2 时域的诅咒930
35.5.3 致命的三要素930
35.6 作为推理的控制932
35.6.1 最大熵强化学习932
35.6.2 其他方法934
35.6.3 模仿学习935
第36章 因果关系937
36.1 概述937
36.2 因果形式主义939
36.2.1 结构因果模型939
36.2.2 因果有向无环图940
36.2.3 识别941
36.2.4 反事实和因果层次943
36.3 随机对照试验944
36.4 混杂因素调整945
36.4.1 因果估计目标、统计估计目标和识别945
36.4.2 具有观测到的混杂因素情况下的平均处理效应估计947
36.4.3 不确定性量化951
36.4.4 匹配952
36.4.5 实际考虑和过程953
36.4.6 总结和实用建议955
36.5 仪器变量策略956
36.5.1 加性未观测到的混杂因素957
36.5.2 仪器单调性和局部平均处理效应959
36.5.3 两阶段最小二乘法961
36.6 双重差分法962
36.6.1 估计964
36.7 可信度检查965
36.7.1 安慰剂检查965
36.7.2 对未观测到的混杂因素进行敏感性分析966
36.8 do演算972
36.8.1 三条规则972
36.8.2 重新调整后门973
36.8.3 前门调整973
36.9 参考阅读资料975
参考文献977