本书系统探讨联邦学习在隐私保护与数据安全方面的关键挑战,并阐述可信联邦学习的关键技术。全书围绕可信联邦学习的基本理论、核心算法和实际应用展开,重点介绍可信联邦学习在隐私安全、模型效用、训练效率中的前沿技术理论研究,以及隐私计算、差分隐私、安全多方计算、区块链等技术在联邦学习中的应用,同时针对三者之间的权衡,提出了一系列的理论,包括不可能三角、多目标优化、概率近似正确学习、博弈均衡等前瞻性研究工作。同时,本书深入讨论了可信联邦学习和大模型技术的交集,提出多种联邦大模型架构及算法。本书还围绕可信联邦学习的模型版权保护与模型定价进行了阐述。书中不仅涵盖了理论分析,还结合可信联邦学习在医疗、金融、营销推荐、视觉等领域的应用提供实践案例,并展望了可信联邦学习未来的发展趋势,以帮助读者更好地理解和应用可信联邦学习技术。每章结尾配有习题,方便读者巩固所学内容。
作者简介杨强加拿大工程院及加拿大皇家科学院院士,香港理工大学人工智能高等研究院院长,香港科技大学(广州)讲座教授,微众银行首席人工智能顾问(荣休),香港科技大学讲座教授及前系主任(荣休),AAAI-2021大会主席,国际人工智能联合会(IJCAI)理事会前主席,曾获2017年 ACM SIGKDD 杰出服务奖以及2023年度“IJCAI Donald E.Walker 杰出服务奖”。他还是两本国际顶级期刊ACM TIST和IEEE TRANS on BIG DATA的创始主编,CAAI/AAAI/ACM/IEEE/AAAS等多个国际学会的Fellow。他的研究领域包括迁移学习和联邦学习研究及应用,著作包括《迁移学习》、《联邦学习》、《隐私计算》和《联邦学习实战》等。黄安埠人工智能研究员,专注于扩散生成模型和原生多模态(VLM)的研究与应用。曾在腾讯、微众银行担任资深AI研究员,在生成式AI、机器学习、隐私保护计算等领域有丰富的研究和落地经验。已申请和拥有40多项国内和PCT国际专利,学术成果发表在ICLR、AAAI等国际会议和期刊上,撰写和出版了多本人工智能专业图书。范力欣微众银行人工智能首席科学家,研究领域包括机器学习和深度学习、隐私计算和联邦学习、计算机视觉和模式识别、图像和视频处理、3D大数据处理、数据可视化和渲染、增强和虚拟现实。他发表了90余篇国际期刊和会议文章,曾在诺基亚研究中心和欧洲施乐研究中心工作。他长期参加NIPS/NeurIPS、ICML、CVPR、ICCV、ECCV、IJCAI等顶级人工智能会议并担任AAAI领域主席,主持举办了各个技术领域的研讨会。他还是在美国、欧洲和中国提交的近百项专利的发明人。著作包括《可解释人工智能导论》和《AI模型水印:护航数据要素流通》。刘洋香港理工大学电子计算学系/人工智能与数据科学系副教授。她的研究兴趣包括机器学习、联邦学习、多智能体系统,以及大模型在跨学科科学研究与产业的应用。她拥有30多项国际、国内发明专利,研究成果曾发表于国际会议与期刊Nature、JMLR、AAAI等,Google Scholar引用3万多次。她合著《联邦学习》等3项专著,曾获AAAI人工智能创新应用奖、CCF科技成果奖等多个奖项,被评为《麻省理工科技评论》中国隐私计算创新人物。张晓今华中科技大学计算机科学与技术学院助理教授,海外高层次引进人才,东湖青年学者。主要从事可信联邦学习、理论计算机科学及人工智能应用等领域的研究。2014年获山东大学数学与金融双学士学位,2017年获中国科学院大学计算技术研究所工学硕士学位,2021年获香港中文大学计算机科学哲学博士学位。2021年至2023年在香港科技大学从事博士后研究。研究成果发表于Nature Communications、AIJ、ICML、ICLR、CVPR、AAAI、TCS、UAI、TIST、ICDE、COLING等国际顶级期刊与会议。
目录
第 1 章 简介 1
1.1 数据的价值与数据空间 2
1.1.1 数据的隐私安全 2
1.1.2 数据的资产属性 3
1.1.3 数据空间 3
1.2 联邦学习 4
1.3 可信联邦学习 5
1.3.1 可信联邦学习的定义 6
1.3.2 可信联邦学习的知识体系 8
1.4 联邦学习的发展 9
1.4.1 联邦学习开源平台 9
1.4.2 联邦学习标准化进展 10
1.5 本章小结 11
第 2 章 联邦学习基础算法 12
2.1 横向联邦学习 13
2.2 纵向联邦学习 14
2.3 联邦迁移学习 16
2.4 联邦强化学习 17
2.5 联邦图学习 18
2.6 自动化联邦学习 21
2.7 联邦元学习 21
2.8 本章小结 24
第 3 章 联邦大模型 25
3.1 横向联邦大模型 26
3.2 纵向联邦大模型 28
3.2.1 训练过程 29
3.2.2 针对 VFL-LLM 的攻防
方法 31
3.3 联邦大小模型 32
3.3.1 联邦迁移大模型 34
3.3.2 联邦协同大模型 35
3.3.3 跨模态联邦大小模型学习
框架 CreamFL 36
3.3.4 大小模型互增强框架
CrossML 39
3.3.5 联邦知识迁移框架
FedKTL 40
3.3.6 大模型知识融合迁移框架
FuseGen 41
3.4 可信联邦大模型 42
3.5 其他分类方式 44
3.6 本章小结 46
第 4 章 联邦学习安全性 49
4.1 安全威胁模型 50
4.2 联邦学习的安全分级 51
4.2.1 问题描述 52
4.2.2 隐私数据安全保护等级 52
4.2.3 模型安全保护等级 54
4.3 针对联邦学习的攻击 55
4.3.1 半诚实攻击 55
4.3.2 恶意攻击 58
4.4 联邦学习的防御 60
4.4.1 基于统计信息的防御策略 61
4.4.2 基于聚类的防御策略 62
4.4.3 基于服务端样本的防御策略 63
4.4.4 基于历史梯度的防御策略 64
4.4.5 混合防御策略 64
4.4.6 基于服务端评估的防御策略 65
4.4.7 基于客户端评估的防御
策略 66
4.5 攻防技术总结 66
4.6 本章小结 68
第 5 章 联邦学习效率 70
5.1 联邦学习效率概述 71
5.2 通信层面优化的效率提高 71
5.2.1 不可靠通信环境的定义 72
5.2.2 针对通信资源有限的效率
提高 72
5.2.3 针对节点丢失的效率提高 77
5.2.4 针对通信干扰的效率提高 77
5.2.5 挑战与展望 78
5.3 算法层面优化的训练效率提高 79
5.3.1 横向联邦学习训练效率
优化 80
5.3.2 纵向联邦学习训练效率
优化 82
5.4 硬件加速层面优化的训练
效率提高 88
5.4.1 使用 GPU 加速计算 88
5.4.2 使用 FPGA 加速计算 89
5.4.3 混合精度训练 90
5.5 本章小结 91
第 6 章 无免费午餐定理 94
6.1 无免费午餐定理的意义 95
6.2 证明无免费午餐定理 95
6.2.1 场景定义 96
6.2.2 符号定义 98
6.2.3 隐私泄露 98
6.2.4 效用损失 99
6.2.5 效率损失 100
6.2.6 无免费午餐定理 101
6.2.7 无免费午餐定理应用 102
6.3 概率近似正确联邦学习 103
6.3.1 基本概念 104
6.3.2 联邦学习场景下的概率近
似正确学习 105
6.3.3 结果分析 108
6.4 本章小结 112
第 7 章 联邦学习的多目标
优化 115
7.1 联邦学习的多目标问题 116
7.1.1 基本概念 116
7.1.2 联邦学习场景下的多目标
优化问题定义 119
7.1.3 联邦学习多目标优化算法
介绍 121
7.2 博弈均衡 122
7.2.1 基本概念 122
7.2.2 联邦学习场景下的攻防
博弈 125
7.2.3 结果分析 126
7.3 本章小结 127
第 8 章 个性化联邦学习 129
8.1 异构性和个性化联邦学习 130
8.1.1 联邦学习的异构性定义和
分类 130
8.1.2 个性化联邦学习的动机 130
8.2 基于数据异构性的个性化
联邦学习 131
8.2.1 基本概念 131
8.2.2 算法介绍 132
8.3 基于设备异构性的个性化
联邦学习 136
8.3.1 基本概念 136
8.3.2 算法介绍 136
8.4 基于模型异构性的个性化
联邦学习 140
8.4.1 基本概念 140
8.4.2 算法介绍 141
8.5 本章小结 147
第 9 章 联邦学习公平性 149
9.1 基本概念 150
9.2 联邦学习场景下的公平性
问题定义 151
9.3 算法介绍 152
9.3.1 模型性能的偏见性 152
9.3.2 公平的贡献评估体系 155
9.3.3 设备的公平选择 159
9.4 本章小结 163
第 10 章 联邦学习贡献度
与激励机制 166
10.1 基本概念 167
10.2 联邦学习场景下的贡献度
评估 167
10.2.1 朴素的联邦夏普利值
实现 168
10.2.2 基于采样的优化策略 169
10.2.3 基于截断的优化策略 170
10.2.4 基于群组测试的优化
策略 171
10.3 联邦学习场景下的激励机制
设计 173
10.3.1 收益分享 173
10.3.2 基于区块链实现的联邦
学习激励机制 174
10.3.3 一种注重公平的收益
分享框架 FLI 179
10.4 本章小结 183
第 11 章 模型知识产权
保护 185
11.1 基本概念 186
11.1.1 基于白盒的水印嵌入 187
11.1.2 基于黑盒的水印嵌入 188
11.2 联邦学习场景下的水印嵌入 189
11.3 算法介绍 190
11.3.1 基于黑盒在客户端侧
实现的水印嵌入 191
11.3.2 基于白盒在客户端侧
实现的水印嵌入 192
11.3.3 基于黑盒在服务端侧
实现的水印嵌入 194
11.3.4 基于白盒在服务端侧
实现的水印嵌入 196
11.4 本章小结 197
第 12 章 联邦学习应用 200
12.1 联邦学习在医疗领域中的
应用 201
12.1.1 新药研发 201
12.1.2 临床辅助诊断与治疗 202
12.1.3 基于可穿戴设备的健康
管理 203
12.1.4 全基因组分析 204
12.1.5 电子健康记录管理 204
12.1.6 最新进展 205
12.2 联邦学习在金融领域中的
应用 205
12.2.1 联邦学习在反洗钱模型
中的应用 205
12.2.2 联邦学习在保险定价中
的应用 207
12.2.3 最新进展 209
12.3 联邦学习在个性化推荐中的
应用 209
12.3.1 纵向联邦矩阵分解 209
12.3.2 横向联邦矩阵分解 211
12.3.3 纵向联邦因子分解机 211
12.3.4 联邦图神经网络推荐 212
12.3.5 最新进展 213
12.4 联邦学习在计算机视觉领域
中的应用 214
12.4.1 联邦学习在智能监控和
安防中的应用 214
12.4.2 联邦学习在自动驾驶
中的应用 215
12.5 联邦学习在语音识别领域
中的应用 215
12.6 本章小结 216
第 13 章 总结与展望 219
13.1 研究现状与未来趋势 220
13.1.1 系统和模型设计 221
13.1.2 安全隐私 222
13.1.3 联邦学习与大模型
技术的融合 222
13.2 商业化现状与未来趋势 223
13.2.1 联邦学习在医疗领域的
商业化应用 223
13.2.2 联邦学习在金融领域的
商业化应用 224
13.2.3 联邦学习在智慧城市
领域的商业化应用 224
13.2.4 联邦学习在移动互联网
领域的商业化应用 225
13.2.5 联邦学习商业化应用
趋势 225
13.3 总结 226
参考文献 227