《联邦学习》全书知识地图
教材:杨强等,《联邦学习》,电子工业出版社,2020年。
用法:先用本页重建全书框架,再进入各章;复习时先遮住正文,只看“闭卷主线”。
⚡ 时效性说明
本书反映的主要是2019年及以前的研究状态。FedProx、SCAFFOLD、FedNova、FedOpt、FedDyn、FedBN、个性化联邦学习、生产级用户差分隐私和联邦大模型等后续进展,需要在教材之外补充。
一句话总纲
联邦学习让多个数据拥有方在不直接集中原始数据的前提下协作训练或使用模型,但必须同时处理数据异质性、通信限制、隐私泄露、恶意攻击和利益分配。
全书定位
- 问题来源:数据孤岛、隐私法规、商业竞争和边缘设备通信限制。
- 技术基础:机器学习、分布式优化、密码学、差分隐私和机制设计。
- 三条算法主线:横向联邦学习、纵向联邦学习、联邦迁移学习。
- 两条保障主线:隐私与安全、激励与治理。
- 应用扩展:计算机视觉、自然语言处理、推荐系统、强化学习和行业协作。
Mermaid知识图
三类联邦学习
| 类型 | 样本ID空间 | 特征空间 | 典型场景 | 训练的核心困难 |
|---|---|---|---|---|
| 横向联邦学习(HFL) | 不同或重叠很少 | 相同 | 多家同类医院、不同手机用户 | Non-IID、客户端漂移、通信与掉线 |
| 纵向联邦学习(VFL) | 大量重叠 | 不同 | 银行与电商的共同客户 | 隐私实体对齐、加密中间量、协同推理 |
| 联邦迁移学习(FTL) | 重叠很少 | 重叠很少 | 不同业务、地区或模态 | 学习共享表征、负迁移、安全迁移 |
每方都有相同结构的数据列,但记录属于不同用户。常通过本地训练和模型聚合得到共享模型。
一次联邦学习任务的八个问题
- 参与方是谁:手机、医院、银行,还是数据服务机构?
- 数据如何划分:样本、特征和标签分别由谁持有?
- 优化什么目标:单一全局模型、个性化模型,还是多任务模型?
- 交换什么信息:模型参数、梯度、激活、加密统计量还是预测结果?
- 信任谁:服务器、协调方和参与方分别是诚实、半诚实还是恶意?
- 隐私保护单位是什么:单条样本、一个用户,还是一家机构?
- 系统约束是什么:带宽、算力、在线率、延迟和客户端规模如何?
- 如何评价:精度、最差客户端、通信量、隐私预算、攻击成功率和公平性分别如何?
核心训练闭环
text
服务器初始化模型
↓
选择本轮参与方
↓
参与方在本地数据上计算
↓
上传模型更新或加密中间结果
↓
服务器聚合 / 多方安全计算
↓
更新共享模型并评估
↓
重复直到停止⭐ 核心结论
联邦学习不是一个单独算法,而是一类带有数据主权、系统异构和隐私安全约束的协作学习问题。FedAvg只是横向联邦学习中最经典的优化基线。
四种隐私机制的边界
| 机制 | 主要保护对象 | 核心作用 | 不能自动解决的问题 |
|---|---|---|---|
| 安全聚合 | 单个客户端更新 | 服务器只能看到更新之和 | 最终模型泄露、投毒攻击 |
| 差分隐私 | 单条样本或单个用户的影响 | 给输出提供可量化的隐私界限 | 任意恶意更新、密码学机密性 |
| 同态加密 | 计算中的明文和中间量 | 允许在密文上执行受支持运算 | 输出本身泄露、低成本训练 |
| 安全多方计算 | 多方私有输入 | 只泄露协议规定的输出 | 输出允许泄露的内容、所有系统攻击 |
⚡ 隐私边界
“原始数据不离开本地”只减少了直接集中数据的风险,并不等于模型更新、中间激活和最终模型不会泄露训练信息。
全书章节链路
| 章节 | 核心问题 | 输出知识 |
|---|---|---|
| 第1章 | 为什么需要联邦学习? | 定义、HFL/VFL/FTL分类、生态视角 |
| 第2章 | 如何描述和保护隐私? | 威胁模型、MPC、HE、DP |
| 第3章 | 联邦学习从哪些分布式技术发展而来? | DML、并行方式、隐私梯度下降 |
| 第4章 | 样本分散时如何训练共享模型? | HFL、FedAvg、安全聚合、通信优化 |
| 第5章 | 特征分散时如何联合建模? | PSI、纵向线性模型、SecureBoost |
| 第6章 | 样本和特征都难对齐时怎么办? | 共享表征、安全联邦迁移 |
| 第7章 | 为什么参与方愿意长期参与? | 贡献估计、收益分享、FLI |
| 第8章 | 如何适配具体机器学习任务? | CV、NLP、推荐系统场景 |
| 第9章 | 如何联合学习序列决策策略? | 横向/纵向联邦强化学习 |
| 第10章 | 哪些行业可能采用? | 金融、医疗、IoT等场景卡 |
| 第11章 | 全书如何统一? | 技术、经济、法律共同构成生态 |
2020年后的问题链
text
FedAvg
├─ 客户端漂移与Non-IID → FedProx / SCAFFOLD / FedDyn
├─ 本地步数不一致 → FedNova
├─ 服务器优化器 → FedOpt(FedAdam / FedYogi)
├─ 特征分布偏移 → FedBN
├─ 单一全局模型不适配所有人 → 个性化联邦学习
├─ 真实设备与在线偏差 → 大规模系统基准与异步FL
├─ 正式隐私保证 → 用户级DP + 安全聚合
└─ 基础模型规模 → 联邦LoRA / Adapter / 指令微调笔记导航
| 文件 | 内容 | 建议用途 |
|---|---|---|
| 00-全书知识地图.md | 全书坐标系与知识链 | 每轮复习入口 |
| 01-引言与联邦学习分类.md | 定义、HFL/VFL/FTL | 分类判断 |
| 02-隐私安全与威胁模型.md | 攻击者与隐私工具 | 建立安全边界 |
| 03-分布式机器学习基础.md | 并行与隐私DML | 理解FL前置技术 |
| 04-横向联邦学习与FedAvg.md | FedSGD、FedAvg、安全聚合 | 闭卷重建算法 |
| 05-纵向联邦学习.md | 纵向线性回归、SecureBoost | 重建VFL训练/推理 |
| 06-联邦迁移学习.md | 表征对齐、AHE/秘密共享FTL | 分析迁移与负迁移 |
| 07-激励机制.md | Shapley、FLI | 贡献与收益治理 |
| 08-应用与扩展.md | CV、NLP、推荐、FRL、行业与法律 | 场景判断与选题 |
| 09-算法卡片.md | 10张独立算法卡 | 伪代码默写 |
| 10-隐私机制卡片.md | 安全聚合、DP、HE、MPC、PSI | 横向对比 |
| 11-闭卷复习题.md | 公式、算法、边界和科研题 | 主动回忆与验收 |
三轮复习路径
- 第一轮:重建骨架。只看本文件的思维导图、章节链路和闭卷主线;答不出的内容再进入对应章节。
- 第二轮:重建算法。遮住算法卡片,逐个写出数据划分、角色、消息、更新公式、终止条件和失效条件。
- 第三轮:压力测试。完成闭卷复习题,重点检查隐私边界、Non-IID、恶意客户端、交集偏差和负迁移。
闭卷主线
不看正文,依次回答:
- HFL、VFL和FTL如何根据样本与特征重叠关系区分?
- 联邦学习与普通分布式训练的约束有何不同?
- 一轮FedAvg包含哪些步骤?
- 为什么Non-IID会使本地更新方向冲突?
- 安全聚合、差分隐私、HE和MPC各保护什么?
- 为什么纵向联邦在推理阶段也可能需要多方在线?
- 为什么贡献评估和收益分配也是联邦系统的一部分?
- 一个可信联邦实验除平均精度外还必须测什么?
