第8~11章 应用、联邦强化学习与生态扩展
原书范围:第8章PDF第164~179页;第9章PDF第180~195页;第10章PDF第196~209页;第11章PDF第210~211页;附录A PDF第212~225页。
⚡ 时效性说明
本文件中的行业进展、平台、网络技术与法规状态主要反映本书2020年出版前后的情况。尤其是中国数据保护法律部分已经发生重大变化,不能把原书附录直接作为当前合规建议。
第8章 联邦学习与CV、NLP及推荐系统
本章定位
- 在全书中的位置:把第4~6章的算法框架映射到三类机器学习任务。
- 前置知识:FedAvg、深度神经网络、协同过滤、隐私协议。
- 后续基础:行业落地评估、端侧训练、个性化模型和联邦基础模型。
- 核心问题:不同任务的数据、模型和部署方式如何改变联邦学习的瓶颈?
一句话总结
CV受模型与图像异构限制,NLP受敏感序列与端侧资源限制,推荐系统受稀疏交互、冷启动和个性化限制,但三者都不能仅凭“数据本地化”解决隐私问题。
学习目标
- 重建联邦目标检测、OOV建模和协同过滤的流程。
- 判断三个案例属于何种数据划分。
- 识别任务特有的通信、隐私和偏差风险。
- 区分共享参数与保留本地的个性化参数。
Mermaid思维导图
一、核心场景
场景卡:联邦目标检测
| 项目 | 内容 |
|---|---|
| 应用任务 | 多家公司协作训练目标检测模型 |
| 参与方 | 图像数据拥有公司、聚合服务器 |
| 各方拥有的数据 | 本地标注图像/视频 |
| 样本是否重叠 | 通常不重叠 |
| 特征是否重叠 | 输入/标签模式对齐 |
| 标签由谁持有 | 各参与方本地持有 |
| 联邦学习类型 | HFL |
| 交换的信息 | 受保护的模型参数/更新 |
| 主要隐私风险 | 梯度反演、图像/标签分布泄露、模型记忆 |
| 主要系统风险 | CNN/检测模型过大、设备异构、训练耗时 |
| 为什么不能直接集中数据 | 图像敏感、监管和商业限制 |
下载共享检测模型
↓
各公司用本地标注图像训练
↓
通过安全协议上传更新
↓
服务器聚合并更新共享模型
↓
持续迭代与本地部署

原书还介绍医疗影像的去中心化框架、联邦主成分分析,以及通过匹配预训练网络参数构造全局模型。应记住的不是平台名,而是两类困难:图像模型参数量大;独立预训练的神经元/参数存在排列与语义不对齐,不能总是逐元素直接平均。
场景卡:联邦OOV与唤醒词
| 项目 | 内容 |
|---|---|
| 应用任务 | 从端侧输入学习词库外词汇/唤醒词检测 |
| 参与方 | 移动设备与服务器 |
| 各方拥有的数据 | 用户输入序列、语音片段、设备反馈 |
| 样本是否重叠 | 不同用户样本分散 |
| 特征是否重叠 | 模型接口一致,但语言分布Non-IID |
| 标签由谁持有 | 设备本地反馈或标注 |
| 联邦学习类型 | HFL,可能带个性化 |
| 交换的信息 | 序列模型参数/梯度更新 |
| 主要隐私风险 | 文本、联系人、罕见词和语音属性泄露 |
| 主要系统风险 | 电量、内存、在线率和输入分布漂移 |
| 为什么不能直接集中数据 | 输入内容高度敏感且规模巨大 |
设备下载共享模型
↓
根据本地输入训练
↓
受保护上传更新
↓
服务器聚合
↓
设备更新共享或个性化模型
⚡ 隐私边界
罕见词和个性化语言模式正是模型最有价值的信号,也可能是最容易关联到个人的信号。安全聚合只让服务器看不到单台设备的更新,不限制最终模型记住罕见内容。
场景卡:联邦协同过滤
| 项目 | 内容 |
|---|---|
| 应用任务 | 利用用户-商品交互进行个性化推荐 |
| 参与方 | 用户设备、电商服务器 |
| 各方拥有的数据 | 评分/评论、订单、浏览、点击和搜索等反馈 |
| 样本是否重叠 | 每个用户只拥有自己的稀疏交互 |
| 特征是否重叠 | 商品空间需对齐 |
| 标签由谁持有 | 用户设备持有本地反馈 |
| 联邦学习类型 | HFL式参数协作,含本地个性化参数 |
| 交换的信息 | 商品因子矩阵的本地更新 |
| 主要隐私风险 | 从商品梯度推断用户偏好和交互 |
| 主要系统风险 | 商品空间巨大、更新稀疏、冷启动和时效性 |
| 为什么不能直接集中数据 | 行为轨迹敏感且涉及大规模监视风险 |
联邦协同过滤保留本地用户因子,服务器共享商品因子:
客户端下载全局商品因子矩阵
↓
聚合本地显式/隐式反馈
↓
更新本地用户因子
↓
计算商品因子的本地更新并安全上传
↓
服务器聚合商品因子更新并下发
⭐ 核心结论
推荐系统的“用户因子保留本地”天然形成共享参数与个性化参数的分层,但商品更新仍可暴露交互对象,稀疏梯度尤其容易泄露用户访问过的商品。
二、任务对比
| 维度 | 联邦CV | 联邦NLP | 联邦推荐 |
|---|---|---|---|
| 典型数据 | 图像/视频 | 文本/语音序列 | 用户-商品交互 |
| 主要模型成本 | 大CNN/检测器 | 序列模型和端侧推理 | 大商品表/嵌入 |
| 主要Non-IID | 设备、地点、成像条件 | 语言、用户词汇、时间 | 兴趣和曝光机制 |
| 个性化需求 | 场景/设备适配 | 个人语言习惯 | 核心需求 |
| 典型隐私 | 可视身份和病灶 | 输入内容和声音属性 | 兴趣、购买和身份 |
| 关键基线 | 单机构、集中检测 | Local-only、集中语言模型 | 非个性化、Local-only推荐 |
三、关键假设、代价与局限
| 假设类型 | 具体假设 | 失效后果 |
|---|---|---|
| 数据假设 | 各方标签语义和预处理一致 | 参数平均融合不兼容任务 |
| 系统假设 | 端侧有足够算力/电量 | 参与集中于高端设备,形成偏差 |
| 模型假设 | 共享部分参数有共同语义 | 预训练模型或嵌入无法直接平均 |
| 信任假设 | 服务器/安全协议按声明运行 | 更新和行为轨迹泄露 |
| 攻击者假设 | 恶意客户端比例有限 | 后门、虚假词汇和推荐操纵 |
原书明确指出
- CV大模型阻碍移动/嵌入式训练,需要压缩和专用硬件;
- 自动驾驶等场景需要实时通信和高效安全协议;
- NLP标注稀缺,联邦无监督、半监督和迁移学习值得研究;
- 推荐系统仍需同时权衡准确度、通信和安全协议;
- 不完整数据、有效数据量及何种辅助信息最有用仍不清楚。
根据假设推导
- 端侧资源门槛使参与样本偏向高端设备用户;
- 推荐曝光由旧模型决定,训练数据存在反馈回路;
- 图像和语言任务中标签标准不一致可比Non-IID更严重;
- 平均准确率不能反映罕见词、长尾商品或小机构性能。
四、图示回查
| 原书图 | PDF页码 | 应记住的关系 |
|---|---|---|
| 图8-1 | 166 | 公司本地训练目标检测器,服务器聚合 |
| 图8-2 | 167 | 联邦更新后的检测模型本地部署 |
| 图8-3 | 171 | 多设备OOV知识汇合后服务各设备 |
| 图8-4 | 177 | 用户因子本地、商品因子联邦共享 |
五、闭卷回忆问题
- 为什么独立预训练的神经网络不能总是直接逐参数平均?
- OOV任务中最有用的罕见信号为什么也是隐私高风险信号?
- 联邦协同过滤中哪些状态适合本地保留,哪些适合共享?
- CV、NLP和推荐的通信瓶颈分别是什么?
- 如何检测端侧资源限制引起的参与偏差?
🔍 参考答案
- 神经元排列和参数语义可能不对齐,同一功能可由不同参数排列表示。
- 罕见词可能直接对应姓名、地址或私人事件,聚合模型也可能记忆。
- 用户因子和原始反馈本地保留,商品因子或其更新跨用户聚合。
- 大检测模型、序列模型端侧训练、巨大稀疏商品嵌入。
- 按设备档位、地区和群体比较参与率、数据分布及模型性能。
从教材到科研
可证伪问题:当低端设备用户的语言分布与高端设备用户不同,设备资源门槛是否会让联邦OOV模型对低端设备用户产生系统性更高的未登录词错误率;资源感知的重加权能否在相同通信预算下降低群体差距?
指标:分设备档位参与率、OOV召回率、最差群体性能、通信量与能耗。
第9章 联邦强化学习
本章定位
- 在全书中的位置:把联邦约束扩展到状态随动作变化、数据由策略生成的序列决策问题。
- 前置知识:MDP、策略、奖励、价值函数、DQN、同步/异步分布式训练。
- 后续基础:多智能体协作、联邦控制、医疗策略和机器人终身学习。
- 核心问题:如何在不直接共享状态、动作、奖励和经验的情况下协作学习策略?
一句话总结
横向联邦强化学习聚合相同任务的多个智能体模型,纵向联邦强化学习融合各方对同一环境的不同观察,但数据非平稳和策略干预使其比监督式FL更难评价。
学习目标
- 区分分布式RL、HFRL和VFRL。
- 重建横向联邦模型聚合和纵向联邦DQN流程。
- 解释策略变化为什么使训练数据非IID且非平稳。
- 分析奖励、状态和中间激活的隐私边界。
- 设计离线和在线安全评价指标。
Mermaid思维导图
一、核心机制
RL与普通监督学习的区别
监督数据通常先存在;RL经验由当前策略与环境交互产生。一次模型更新会改变后续访问的状态、动作和奖励分布。因此:
- 客户端数据不是固定训练集;
- 客户端策略可能改变环境;
- 聚合旧策略产生的更新可能不再适配当前策略;
- 在线试错可能造成现实安全损失。


横向联邦强化学习(HFRL)
多个智能体执行相同任务,但位于不同环境或地点:
智能体在本地环境独立训练
↓
加密上传模型参数
↓
联邦服务器安全融合模型
↓
下发联邦模型
↓
智能体更新本地策略并继续交互
原书以不同燃煤锅炉控制智能体为例。各智能体有相同控制任务,但环境动力学和经验分布可能不同。HFRL试图提高样本效率、缓解单智能体经验相关性并加速学习;这些收益依赖任务可迁移,不能无条件成立。
纵向联邦强化学习(VFRL)
各方对同一环境持有不同观察,一方可能掌握动作/奖励,其他方只提供观察知识。原书联邦DQN流程:
各智能体根据本地观察计算动作或知识
↓
环境返回新观察和奖励
↓
协作智能体计算并加密中间结果
↓
Q网络智能体融合中间结果并计算损失
↓
Q网络智能体发送加密权重梯度
↓
协作智能体更新本地网络
训练和推理都可能依赖各观察方在线。天气服务与锅炉控制的例子说明:观察方可以提供“从数据中抽取的价值”,但中间表征和梯度并非天然无泄露。
二、算法卡:HFRL模型聚合
- 解决的问题:相同任务的多个RL智能体在不共享原始经验时协作学习。
- 适用的数据划分:相同状态/动作任务接口,不同环境经验。
- 参与角色:RL智能体、联邦服务器。
- 客户端保存的状态:本地经验、策略/价值网络、优化器。
- 服务端保存的状态:联邦模型及聚合状态。
- 每轮交换的信息:加密模型参数/更新。
- 本地更新:与环境交互并训练RL模型。
- 服务端更新:融合各智能体模型。
- 终止条件:任务回报稳定、训练预算或安全阈值。
- 主要优势:汇合多环境知识,可能提高样本效率。
- 主要局限:环境异构、策略非平稳、参数平均未必有策略语义。
- 可能失效的条件:奖励/动作空间不一致,任务相互冲突,离策略偏差过大。
- 应该比较的基线:单智能体、集中经验回放、普通分布式RL。
三、HFRL与VFRL对比
| 维度 | HFRL | VFRL |
|---|---|---|
| 环境关系 | 多个相似/不同环境 | 同一环境的不同观察 |
| 任务接口 | 通常相同 | 角色可能异构 |
| 交换对象 | 模型参数/梯度 | 中间激活和梯度 |
| 奖励 | 各智能体可拥有 | 可能只有Q网络方拥有 |
| 推理依赖 | 可本地部署 | 常需多方协作 |
| 主要风险 | 负迁移、陈旧策略 | 观察/奖励推断、强耦合 |
四、关键假设、代价与局限
| 假设类型 | 具体假设 | 失效后果 |
|---|---|---|
| 数据/环境 | 智能体任务间存在可共享知识 | 模型聚合导致负迁移 |
| 系统 | 训练更新与环境时间尺度兼容 | 更新到达时策略已过时 |
| 模型 | 网络参数可安全融合 | 平均策略性能下降 |
| 信任 | 智能体遵守协议 | 奖励操纵、策略投毒、危险动作 |
| 攻击者 | 加噪或加密足以保护经验 | 状态/动作可从梯度和轨迹推断 |
原书明确指出
- 参数交换或简单高斯噪声面对敌对智能体较脆弱;
- 需要把DP、MPC和HE等机制引入FRL;
- 迁移联邦强化学习和新的FRL机制值得研究。
根据假设推导
- 平均回报不能代表安全性,低概率灾难必须单独测量;
- 策略更新改变数据分布,静态隐私会计和离线验证可能失效;
- 奖励持有方可通过奖励定义控制其他智能体的学习方向;
- 安全计算增加延迟,而控制系统对实时性敏感。
五、图表回查
| 原书图/表 | PDF页码 | 应记住的关系 |
|---|---|---|
| 图9-1 | 181 | 状态-动作-奖励-下一状态闭环 |
| 图9-2 | 183 | 锅炉观察、控制动作和环境演进 |
| 表9-1 | 185 | RL算法按模型/价值/策略/更新方式分类 |
| 图9-3 | 191 | 多锅炉智能体向联邦服务器聚合模型 |
| 图9-4 | 193 | 多观察方把中间结果送给Q网络方 |
六、闭卷回忆问题
- 为什么RL经验不是静态IID数据?
- HFRL与普通分布式RL的额外约束是什么?
- VFRL中没有奖励的协作智能体如何得到训练信号?
- 为什么参数平均在RL中比监督学习更危险?
- FRL实验除平均回报外必须报告什么?
🔍 参考答案
- 经验由当前策略与环境交互生成,更新策略会改变后续数据分布。
- 不直接共享原始经验,并需保护状态、动作、奖励、梯度和模型。
- Q网络方根据联合损失反向传播并发送受保护梯度。
- 参数变化会改变策略和访问状态分布,平均模型可能产生未评估动作。
- 最差环境回报、失败/约束违反率、样本效率、通信延迟和攻击成功率。
从教材到科研
可证伪问题:当环境动力学异质性逐步增大时,HFRL参数平均是否在提高平均回报的同时增加最差环境的安全约束违反率;基于策略行为距离的选择性聚合能否降低该风险?
指标:平均/最差回报、约束违反率、策略散度、样本量和通信量。
第10章 应用前景
本章定位
- 在全书中的位置:用金融、医疗、教育、城市、边缘、区块链和5G说明联邦学习的产业动机。
- 前置知识:HFL/VFL/FTL分类、隐私安全、激励与系统约束。
- 后续基础:项目可行性评估、参与方治理、法规与风险分析。
- 核心问题:一个行业“有数据孤岛”是否足以证明应使用联邦学习?
一句话总结
行业采用联邦学习的前提不是数据敏感本身,而是多方数据确有互补价值、合法处理基础、可执行协议和可持续收益。
学习目标
- 用场景卡识别数据划分、标签方和交换信息。
- 说明为何不能直接集中数据。
- 判断FL相对Local-only和集中训练是否有真实增益。
- 识别行业场景中的系统、隐私和治理风险。
Mermaid思维导图
一、行业场景卡
| 场景 | 参与方与数据 | FL类型 | 交换信息 | 主要风险 | 不能集中原因 |
|---|---|---|---|---|---|
| 智慧消费金融 | 银行资质/信用、社交偏好、电商商品/消费 | VFL/FTL | 加密中间量/表征 | 歧视、标签滥用、关联推断 | 金融监管、商业与目的限制 |
| 医疗诊断 | 医院影像、病历、检查、标签 | HFL/VFL/FTL | 模型或加密统计 | 患者重识别、域偏移、安全责任 | 高敏感健康数据与机构治理 |
| 个性化教育 | 学校/AIS知识图谱、学生设备行为 | HFL/FTL | 模型/表征 | 未成年人隐私、画像和不公平路径 | 学生数据保护与机构边界 |
| 智慧城市 | 交通、气象、排放、传感器 | VFL/HFL | 模型、统计和表征 | 大规模监视、位置泄露、治理不透明 | 部门孤岛、企业竞争、目的不同 |
| 边缘与IoT | 手机、家居和传感设备 | HFL | 端侧模型更新 | 设备偏差、投毒、能源消耗 | 原始数据量大、低延迟和隐私 |
| 区块链+FL | 参与方更新与分布式账本 | 架构组合 | 更新摘要/审计记录 | 永久记录与隐私冲突、吞吐 | 追踪篡改与责任归属需求 |
| 5G/无线 | 用户设备、基站、边缘节点 | HFL/分层FL | 更新与网络状态 | 无线窃听、参与偏差、时延 | 数据位于网络边缘且带宽受限 |





⚡ 易混淆点
区块链的不可篡改和可追踪性不等于模型更新正确,也不等于数据私密。把更新或元数据永久写入账本,可能增加可链接性、删除困难和合规风险。
二、项目判定清单
在决定使用FL前,依次回答:
- 多方数据的样本、特征和标签如何分布?
- Local-only的性能缺口是否真实存在?
- 集中处理是否真的不可行,法律基础是什么?
- 交换更新是否比原始数据更低风险,如何证明?
- 训练和推理需要哪些方长期在线?
- 谁拥有模型、收益、审计权和退出权?
- 模型失败由谁承担责任?
- FL相对集中、可信执行环境或数据洁净室是否更合适?
三、图示回查
| 原书图 | PDF页码 | 应记住的关系 |
|---|---|---|
| 图10-1 | 198 | 金融、社交和电商异构特征协作 |
| 图10-2 | 200 | 多医疗机构数据支持联合诊断 |
| 图10-3 | 202 | 通用学习计划与本地个性化教育 |
| 图10-4 | 204 | 城市多主体通过联邦打通数据孤岛 |
| 图10-5 | 207 | 边缘设备本地训练、云侧协作 |
四、关键假设与局限
| 维度 | 收益 | 代价或风险 |
|---|---|---|
| 模型效果 | 跨方互补数据提高覆盖 | 域偏移、标签标准和交集偏差 |
| 计算通信 | 数据附近计算、减少原始上传 | 密文与多轮协议、端侧能耗 |
| 隐私 | 减少直接集中 | 更新、输出、元数据仍泄露 |
| 鲁棒性 | 多源信息可提高覆盖 | 恶意方、单点和协同推理依赖 |
| 公平治理 | 多方共享收益 | 大机构控制、贡献难衡量 |
从教材到科研
可证伪问题:在跨医院影像FL中,当设备厂商与患者群体同时偏移时,按医院平均的FedAvg改进是否来自设备特征而非病理知识;跨设备留一测试能否揭示这种伪泛化?
指标:院内/跨院/跨设备AUC、校准、最差医院性能和模型对设备属性的可预测性。
第11章 总结、生态与法律边界
本章定位
- 在全书中的位置:把算法、隐私安全、系统、激励和法律统一为联邦学习生态。
- 前置知识:全书第1~10章。
- 后续基础:完整项目治理与科研问题选择。
- 核心问题:为什么联邦学习不是部署一个聚合算法就结束?
一句话总结
可持续联邦系统必须同时满足统计有效、协议安全、系统可用、经济公平和法律合规,任一层失败都可能使整体目标失效。
学习目标
- 用五层框架审查一个联邦项目。
- 区分技术隐私保证与法律合规。
- 识别原书法律内容的时效边界。
- 形成全书研究问题链。
Mermaid思维导图
一、五层验收框架
| 层 | 核心问题 | 最低证据 |
|---|---|---|
| 统计 | 联邦模型真的优于Local-only吗? | 多分布测试、最差方指标、消融 |
| 系统 | 在真实带宽、掉线和设备条件下可运行吗? | 墙钟时间、通信量、能耗、恢复测试 |
| 安全 | 保护谁、抵御谁、允许泄露什么? | 明确威胁模型、协议证明、攻击测试 |
| 经济 | 谁付出、谁获益、谁会退出? | 贡献/成本机制、预算和长期留存 |
| 法律 | 处理活动本身是否合法且可问责吗? | 角色、目的、合法基础、权利和审计流程 |
⚡ 隐私边界
联邦学习是一种技术架构,不是法律豁免。即使原始数据不离开本地,实体对齐、梯度、模型、预测和参与元数据仍可能构成个人数据处理。
二、附录A法律知识骨架
原书保留的通用原则
- 角色:数据主体、控制者、处理者及跨组织关系必须明确。
- 处理范围:收集、存储、训练、推理、传输和删除都属于治理对象。
- 原则:合法公平透明、目的限制、数据最小化、准确、存储限制、完整性与机密性、问责。
- 权利:知情、访问、更正、删除、限制、可携、反对及与自动决策相关的权利。
- 工程要求:隐私保护应在设计与默认设置中落实,不能只依赖事后声明。
时效性说明
⚡ 时效性说明
原书称当时中国“没有单一完整的数据保护法律”,并介绍《网络安全法》、旧版个人信息安全规范及若干草案。这是2020年前后的状态。此后中国已施行《数据安全法》和《个人信息保护法》等重要法律制度;美国州法及欧盟数据治理也持续变化。实际项目必须由合格法律与合规人员依据当前法域和业务事实判断。
| 原书法域 | 原书重点 | 阅读时必须补充的判断 |
|---|---|---|
| 欧盟 | GDPR术语、原则、数据主体权利、设计保护、泄露通知 | FL各方控制者/处理者关系、跨境、自动决策和可删除性 |
| 美国 | 联邦行业法与州法并存,CCPA等 | 当前州法变化、行业监管及具体适用范围 |
| 中国 | 网络安全、消费者、电商、健康数据等规则 | 当前个人信息、重要数据、跨境及算法治理要求 |
三、全书最终结论
- HFL、VFL和FTL由样本/特征重叠关系决定,不由行业名称决定。
- FedAvg是优化基线,不是隐私机制。
- HE/MPC保护计算中的输入与中间量,DP限制个体对输出的影响。
- 安全聚合隐藏单个更新,却可能降低逐客户端异常检测能力。
- VFL/FTL的训练与推理通常都依赖多方在线。
- 平均性能不足以证明联邦收益,应报告尾部、公平、安全和系统指标。
- 激励、审计和法律责任是系统组成,不是算法部署后的附加项。
四、开放研究问题
- 如何同时优化Non-IID收敛、用户级DP、鲁棒性和群体公平?
- 如何在安全聚合下检测投毒,又不恢复单个诚实更新?
- 如何校正VFL实体交集造成的选择偏差?
- 如何检测FTL负迁移并证明迁移收益来自可泛化知识?
- 如何在联邦大模型中分配数据、算力和参数高效更新的贡献?
- 如何实现参与方退出、数据主体删除和已训练模型治理?
五、闭卷回忆问题
- 为什么技术安全证明不能替代合法性判断?
- 联邦项目的五层验收分别是什么?
- 为什么“数据最小化”仍适用于不上传原始数据的FL?
- 一个模型性能提高但最差客户端、安全和能耗恶化的项目是否成功?
- 原书附录中的哪些内容必须按当前法律重新核对?
🔍 参考答案
- 法律还要求处理目的、角色、权利、跨境和问责,密码协议只覆盖特定信息流。
- 统计、系统、安全、经济和法律治理。
- 梯度、ID交集、模型和预测也可能超出任务必要范围。
- 不能仅凭平均精度判定,应按项目约束和多维指标验收。
- 中国、美国和欧盟的现行规则、跨境要求、自动决策和平台状态等。
从教材到科研
可证伪问题:当联邦系统支持参与方退出或数据删除请求时,仅停止未来参与是否足以消除其历史影响;现有联邦遗忘方法能否在给定误差界内接近从未见过该数据的重训练模型?
指标:参数/预测距离、成员推断优势、遗忘时间、重训练成本和剩余客户端效用。
