第9章 联邦强化学习
专题导航:总览 · CV、NLP与推荐 · 联邦强化学习 · 行业应用 · 生态与法律
本章先记住
- 强化学习的数据由策略与环境交互产生,不是固定训练集。
- 横向FRL聚合相同任务的多环境模型;纵向FRL融合对同一环境的不同观察。
- 除平均回报外,还必须评价最差环境、约束违反和低概率灾难。
🧭 学习目标与本章地图
本章定位
- 在知识体系中的位置:把联邦约束扩展到状态随动作变化、数据由策略生成的序列决策问题。
- 前置知识:MDP、策略、奖励、价值函数、DQN、同步/异步分布式训练。
- 后续基础:多智能体协作、联邦控制、医疗策略和机器人终身学习。
- 核心问题:如何在不直接共享状态、动作、奖励和经验的情况下协作学习策略?
一句话总结
横向联邦强化学习聚合相同任务的多个智能体模型,纵向联邦强化学习融合各方对同一环境的不同观察,但数据非平稳和策略干预使其比监督式FL更难评价。
学习目标
- 区分分布式RL、HFRL和VFRL。
- 重建横向联邦模型聚合和纵向联邦DQN流程。
- 解释策略变化为什么使训练数据非IID且非平稳。
- 分析奖励、状态和中间激活的隐私边界。
- 设计离线和在线安全评价指标。
Mermaid思维导图
一、核心机制
RL与普通监督学习的区别
监督数据通常先存在;RL经验由当前策略与环境交互产生。一次模型更新会改变后续访问的状态、动作和奖励分布。因此:
- 客户端数据不是固定训练集;
- 客户端策略可能改变环境;
- 聚合旧策略产生的更新可能不再适配当前策略;
- 在线试错可能造成现实安全损失。


横向联邦强化学习(HFRL)
多个智能体执行相同任务,但位于不同环境或地点:
text
智能体在本地环境独立训练
↓
加密上传模型参数
↓
联邦服务器安全融合模型
↓
下发联邦模型
↓
智能体更新本地策略并继续交互1
2
3
4
5
6
7
8
9
2
3
4
5
6
7
8
9

以不同燃煤锅炉的控制智能体为例,各智能体执行相同控制任务,但环境动力学和经验分布可能不同。HFRL试图提高样本效率、缓解单智能体经验相关性并加速学习;这些收益依赖任务间确有可迁移知识,不能无条件成立。
纵向联邦强化学习(VFRL)
各方对同一环境持有不同观察,一方可能掌握动作和奖励,其他方只提供观察知识。典型的联邦DQN流程为:
text
各智能体根据本地观察计算动作或知识
↓
环境返回新观察和奖励
↓
协作智能体计算并加密中间结果
↓
Q网络智能体融合中间结果并计算损失
↓
Q网络智能体发送加密权重梯度
↓
协作智能体更新本地网络1
2
3
4
5
6
7
8
9
10
11
2
3
4
5
6
7
8
9
10
11

训练和推理都可能依赖各观察方在线。天气服务与锅炉控制的例子说明:观察方可以提供“从数据中抽取的价值”,但中间表征和梯度并非天然无泄露。
二、HFRL算法卡(按需展开)
数据、角色与失效条件
- 解决的问题:相同任务的多个RL智能体在不共享原始经验时协作学习。
- 适用的数据划分:相同状态/动作任务接口,不同环境经验。
- 参与角色:RL智能体、联邦服务器。
- 客户端保存的状态:本地经验、策略/价值网络、优化器。
- 服务端保存的状态:联邦模型及聚合状态。
- 每轮交换的信息:加密模型参数/更新。
- 本地更新:与环境交互并训练RL模型。
- 服务端更新:融合各智能体模型。
- 终止条件:任务回报稳定、训练预算或安全阈值。
- 主要优势:汇合多环境知识,可能提高样本效率。
- 主要局限:环境异构、策略非平稳、参数平均未必有策略语义。
- 可能失效的条件:奖励/动作空间不一致,任务相互冲突,离策略偏差过大。
- 应该比较的基线:单智能体、集中经验回放参考、普通分布式RL。
三、HFRL与VFRL对比
| 维度 | HFRL | VFRL |
|---|---|---|
| 环境关系 | 多个相似/不同环境 | 同一环境的不同观察 |
| 任务接口 | 通常相同 | 角色可能异构 |
| 交换对象 | 模型参数/梯度 | 中间激活和梯度 |
| 奖励 | 各智能体可拥有 | 可能只有Q网络方拥有 |
| 推理依赖 | 可本地部署 | 常需多方协作 |
| 主要风险 | 负迁移、陈旧策略 | 观察/奖励推断、强耦合 |
四、关键假设、代价与局限
| 假设类型 | 具体假设 | 失效后果 |
|---|---|---|
| 数据/环境 | 智能体任务间存在可共享知识 | 模型聚合导致负迁移 |
| 系统 | 训练更新与环境时间尺度兼容 | 更新到达时策略已过时 |
| 模型 | 网络参数可安全融合 | 平均策略性能下降 |
| 信任 | 智能体遵守协议 | 奖励操纵、策略投毒、危险动作 |
| 攻击者 | 加噪或加密足以保护经验 | 状态/动作可从梯度和轨迹推断 |
已知局限
- 参数交换或简单高斯噪声面对敌对智能体较脆弱;
- 需要把DP、MPC和HE等机制引入FRL;
- 迁移联邦强化学习和新的FRL机制值得研究。
根据假设推导
- 平均回报不能代表安全性,低概率灾难必须单独测量;
- 策略更新改变数据分布,静态隐私会计和离线验证可能失效;
- 奖励持有方可通过奖励定义控制其他智能体的学习方向;
- 安全计算增加延迟,而控制系统对实时性敏感。
五、闭卷回忆问题
- 为什么RL经验不是静态IID数据?
- HFRL与普通分布式RL的额外约束是什么?
- VFRL中没有奖励的协作智能体如何得到训练信号?
- 为什么参数平均在RL中比监督学习更危险?
- FRL实验除平均回报外必须报告什么?
🔍 参考答案
- 经验由当前策略与环境交互生成,更新策略会改变后续数据分布。
- 不直接共享原始经验,并需保护状态、动作、奖励、梯度和模型。
- Q网络方根据联合损失反向传播并发送受保护梯度。
- 参数变化会改变策略和访问状态分布,平均模型可能产生未评估动作。
- 最差环境回报、失败/约束违反率、样本效率、通信延迟和攻击成功率。
🧪 从理解到研究(进阶)
可证伪问题:当环境动力学异质性逐步增大时,HFRL参数平均是否在提高平均回报的同时增加最差环境的安全约束违反率;基于策略行为距离的选择性聚合能否降低该风险?
指标:平均/最差回报、约束违反率、策略散度、样本量和通信量。
