第8章 联邦学习与CV、NLP及推荐系统
专题导航:总览 · CV、NLP与推荐 · 联邦强化学习 · 行业应用 · 生态与法律
本章先记住
- CV、NLP和推荐系统共享联邦训练骨架,但模型大小、数据异质性和个性化需求完全不同。
- 先判断哪些参数适合共享、哪些状态必须留在本地,再讨论隐私机制。
- 平均精度不能覆盖罕见词、长尾商品和小机构的性能。
🧭 学习目标与本章地图
本章定位
- 在知识体系中的位置:把第4~6章的算法框架映射到三类机器学习任务。
- 前置知识:FedAvg、深度神经网络、协同过滤、隐私协议。
- 后续基础:行业落地评估、端侧训练、个性化模型和联邦基础模型。
- 核心问题:不同任务的数据、模型和部署方式如何改变联邦学习的瓶颈?
一句话总结
CV受模型与图像异构限制,NLP受敏感序列与端侧资源限制,推荐系统受稀疏交互、冷启动和个性化限制,但三者都不能仅凭“数据本地化”解决隐私问题。
学习目标
- 重建联邦目标检测、OOV建模和协同过滤的流程。
- 判断三个案例属于何种数据划分。
- 识别任务特有的通信、隐私和偏差风险。
- 区分共享参数与保留本地的个性化参数。
Mermaid思维导图
一、核心场景
场景卡:联邦目标检测
| 项目 | 内容 |
|---|---|
| 应用任务 | 多家公司协作训练目标检测模型 |
| 参与方 | 图像数据拥有公司、聚合服务器 |
| 各方拥有的数据 | 本地标注图像/视频 |
| 样本是否重叠 | 通常不重叠 |
| 特征是否重叠 | 输入/标签模式对齐 |
| 标签由谁持有 | 各参与方本地持有 |
| 联邦学习类型 | HFL |
| 交换的信息 | 受保护的模型参数/更新 |
| 主要隐私风险 | 梯度反演、图像/标签分布泄露、模型记忆 |
| 主要系统风险 | CNN/检测模型过大、设备异构、训练耗时 |
| 为什么不能直接集中数据 | 图像敏感、监管和商业限制 |
text
下载共享检测模型
↓
各公司用本地标注图像训练
↓
通过安全协议上传更新
↓
服务器聚合并更新共享模型
↓
持续迭代与本地部署1
2
3
4
5
6
7
8
9
2
3
4
5
6
7
8
9

联邦计算机视觉还包括多机构医疗影像、联邦主成分分析和预训练模型融合等方向。它们共同面对两类困难:图像模型参数量大;独立预训练模型的神经元排列与参数语义可能不对齐,因此不能总是逐元素直接平均。
场景卡:联邦OOV与唤醒词
| 项目 | 内容 |
|---|---|
| 应用任务 | 从端侧输入学习词库外词汇/唤醒词检测 |
| 参与方 | 移动设备与服务器 |
| 各方拥有的数据 | 用户输入序列、语音片段、设备反馈 |
| 样本是否重叠 | 不同用户样本分散 |
| 特征是否重叠 | 模型接口一致,但语言分布Non-IID |
| 标签由谁持有 | 设备本地反馈或标注 |
| 联邦学习类型 | HFL,可能带个性化 |
| 交换的信息 | 序列模型参数/梯度更新 |
| 主要隐私风险 | 文本、联系人、罕见词和语音属性泄露 |
| 主要系统风险 | 电量、内存、在线率和输入分布漂移 |
| 为什么不能直接集中数据 | 输入内容高度敏感且规模巨大 |
text
设备下载共享模型
↓
根据本地输入训练
↓
受保护上传更新
↓
服务器聚合
↓
设备更新共享或个性化模型1
2
3
4
5
6
7
8
9
2
3
4
5
6
7
8
9

⚡ 隐私边界
罕见词和个性化语言模式正是模型最有价值的信号,也可能是最容易关联到个人的信号。安全聚合只让服务器看不到单台设备的更新,不限制最终模型记住罕见内容。
场景卡:联邦协同过滤
| 项目 | 内容 |
|---|---|
| 应用任务 | 利用用户-商品交互进行个性化推荐 |
| 参与方 | 用户设备、电商服务器 |
| 各方拥有的数据 | 评分/评论、订单、浏览、点击和搜索等反馈 |
| 样本是否重叠 | 每个用户只拥有自己的稀疏交互 |
| 特征是否重叠 | 商品空间需对齐 |
| 标签由谁持有 | 用户设备持有本地反馈 |
| 联邦学习类型 | HFL式参数协作,含本地个性化参数 |
| 交换的信息 | 商品因子矩阵的本地更新 |
| 主要隐私风险 | 从商品梯度推断用户偏好和交互 |
| 主要系统风险 | 商品空间巨大、更新稀疏、冷启动和时效性 |
| 为什么不能直接集中数据 | 行为轨迹敏感且涉及大规模监视风险 |
联邦协同过滤保留本地用户因子,服务器共享商品因子:
text
客户端下载全局商品因子矩阵
↓
聚合本地显式/隐式反馈
↓
更新本地用户因子
↓
计算商品因子的本地更新并安全上传
↓
服务器聚合商品因子更新并下发1
2
3
4
5
6
7
8
9
2
3
4
5
6
7
8
9

⭐ 核心结论
推荐系统的“用户因子保留本地”天然形成共享参数与个性化参数的分层,但商品更新仍可暴露交互对象,稀疏梯度尤其容易泄露用户访问过的商品。
二、任务对比
| 维度 | 联邦CV | 联邦NLP | 联邦推荐 |
|---|---|---|---|
| 典型数据 | 图像/视频 | 文本/语音序列 | 用户-商品交互 |
| 主要模型成本 | 大CNN/检测器 | 序列模型和端侧推理 | 大商品表/嵌入 |
| 主要Non-IID | 设备、地点、成像条件 | 语言、用户词汇、时间 | 兴趣和曝光机制 |
| 个性化需求 | 场景/设备适配 | 个人语言习惯 | 核心需求 |
| 典型隐私 | 可视身份和病灶 | 输入内容和声音属性 | 兴趣、购买和身份 |
| 关键基线 | 单机构、集中检测参考 | Local-only、集中语言模型参考 | 非个性化、Local-only推荐 |
三、关键假设、代价与局限
| 假设类型 | 具体假设 | 失效后果 |
|---|---|---|
| 数据假设 | 各方标签语义和预处理一致 | 参数平均融合不兼容任务 |
| 系统假设 | 端侧有足够算力/电量 | 参与集中于高端设备,形成偏差 |
| 模型假设 | 共享部分参数有共同语义 | 预训练模型或嵌入无法直接平均 |
| 信任假设 | 服务器/安全协议按声明运行 | 更新和行为轨迹泄露 |
| 攻击者假设 | 恶意客户端比例有限 | 后门、虚假词汇和推荐操纵 |
已知局限
- CV大模型阻碍移动/嵌入式训练,需要压缩和专用硬件;
- 自动驾驶等场景需要实时通信和高效安全协议;
- NLP标注稀缺,联邦无监督、半监督和迁移学习值得研究;
- 推荐系统仍需同时权衡准确度、通信和安全协议;
- 不完整数据、有效数据量及何种辅助信息最有用仍不清楚。
根据假设推导
- 端侧资源门槛使参与样本偏向高端设备用户;
- 推荐曝光由旧模型决定,训练数据存在反馈回路;
- 图像和语言任务中标签标准不一致可比Non-IID更严重;
- 平均准确率不能反映罕见词、长尾商品或小机构性能。
四、闭卷回忆问题
- 为什么独立预训练的神经网络不能总是直接逐参数平均?
- OOV任务中最有用的罕见信号为什么也是隐私高风险信号?
- 联邦协同过滤中哪些状态适合本地保留,哪些适合共享?
- CV、NLP和推荐的通信瓶颈分别是什么?
- 如何检测端侧资源限制引起的参与偏差?
🔍 参考答案
- 神经元排列和参数语义可能不对齐,同一功能可由不同参数排列表示。
- 罕见词可能直接对应姓名、地址或私人事件,聚合模型也可能记忆。
- 用户因子和原始反馈本地保留,商品因子或其更新跨用户聚合。
- 大检测模型、序列模型端侧训练、巨大稀疏商品嵌入。
- 按设备档位、地区和群体比较参与率、数据分布及模型性能。
🧪 从理解到研究(进阶)
可证伪问题:当低端设备用户的语言分布与高端设备用户不同,设备资源门槛是否会让联邦OOV模型对低端设备用户产生系统性更高的未登录词错误率;资源感知的重加权能否在相同通信预算下降低群体差距?
指标:分设备档位参与率、OOV召回率、最差群体性能、通信量与能耗。
