第6章 联邦迁移学习
原书范围:PDF第134~149页。
本章定位
- 在全书中的位置:三类联邦学习算法主线的第三章,处理样本和特征都难以充分对齐的异构协作。
- 前置知识:迁移学习、神经网络表征、VFL、安全计算、AHE和秘密共享。
- 后续基础:跨域联邦、多模态联邦、弱监督联邦和联邦表征学习。
- 核心问题:只有少量共同样本、特征空间又不同,如何利用源域标签帮助目标域预测,并控制共享表征的泄露?
一句话总结
联邦迁移学习通过少量对齐样本约束两方隐藏表征,在监督损失、表征对齐和正则化之间联合优化,从而把源域标签知识迁移到目标域。
学习目标
- 解释何时HFL/VFL都不适用而需要FTL。
- 区分基于实例、特征和模型的联邦迁移。
- 重建原书基于特征的FTL数据与角色设置。
- 解释监督损失、对齐损失和正则项各自作用。
- 比较AHE版与秘密共享版训练/预测流程。
- 识别负迁移、恶意输入和共享表征泄露风险。
Mermaid思维导图
一、本章要解决的问题
HFL要求特征空间足够一致,VFL要求样本空间有大量重叠。现实中的跨地区银行、不同业务平台或不同模态机构可能同时存在:
- 共同用户少;
- 共同特征少;
- 数据分布和规模差异大;
- 目标方标签很少甚至没有。
FTL不再直接平均同构模型或拼接大量共同样本,而是寻找源域与目标域之间可迁移的不变性。原书重点介绍基于特征的两方框架:用少量共同样本让两方神经网络的隐藏表征对齐,再借助源域标签预测目标域未标注样本。
⚡ 易混淆点
“存在相关性”不等于“迁移一定有益”。若对齐样本不代表目标域、任务语义不同或对齐权重过大,共享表征会产生负迁移,使目标域性能低于不迁移的Local-only模型。
二、核心概念与定义
| 概念 | 准确定义 | 通俗理解 | 与相近概念的区别 |
|---|---|---|---|
| 源域 | 数据或监督相对丰富、提供可迁移知识的领域 | 知识提供方 | 不保证规模总是更大,关键是提供监督/知识 |
| 目标域 | 希望改善预测、但数据或标签不足的领域 | 知识接收方 | 最终评价主要在目标域 |
| 联邦迁移学习(FTL) | 在数据不能集中且需隐私保护时,跨样本/特征异构领域迁移知识 | 安全地跨域借知识 | 传统TL通常可直接访问双方数据/模型 |
| 基于实例的迁移 | 选择或重加权源/目标样本以缩小分布差异 | 挑选更像目标域的样本 | 不直接规定共享表征或模型结构 |
| 基于特征的迁移 | 学习使不同领域语义可比较的共同表征 | 把不同字段映射到同一种语言 | 原书6.3重点方法 |
| 基于模型的迁移 | 共享模型、参数或预训练模型作为迁移载体 | 迁移模型知识 | HFL也可被视为一种广义模型迁移 |
| 对齐损失 | 约束共同样本在两方隐藏空间相似的损失 | 同一个人在两个表示中靠近 | 与有标签监督损失作用不同 |
| 负迁移 | 迁移后目标性能反而下降 | 借来的知识带偏目标模型 | 不能只通过训练损失判断 |
原书式(6-1)用三种空间均不同来刻画FTL场景:
其中
三、三类联邦迁移
在HFL中重加权不同分布的样本;在VFL/异构场景中筛除可能造成负迁移的样本或特征。难点是如何在不查看对方数据时估计相似度和权重。
| 类型 | 迁移载体 | 所需联系 | 主要风险 |
|---|---|---|---|
| 实例 | 样本选择/权重 | 可估计样本相关性 | 权重泄露、选择偏差 |
| 特征 | 隐藏表征 | 少量对齐样本或分布约束 | 表征泄露、语义错配 |
| 模型 | 参数/结构/预训练模型 | 任务和模型可复用部分 | 模型不兼容、负迁移 |
四、原书框架的数据与角色
设源域A持有:
目标域B持有未标注数据:
双方有少量共同样本对:
A还持有少量“针对B方数据”的标签集合

两方本地网络生成
其中网络参数分别为

场景卡:跨域弱标签预测
| 项目 | 内容 |
|---|---|
| 应用任务 | 用A方标签知识预测B方未标注样本 |
| 参与方 | 源域A、目标域B |
| 各方拥有的数据 | A有 |
| 样本是否重叠 | 仅少量重叠样本 |
| 特征是否重叠 | 少或无直接重叠 |
| 标签由谁持有 | 原书框架中由A持有 |
| 联邦学习类型 | FTL,基于特征 |
| 交换的信息 | 加密/秘密共享的表征交互、损失和梯度 |
| 主要隐私风险 | 隐藏表征、梯度、标签和共同样本关系泄露 |
| 主要系统风险 | 双方强依赖、密码计算慢、推理交互延迟 |
| 为什么不能直接集中数据 | 隐私、商业和跨域数据治理限制 |
五、关键公式
5.1 目标域监督损失
原书式(6-2):
利用A方知识和B方表征生成目标预测。 是监督损失;原书举Logistic损失:
- 该项要求目标预测能解释已有标签;若
太小,单独优化容易过拟合。
5.2 表征对齐损失
原书式(6-3):
5.3 联合目标
原书式(6-4):
其中:
控制迁移/对齐强度。 控制模型复杂度。 - 增大
通常加强两域耦合,但域差异大时增加负迁移风险。 - 增大
抑制过拟合,但可能降低表征能力。
对
该梯度把监督信号、跨域对齐信号和正则化对应到同一反向传播过程。
5.4 安全计算中的近似
原书AHE版对最终损失相关表达采用二阶泰勒近似,使计算适配加法和标量乘法。原书指出性能损失来自最终损失函数近似,而非每个神经网络激活层,因为两方网络内部仍在本地明文执行。
⚡ 精度声明边界
“只近似最终损失”不等于误差对所有数据、网络和参数都很小。近似误差取决于展开点、Logit范围和训练轨迹,应与非加密原目标逐轮比较。
六、算法卡:AHE联邦迁移学习
- 解决的问题:在少量重叠样本和异构特征下,安全迁移A方监督知识到B方。
- 适用的数据划分:样本和特征重叠均少,两方存在少量可对齐样本。
- 参与角色:源域A、目标域B。
- 客户端保存的状态:各自数据、Net参数、密钥/公钥和随机掩码。
- 服务端保存的状态:无独立服务器;模型和协议状态分散在两方。
- 每轮交换的信息:对方公钥下的加密中间量、加密损失、受掩码梯度。
- 本地更新:各方去除自己的梯度掩码后反向更新本地网络。
- 服务端更新:无中央聚合。
- 核心公式:
。 - 终止条件:A方获得的损失收敛,或达到迭代/时间上限。
- 计算复杂度:本地神经网络前后向加密文运算;密文成本与表征维度、重叠样本和参数交互项相关。
- 通信复杂度:每轮双向交换多组密文梯度/损失,随表示和参数规模增长。
- 隐私机制:AHE保护传输/计算中的中间量,随机掩码防止对方获知确切梯度。
- 信任与攻击者假设:双方半诚实,最多一方被破坏,不处理恶意输入。
- 主要优势:本地网络结构可灵活变化;无需暴露原始数据和本地网络。
- 主要局限:密码计算和密文通信重;损失需近似;协同推理。
- 可能失效的条件:恶意探测输入、密钥泄露、域不相关、对齐样本太少/有偏、近似区间失配。
- 应该比较的基线:B-only、A-only不可直接部署对照、集中TL、明文分布式FTL。
🔍 展开查看:AHE训练与预测流程
训练:
1. A、B在本地运行NetA/NetB,得到uA、uB。
2. A计算并加密帮助B求梯度的中间量;B计算并加密帮助A求梯度/损失的中间量。
3. A、B结合收到的密文计算各自的加密梯度;分别加入随机掩码mA、mB并发给对方解密。
4. A、B解密对方的受掩码结果,再将明文受掩码梯度返回掩码拥有方。
5. 各方去掩码,获得自己的梯度并更新本地网络。
6. 损失收敛则A向B发送停止信号,否则重复。
预测:
1. B计算目标样本uB并用A方公钥加密发送A。
2. A安全计算预测函数,加随机掩码后发B解密。
3. B返回受掩码预测值;A去掩码得到标签并按授权返回B。七、算法卡:秘密共享联邦迁移学习
- 解决的问题:用秘密份额替代重型AHE计算相同的跨域损失与梯度交互项。
- 适用的数据划分:同上。
- 参与角色:A、B及秘密共享协议需要的计算角色/预处理。
- 客户端保存的状态:本地数据/网络、秘密份额、离线乘法三元组。
- 每轮交换的信息:交互项的秘密份额及重构所需消息。
- 本地更新:本地项单独计算,交叉项由秘密共享共同计算后合并梯度。
- 服务端更新:无中央聚合。
- 核心公式:原书式(6-9)至(6-11):
- 终止条件:联合损失收敛或达到上限。
- 计算复杂度:线上算术通常较AHE轻,但乘法依赖离线预处理。
- 通信复杂度:乘法层数和交互项会增加多轮消息。
- 隐私机制:单方只持秘密的一部分,未达阈值无法重构。
- 信任与攻击者假设:腐败方数与串谋不超过协议阈值。
- 主要优势:原书强调无近似精度损失且线上计算更高效。
- 主要局限:需提前生成、分发和存储大量乘法三元组。
- 可能失效的条件:份额串谋、预处理材料复用/泄露、通信中断。
- 应该比较的基线:AHE版、明文FTL、B-only。
AHE与秘密共享总对比
| 维度 | AHE版 | 秘密共享版 |
|---|---|---|
| 数据表示 | 密文 | 秘密份额 |
| 线上计算 | 密码运算较重 | 算术通常较轻 |
| 精度 | 原书方案含二阶近似 | 原书强调无近似损失 |
| 离线阶段 | 密钥准备 | 大量乘法三元组 |
| 通信模式 | 密文膨胀 | 多轮份额交互 |
| 关键假设 | 加密安全、密钥管理 | 腐败阈值、非串谋、预处理安全 |
八、关键假设
| 假设类型 | 具体假设 | 假设不成立时的后果 |
|---|---|---|
| 数据假设 | 两域存在可迁移相关性 | 负迁移,B-only反而更优 |
| 数据假设 | 少量对齐样本足以约束共同表征 | 对齐不可识别或过拟合交集 |
| 系统假设 | 双方训练/推理时稳定在线 | 协议和预测中断 |
| 模型假设 | 两方隐藏表征维度和交互函数兼容 | 无法计算对齐损失 |
| 信任假设 | 双方半诚实,最多一方被破坏 | 恶意输入可探测表征或破坏模型 |
| 攻击者假设 | 密钥/份额和随机掩码正确管理 | 梯度、中间量或输入可泄露 |
九、代价与权衡
| 维度 | 收益 | 代价或风险 |
|---|---|---|
| 模型效果 | 弱标签目标域可借助源域 | 负迁移与对齐样本偏差 |
| 本地计算 | 原始特征和网络留在本地 | 双网络训练、HE/MPC额外计算 |
| 通信成本 | 只交换受保护中间量 | 高频密文/份额交互 |
| 存储成本 | 模型分散持有 | 密钥、份额、三元组和协议状态 |
| 隐私保证 | 控制输入和中间量可见性 | 输出、表示和梯度仍可能泄露 |
| 安全与鲁棒性 | 可抵御半诚实单方推断 | 原书协议不处理恶意方 |
| 客户端公平性 | 双方共同得到目标模型价值 | 源域贡献、目标域收益难定价 |
十、局限与开放问题
原书明确指出
- 需要学习能捕捉参与方不变性的可迁移知识;
- 需要在本地模型自主性与泛化之间平衡;
- 共享表征必须在分布式环境中被安全学习;
- FTL交互频率和数据规模较大,需要高效安全协议。
根据假设推导
- 对齐损失可能把领域特有且有用的信息错误抹平;
- 少量重叠样本上的相关性不保证适用于B方全部样本;
- 隐藏表征不是匿名数据,可被属性推断或重建;
- A方控制标签和停止信号,双方信息与控制权不对称。
2020年后仍重要
- 联邦域适应、跨模态和基础模型表征迁移;
- 自动检测和抑制负迁移;
- 无/极少样本重叠下的可识别迁移;
- 恶意安全、表示级DP和可验证对齐;
- 参数高效迁移与协同推理降本。
十一、图示回查
| 原书图 | PDF页码 | 应记住的关系 |
|---|---|---|
| 图6-1 | 139 | A有标签、B有目标数据,仅少量样本重叠 |
| 图6-2 | 141 | 两个本地网络把异构特征映射到同维隐藏表征 |
十二、章节关系
第5章VFL:大量样本对齐、特征不同
↓ 减少样本重叠并引入迁移
第6章FTL:少量样本与特征重叠
├─ 第2章AHE/秘密共享 → 安全损失与梯度
├─ 第8章跨行业应用 → 弱标签与异构数据
└─ 后续研究 → 域适应、多模态、参数高效迁移十三、闭卷回忆问题
- 哪些数据条件下HFL和VFL都不足以工作?
- 基于实例、特征、模型的迁移载体分别是什么?
- 原书FTL中A、B各持有什么数据?
、 和正则项分别解决什么? - 增大
为什么可能引起负迁移? - AHE版的随机掩码和加密分别防什么?
- 秘密共享版为何线上更快却需要离线材料?
- 如何实验证明迁移是否真正有益?
🔍 参考答案
- 样本和特征重叠都很少,目标方标签又不足。
- 分别是样本权重/选择、共同隐藏表征、参数或预训练模型。
- A持有源域特征和标签,B持有目标域未标注特征,双方有少量对齐样本。
- 监督目标预测、跨域表征对齐、控制模型复杂度。
- 域语义不一致时,强迫表征接近会删除目标域有用特征。
- 加密防传输/计算中直接见明文;掩码防协议对方得到确切梯度。
- 份额算术较轻,但乘法需预生成Beaver三元组等材料。
- 与B-only、集中TL和无对齐损失版本在目标域同一测试集、同一计算预算下比较。
从教材到科研
现有方法隐含了哪些假设?
- 少量共同样本代表跨域关系;
- 两域共享的潜在语义可由固定维度表征捕捉;
- 对齐越好通常越利于目标预测;
- 半诚实模型足以描述参与行为;
- 协同推理的长期依赖可接受。
怎样构造让这些假设失效的实验?
- 从同类到无关任务逐步降低域相似度;
- 让对齐样本只来自高活跃或特定标签群体;
- 扫描
并同时测对齐距离与目标性能; - 构造特殊非零输入探测对方表征;
- 改变表征维度、标签量和重叠样本数;
- 比较AHE近似目标和原目标的梯度夹角。
可以提出哪些可证伪的研究问题?
当共同样本来自目标域的高活跃子群时,统一表征对齐是否会降低目标域低活跃子群的性能,而按对齐可信度加权能否在不降低总体AUC的情况下缩小群体差距?
- 现有方法:统一
的基于特征FTL。 - 失效条件:重叠样本有选择偏差。
- 可能机制:对齐目标只代表高活跃子群。
- 可观察结果:各群体表征距离、梯度方向和目标预测。
- 验证指标:总体/分群AUC、最差群体性能、负迁移率和额外协议成本。
