Skip to content

第6章 联邦迁移学习

原书范围:PDF第134~149页。

本章定位

  • 在全书中的位置:三类联邦学习算法主线的第三章,处理样本和特征都难以充分对齐的异构协作。
  • 前置知识:迁移学习、神经网络表征、VFL、安全计算、AHE和秘密共享。
  • 后续基础:跨域联邦、多模态联邦、弱监督联邦和联邦表征学习。
  • 核心问题:只有少量共同样本、特征空间又不同,如何利用源域标签帮助目标域预测,并控制共享表征的泄露?

一句话总结

联邦迁移学习通过少量对齐样本约束两方隐藏表征,在监督损失、表征对齐和正则化之间联合优化,从而把源域标签知识迁移到目标域。

学习目标

  1. 解释何时HFL/VFL都不适用而需要FTL。
  2. 区分基于实例、特征和模型的联邦迁移。
  3. 重建原书基于特征的FTL数据与角色设置。
  4. 解释监督损失、对齐损失和正则项各自作用。
  5. 比较AHE版与秘密共享版训练/预测流程。
  6. 识别负迁移、恶意输入和共享表征泄露风险。

Mermaid思维导图

一、本章要解决的问题

HFL要求特征空间足够一致,VFL要求样本空间有大量重叠。现实中的跨地区银行、不同业务平台或不同模态机构可能同时存在:

  • 共同用户少;
  • 共同特征少;
  • 数据分布和规模差异大;
  • 目标方标签很少甚至没有。

FTL不再直接平均同构模型或拼接大量共同样本,而是寻找源域与目标域之间可迁移的不变性。原书重点介绍基于特征的两方框架:用少量共同样本让两方神经网络的隐藏表征对齐,再借助源域标签预测目标域未标注样本。

⚡ 易混淆点

“存在相关性”不等于“迁移一定有益”。若对齐样本不代表目标域、任务语义不同或对齐权重过大,共享表征会产生负迁移,使目标域性能低于不迁移的Local-only模型。

二、核心概念与定义

概念准确定义通俗理解与相近概念的区别
源域数据或监督相对丰富、提供可迁移知识的领域知识提供方不保证规模总是更大,关键是提供监督/知识
目标域希望改善预测、但数据或标签不足的领域知识接收方最终评价主要在目标域
联邦迁移学习(FTL)在数据不能集中且需隐私保护时,跨样本/特征异构领域迁移知识安全地跨域借知识传统TL通常可直接访问双方数据/模型
基于实例的迁移选择或重加权源/目标样本以缩小分布差异挑选更像目标域的样本不直接规定共享表征或模型结构
基于特征的迁移学习使不同领域语义可比较的共同表征把不同字段映射到同一种语言原书6.3重点方法
基于模型的迁移共享模型、参数或预训练模型作为迁移载体迁移模型知识HFL也可被视为一种广义模型迁移
对齐损失约束共同样本在两方隐藏空间相似的损失同一个人在两个表示中靠近与有标签监督损失作用不同
负迁移迁移后目标性能反而下降借来的知识带偏目标模型不能只通过训练损失判断

原书式(6-1)用三种空间均不同来刻画FTL场景:

其中分别是第方的特征、标签和样本空间。实际算法仍需要少量可对齐样本或其他跨域联系,完全无关联时没有可识别的迁移依据。

三、三类联邦迁移

在HFL中重加权不同分布的样本;在VFL/异构场景中筛除可能造成负迁移的样本或特征。难点是如何在不查看对方数据时估计相似度和权重。

类型迁移载体所需联系主要风险
实例样本选择/权重可估计样本相关性权重泄露、选择偏差
特征隐藏表征少量对齐样本或分布约束表征泄露、语义错配
模型参数/结构/预训练模型任务和模型可复用部分模型不兼容、负迁移

四、原书框架的数据与角色

设源域A持有:

目标域B持有未标注数据:

双方有少量共同样本对:

A还持有少量“针对B方数据”的标签集合。原书假设标签位于A方,目标是在不公开的情况下预测B方未标注数据。

图6-1 基于特征的联邦迁移学习框架的数据视图

两方本地网络生成维隐藏表征:

其中网络参数分别为。双方不交换原始输入和完整本地网络,只通过安全协议协作计算表征交互项、损失和梯度。

图6-2 源域和目标域的神经网络架构

场景卡:跨域弱标签预测

项目内容
应用任务用A方标签知识预测B方未标注样本
参与方源域A、目标域B
各方拥有的数据A有;B有
样本是否重叠仅少量重叠样本
特征是否重叠少或无直接重叠
标签由谁持有原书框架中由A持有
联邦学习类型FTL,基于特征
交换的信息加密/秘密共享的表征交互、损失和梯度
主要隐私风险隐藏表征、梯度、标签和共同样本关系泄露
主要系统风险双方强依赖、密码计算慢、推理交互延迟
为什么不能直接集中数据隐私、商业和跨域数据治理限制

五、关键公式

5.1 目标域监督损失

原书式(6-2):

  • 利用A方知识和B方表征生成目标预测。
  • 是监督损失;原书举Logistic损失:
  • 该项要求目标预测能解释已有标签;若太小,单独优化容易过拟合。

5.2 表征对齐损失

原书式(6-3):

可用负内积或平方Frobenius距离。对齐权重过小无法建立跨域联系;过大则可能牺牲各域任务语义并导致负迁移。

5.3 联合目标

原书式(6-4):

其中:

  • 控制迁移/对齐强度。
  • 控制模型复杂度。
  • 增大通常加强两域耦合,但域差异大时增加负迁移风险。
  • 增大抑制过拟合,但可能降低表征能力。

的第层参数,原书式(6-5):

该梯度把监督信号、跨域对齐信号和正则化对应到同一反向传播过程。

5.4 安全计算中的近似

原书AHE版对最终损失相关表达采用二阶泰勒近似,使计算适配加法和标量乘法。原书指出性能损失来自最终损失函数近似,而非每个神经网络激活层,因为两方网络内部仍在本地明文执行。

⚡ 精度声明边界

“只近似最终损失”不等于误差对所有数据、网络和参数都很小。近似误差取决于展开点、Logit范围和训练轨迹,应与非加密原目标逐轮比较。

六、算法卡:AHE联邦迁移学习

  • 解决的问题:在少量重叠样本和异构特征下,安全迁移A方监督知识到B方。
  • 适用的数据划分:样本和特征重叠均少,两方存在少量可对齐样本。
  • 参与角色:源域A、目标域B。
  • 客户端保存的状态:各自数据、Net参数、密钥/公钥和随机掩码。
  • 服务端保存的状态:无独立服务器;模型和协议状态分散在两方。
  • 每轮交换的信息:对方公钥下的加密中间量、加密损失、受掩码梯度。
  • 本地更新:各方去除自己的梯度掩码后反向更新本地网络。
  • 服务端更新:无中央聚合。
  • 核心公式
  • 终止条件:A方获得的损失收敛,或达到迭代/时间上限。
  • 计算复杂度:本地神经网络前后向加密文运算;密文成本与表征维度、重叠样本和参数交互项相关。
  • 通信复杂度:每轮双向交换多组密文梯度/损失,随表示和参数规模增长。
  • 隐私机制:AHE保护传输/计算中的中间量,随机掩码防止对方获知确切梯度。
  • 信任与攻击者假设:双方半诚实,最多一方被破坏,不处理恶意输入。
  • 主要优势:本地网络结构可灵活变化;无需暴露原始数据和本地网络。
  • 主要局限:密码计算和密文通信重;损失需近似;协同推理。
  • 可能失效的条件:恶意探测输入、密钥泄露、域不相关、对齐样本太少/有偏、近似区间失配。
  • 应该比较的基线:B-only、A-only不可直接部署对照、集中TL、明文分布式FTL。
🔍 展开查看:AHE训练与预测流程
text
训练:
1. A、B在本地运行NetA/NetB,得到uA、uB。
2. A计算并加密帮助B求梯度的中间量;B计算并加密帮助A求梯度/损失的中间量。
3. A、B结合收到的密文计算各自的加密梯度;分别加入随机掩码mA、mB并发给对方解密。
4. A、B解密对方的受掩码结果,再将明文受掩码梯度返回掩码拥有方。
5. 各方去掩码,获得自己的梯度并更新本地网络。
6. 损失收敛则A向B发送停止信号,否则重复。

预测:
1. B计算目标样本uB并用A方公钥加密发送A。
2. A安全计算预测函数,加随机掩码后发B解密。
3. B返回受掩码预测值;A去掩码得到标签并按授权返回B。

七、算法卡:秘密共享联邦迁移学习

  • 解决的问题:用秘密份额替代重型AHE计算相同的跨域损失与梯度交互项。
  • 适用的数据划分:同上。
  • 参与角色:A、B及秘密共享协议需要的计算角色/预处理。
  • 客户端保存的状态:本地数据/网络、秘密份额、离线乘法三元组。
  • 每轮交换的信息:交互项的秘密份额及重构所需消息。
  • 本地更新:本地项单独计算,交叉项由秘密共享共同计算后合并梯度。
  • 服务端更新:无中央聚合。
  • 核心公式:原书式(6-9)至(6-11):
  • 终止条件:联合损失收敛或达到上限。
  • 计算复杂度:线上算术通常较AHE轻,但乘法依赖离线预处理。
  • 通信复杂度:乘法层数和交互项会增加多轮消息。
  • 隐私机制:单方只持秘密的一部分,未达阈值无法重构。
  • 信任与攻击者假设:腐败方数与串谋不超过协议阈值。
  • 主要优势:原书强调无近似精度损失且线上计算更高效。
  • 主要局限:需提前生成、分发和存储大量乘法三元组。
  • 可能失效的条件:份额串谋、预处理材料复用/泄露、通信中断。
  • 应该比较的基线:AHE版、明文FTL、B-only。

AHE与秘密共享总对比

维度AHE版秘密共享版
数据表示密文秘密份额
线上计算密码运算较重算术通常较轻
精度原书方案含二阶近似原书强调无近似损失
离线阶段密钥准备大量乘法三元组
通信模式密文膨胀多轮份额交互
关键假设加密安全、密钥管理腐败阈值、非串谋、预处理安全

八、关键假设

假设类型具体假设假设不成立时的后果
数据假设两域存在可迁移相关性负迁移,B-only反而更优
数据假设少量对齐样本足以约束共同表征对齐不可识别或过拟合交集
系统假设双方训练/推理时稳定在线协议和预测中断
模型假设两方隐藏表征维度和交互函数兼容无法计算对齐损失
信任假设双方半诚实,最多一方被破坏恶意输入可探测表征或破坏模型
攻击者假设密钥/份额和随机掩码正确管理梯度、中间量或输入可泄露

九、代价与权衡

维度收益代价或风险
模型效果弱标签目标域可借助源域负迁移与对齐样本偏差
本地计算原始特征和网络留在本地双网络训练、HE/MPC额外计算
通信成本只交换受保护中间量高频密文/份额交互
存储成本模型分散持有密钥、份额、三元组和协议状态
隐私保证控制输入和中间量可见性输出、表示和梯度仍可能泄露
安全与鲁棒性可抵御半诚实单方推断原书协议不处理恶意方
客户端公平性双方共同得到目标模型价值源域贡献、目标域收益难定价

十、局限与开放问题

原书明确指出

  • 需要学习能捕捉参与方不变性的可迁移知识;
  • 需要在本地模型自主性与泛化之间平衡;
  • 共享表征必须在分布式环境中被安全学习;
  • FTL交互频率和数据规模较大,需要高效安全协议。

根据假设推导

  • 对齐损失可能把领域特有且有用的信息错误抹平;
  • 少量重叠样本上的相关性不保证适用于B方全部样本;
  • 隐藏表征不是匿名数据,可被属性推断或重建;
  • A方控制标签和停止信号,双方信息与控制权不对称。

2020年后仍重要

  • 联邦域适应、跨模态和基础模型表征迁移;
  • 自动检测和抑制负迁移;
  • 无/极少样本重叠下的可识别迁移;
  • 恶意安全、表示级DP和可验证对齐;
  • 参数高效迁移与协同推理降本。

十一、图示回查

原书图PDF页码应记住的关系
图6-1139A有标签、B有目标数据,仅少量样本重叠
图6-2141两个本地网络把异构特征映射到同维隐藏表征

十二、章节关系

text
第5章VFL:大量样本对齐、特征不同
  ↓ 减少样本重叠并引入迁移
第6章FTL:少量样本与特征重叠
  ├─ 第2章AHE/秘密共享 → 安全损失与梯度
  ├─ 第8章跨行业应用 → 弱标签与异构数据
  └─ 后续研究 → 域适应、多模态、参数高效迁移

十三、闭卷回忆问题

  1. 哪些数据条件下HFL和VFL都不足以工作?
  2. 基于实例、特征、模型的迁移载体分别是什么?
  3. 原书FTL中A、B各持有什么数据?
  4. 和正则项分别解决什么?
  5. 增大为什么可能引起负迁移?
  6. AHE版的随机掩码和加密分别防什么?
  7. 秘密共享版为何线上更快却需要离线材料?
  8. 如何实验证明迁移是否真正有益?
🔍 参考答案
  1. 样本和特征重叠都很少,目标方标签又不足。
  2. 分别是样本权重/选择、共同隐藏表征、参数或预训练模型。
  3. A持有源域特征和标签,B持有目标域未标注特征,双方有少量对齐样本。
  4. 监督目标预测、跨域表征对齐、控制模型复杂度。
  5. 域语义不一致时,强迫表征接近会删除目标域有用特征。
  6. 加密防传输/计算中直接见明文;掩码防协议对方得到确切梯度。
  7. 份额算术较轻,但乘法需预生成Beaver三元组等材料。
  8. 与B-only、集中TL和无对齐损失版本在目标域同一测试集、同一计算预算下比较。

从教材到科研

现有方法隐含了哪些假设?

  • 少量共同样本代表跨域关系;
  • 两域共享的潜在语义可由固定维度表征捕捉;
  • 对齐越好通常越利于目标预测;
  • 半诚实模型足以描述参与行为;
  • 协同推理的长期依赖可接受。

怎样构造让这些假设失效的实验?

  • 从同类到无关任务逐步降低域相似度;
  • 让对齐样本只来自高活跃或特定标签群体;
  • 扫描并同时测对齐距离与目标性能;
  • 构造特殊非零输入探测对方表征;
  • 改变表征维度、标签量和重叠样本数;
  • 比较AHE近似目标和原目标的梯度夹角。

可以提出哪些可证伪的研究问题?

当共同样本来自目标域的高活跃子群时,统一表征对齐是否会降低目标域低活跃子群的性能,而按对齐可信度加权能否在不降低总体AUC的情况下缩小群体差距?

  • 现有方法:统一的基于特征FTL。
  • 失效条件:重叠样本有选择偏差。
  • 可能机制:对齐目标只代表高活跃子群。
  • 可观察结果:各群体表征距离、梯度方向和目标预测。
  • 验证指标:总体/分群AUC、最差群体性能、负迁移率和额外协议成本。