Skip to content

第5章 纵向联邦学习

原书范围:PDF第116~133页。

本章定位

  • 在全书中的位置:三类联邦学习算法主线的第二章,处理“同一批实体的特征分散在不同机构”问题。
  • 前置知识:线性回归、梯度提升树、AHE、MPC、安全实体对齐。
  • 后续基础:联邦迁移学习、Split Learning、跨机构风控和协同推理。
  • 核心问题:如何先找出共同实体,再在不暴露各方特征和标签的情况下计算联合损失、梯度或树分裂?

一句话总结

纵向联邦先通过隐私实体对齐确定共同样本,再让特征方交换受保护的中间统计量共同训练分布式模型,因此训练和推理都通常依赖多方在线。

学习目标

  1. 区分HFL与VFL的数据、模型和通信方式。
  2. 重建VFL的实体对齐与加密训练流程。
  3. 推导安全联邦线性回归的损失分解和梯度。
  4. 闭卷重建SecureBoost一棵树的训练与预测。
  5. 说明VFL“无损”结论依赖的条件。
  6. 分析样本ID、梯度统计和树路径的隐私风险。

Mermaid思维导图

一、本章要解决的问题

银行、电商、医院等机构可能拥有大量共同用户,却分别保存收入、消费、病历、检查等不同字段。任何一方单独建模都缺少重要特征;直接拼表又会泄露个人数据和商业资产。

VFL必须连续解决两个不同问题:

  1. 哪些记录属于同一实体? 需要隐私集合求交或加密ID对齐。
  2. 如何在特征仍分散时训练? 需要安全计算联合点积、残差、梯度或分裂统计。

⭐ 核心结论

实体对齐不是模型训练的附属步骤,而是VFL的安全边界之一。对齐结果本身会暴露双方关系和共同用户集合;训练协议安全不代表实体对齐自动安全。

二、核心概念与定义

概念准确定义通俗理解与相近概念的区别
纵向联邦学习(VFL)各方样本ID大量重叠而特征空间不同,通过协作训练共享模型同一批行的列分散在不同机构HFL是相同列、不同记录
实体对齐在不披露非共同实体的条件下识别各方共同样本安全地找出“同一个人”只解决记录匹配,不完成模型训练
主动方持有标签和特征,并协调计算的参与方知道训练目标的一方被动方通常只有特征
被动方持有额外特征、不持有标签的参与方补充字段的一方需依赖主动方的标签信号训练
半诚实第三方(STP)遵守协议、负责密钥或解密受掩码中间量,且不与参与方串谋协助安全计算的独立角色不是无条件可信;可用MPC替代
中间结果局部点积、残差份额、梯度统计、分支决策等协议消息联合计算所需的最小信息不是原始数据,但仍可能泄露
协同推理预测时由不同模型分片和特征方共同完成输出模型训练完也不能单方运行HFL完整模型常能单方部署

VFL的核心数据关系可概括为:

其中为样本ID空间,为特征空间。实践中通常先对齐得到交集,而不是假定双方原始用户集合完全相同;标签可只由一方持有。

三、核心机制

3.1 两阶段架构

text
A、B各自持有用户ID与不同特征

隐私实体对齐,得到共同样本

协调方生成密钥或多方建立秘密份额

各方计算并交换加密中间结果

计算加密损失与梯度/分裂统计

解密受掩码结果,各方更新本地模型分片

预测时继续协作
  • 输入:共同任务、各方特征、标签方标签、实体ID。
  • 角色:A方、B方、可选协调方C。
  • 各方状态:本地数据、本地模型参数、掩码或密钥状态。
  • 交换信息:对齐协议消息、加密点积/梯度/统计量、掩码结果。
  • 输出:分散在各方的模型分片或树结构/查找表。
  • 训练与推理:通常都需要多方协作。

图5-1 纵向联邦学习系统的架构

图5-2 加密实体对齐图解

3.2 场景卡:银行与电商联合风控

项目内容
应用任务利用消费行为改善信用风险预测
参与方银行、电商、可选协调方
各方拥有的数据银行持有收入/信用/标签;电商持有浏览/购买特征
样本是否重叠大量共同客户,但需安全对齐
特征是否重叠少或不重叠
标签由谁持有通常由银行/主动方持有
联邦学习类型VFL
交换的信息PSI消息、加密残差/梯度或分裂统计
主要隐私风险共同用户集合、标签、特征、梯度和树路径泄露
主要系统风险任一方掉线、跨机构延迟、密钥和身份管理
为什么不能直接集中数据法律、商业竞争、目的限制和数据主权

四、关键公式:安全联邦线性回归

设A方持有特征和参数,B方持有特征、标签和参数。定义:

原书式(5-2)的正则化平方损失为:

  • 优化对象:联合特征上的线性预测误差与参数复杂度。
  • 是正则化参数;增大可抑制参数幅度,但过大导致欠拟合。
  • 联合预测无法由任一方单独计算。

。AHE下损失可分成各方本地项和交叉项:

其中:

原书式(5-5)、(5-6)的加密梯度为:

  • 每方用自己的明文特征与加密残差计算本地参数梯度。
  • C方只应解密加入随机掩码后的梯度;A/B收到后去掩码更新。
  • 原书的安全论证依赖半诚实、不串谋和“样本数远大于特征数”等代数条件;恶意方构造特殊输入会破坏该推理。

五、算法卡:安全联邦线性回归

  • 解决的问题:特征纵向分割时训练联合线性回归而不公开特征/标签。
  • 适用的数据划分:共同样本、不同特征,一方持有标签。
  • 参与角色:A、B和可选受信第三方C。
  • 客户端保存的状态:A保存;B保存
  • 服务端保存的状态:C保存密钥并临时解密受掩码损失/梯度。
  • 每轮交换的信息:加密局部点积、残差份额、损失、掩码梯度。
  • 本地更新:各方用去掩码梯度更新自己的
  • 服务端更新:无统一模型参数;C只协助解密和协调。
  • 核心公式及上述分解损失/梯度。
  • 终止条件:联合损失收敛或达到迭代上限。
  • 计算复杂度:每轮至少线性依赖重叠样本数和本地特征维度,另加逐元素AHE运算;具体常数取决于密码实现。
  • 通信复杂度:每轮传输量随重叠样本数及参数维度增长;密文显著大于明文。
  • 隐私机制:AHE、随机掩码;可用MPC移除C。
  • 信任与攻击者假设:各方半诚实、不串谋,C不与A/B串谋,信道可靠。
  • 主要优势:在相同目标和精确算术下,损失/梯度与集中训练相同。
  • 主要局限:依赖C或重型MPC;不防恶意输入;高频通信;协同推理。
  • 可能失效的条件:串谋、特殊探测输入、实体错配、样本数不满足代数安全条件、密钥泄露。
  • 应该比较的基线:集中训练、A-only/B-only、明文VFL、MPC版本。
🔍 展开查看:训练与预测流程
text
训练:
1. C生成密钥对并向A、B发送公钥。
2. A计算[[uA]]、[[LA]]并发送B;B计算[[uB]]、[[dB]]、[[L]]。
3. A、B分别计算加密梯度,加随机掩码后发送C。
4. C解密受掩码梯度,分别返回A、B。
5. A、B去掩码并更新ThetaA、ThetaB。
6. 根据联合损失决定继续或停止。

预测:
1. 对待预测ID,A计算uA,B计算uB。
2. 通过C或安全协议计算uA+uB。
3. 输出只发送给获授权的结果方。

⚡ “无损”的准确含义

原书称该协议“无损”,指在相同训练设置、精确密码运算和协议正确执行下,计算出的损失与梯度和集中式线性回归相同。它不表示实体对齐无误、有限精度无误、系统不掉线、结果不泄露或恶意攻击下仍无损。

六、关键公式:SecureBoost

6.1 树集成与二阶目标

原书式(5-7):

轮增加树,原书式(5-8)的二阶近似目标:

其中分别是损失对上一轮预测的一阶、二阶导数,惩罚树复杂度。只有标签方能计算

6.2 分裂增益

对当前节点样本集合,候选分裂产生左、右集合。原书式(5-9):

  • 增益越大,分裂越优。
  • 抑制叶权重过大;增大通常使分裂更保守。
  • 被动方不能在AHE密文上完成除法和比较,因此只聚合密文统计;主动方解密后评分。

叶节点的最优权重,原书式(5-10):

七、算法卡:SecureBoost

  • 解决的问题:标签和特征分散时,安全训练梯度提升树。
  • 适用的数据划分:共同样本,不同特征,主动方持标签。
  • 参与角色:一个主动方、一个或多个被动方。
  • 客户端保存的状态:主动方保存标签、预测和树结构;被动方保存特征、分桶与本地查找表。
  • 服务端保存的状态:无独立服务器;主动方承担协调和解密。
  • 每轮交换的信息:主动方发送;被动方返回按桶聚合的密文统计;主动方返回选中特征/阈值ID。
  • 本地更新:被动方按特征分桶、聚合统计、执行样本划分并记录阈值。
  • 服务端更新:主动方解密候选统计、计算全局最佳分裂、维护树结构。
  • 核心公式:二阶目标、分裂增益、叶权重。
  • 终止条件:最大深度、最小增益、叶样本条件或树数量上限。
  • 计算复杂度:每节点依赖各方特征数、桶数和当前样本数;主动方需遍历所有候选统计。
  • 通信复杂度:每节点约与各方“特征数×桶数”的加密统计量成正比,另有样本ID集合/路由消息。
  • 隐私机制:AHE保护逐样本一二阶梯度;实体对齐协议保护ID交集。
  • 信任与攻击者假设:半诚实、不串谋;主动方可解密聚合统计。
  • 主要优势:在原书设定下可获得与对应集中式提升树相同的分裂计算精度。
  • 主要局限:主动方看到聚合统计和树结构;交互密集;推理需多方在线。
  • 可能失效的条件:小桶泄露、恶意特征/梯度、样本错配、参与方掉线、查询式路径探测。
  • 应该比较的基线:集中XGBoost、Active-only、Passive-only不可用对照、明文VFL树。
🔍 展开查看:一棵树的完整流程
text
1. 主动方计算每个样本的gi、hi并AHE加密,发送所有被动方。
2. 每个被动方对每个特征分桶,在当前节点样本集合内累加[[gi]]、[[hi]],
   将“特征ID、桶ID、加密统计”发送主动方。
3. 主动方解密聚合统计,对所有候选计算split gain,选择
   [参与方ID, 特征ID kopt, 阈值ID vopt]。
4. 若最佳特征在被动方,主动方把kopt、vopt发给该方;该方找到真实阈值,
   划分当前样本集合,在本地保存[记录ID, 特征, 阈值],返回记录ID和左样本集合IL。
5. 主动方据IL划分节点,并在树节点保存[参与方ID, 记录ID]。
6. 递归处理子节点;建树结束后用式(5-10)计算叶权重。

预测:
1. 主动方读取当前节点的[参与方ID, 记录ID]。
2. 对应被动方用本地阈值比较新样本特征,只返回左/右方向。
3. 主动方沿树前进,直到叶节点。
4. 遍历所有树并累加叶权重。

八、HFL与VFL对比

样本分散、模型同构;客户端本地可独立计算完整损失,服务器聚合更新;最终模型通常可单方推理。

维度HFLVFL
数据扩展增加样本增加特征
对齐需求通常弱必须做实体对齐
交换对象模型/梯度中间激活、残差、统计、路径
参数归属常共享完整模型各方持本地模型分片
推理常可单方通常协同
故障耦合每轮可部分参与任一必要方掉线可阻断

九、关键假设

假设类型具体假设假设不成立时的后果
数据假设有足够共同样本且实体对齐准确错配导致训练噪声、偏差和隐私事故
系统假设通信可靠、无损、按协议顺序进行依赖链中断,训练/推理无法继续
模型假设联合目标可分解为安全协议支持的操作非线性、比较和除法成本升高
信任假设各方半诚实且不串谋;C不串谋输入探测、密钥滥用或联合恢复信息
攻击者假设最多一方被半诚实对手控制恶意输入、标签投毒和主动查询不在保证内

十、代价与权衡

维度收益代价或风险
模型效果利用跨机构异构特征只在重叠样本上训练,可能有选择偏差
本地计算原始特征不外发加密、分桶和模型分片计算增加
通信成本交换中间量而非原始表高频、按样本或按桶密文通信
存储成本各方保留数据主权密钥、查找表、树路径和协议状态
隐私保证HE/MPC隐藏部分输入和中间量对齐集合、聚合统计和输出仍会泄露
安全与鲁棒性可限制半诚实方所见内容恶意输入和串谋防护不足
客户端公平性各方特征共同产生价值标签方/主动方控制更强,收益难量化

十一、局限与开放问题

原书明确指出

  • VFL计算具有跨方依赖,需要频繁互动;
  • 长距离通信降低资源利用率,需要流式调度和容错;
  • 需要按运算类型组合混淆电路、秘密共享和HE;
  • 高效隐私实体对齐仍是关键研究方向。

根据假设推导

  • 共同样本通常不是双方用户的随机样本,模型可能只适配“交集人群”;
  • 标签方控制损失和评价,存在权力与可验证性不对称;
  • 树的分桶统计、样本集合大小和重复路径查询可形成侧信道;
  • 协同推理使服务可用性、退出权和模型生命周期管理更复杂。

2020年后仍重要

  • 恶意安全VFL、标签推断和特征重建防御;
  • 纵向联邦深度网络的通信压缩与异步流水线;
  • 无标签方退出时的模型蒸馏或单方部署;
  • PSI结果最小披露与对齐偏差校正;
  • 特征贡献、定价、公平和可审计性。

十二、图表回查

原书图/表PDF页码应记住的关系
图5-1121先实体对齐,再加密训练
图5-2121只识别共同实体,不暴露非交集用户
表5-1122线性回归符号与各方状态
表5-2124A/B/C的加密训练消息顺序
表5-3125预测时各方共同计算
算法5-1128被动方按特征桶聚合密文
算法5-2130主动方解密候选并寻找全局最佳分裂

十三、章节关系

text
第2章AHE/MPC/秘密共享

第5章VFL
  ├─ 安全线性回归:安全点积与梯度
  ├─ SecureBoost:安全统计与比较
  ├─ 第6章FTL:重叠样本/特征进一步减少
  └─ 第7章激励:跨机构贡献与收益分配

十四、闭卷回忆问题

  1. VFL为什么必须先做实体对齐?
  2. 主动方、被动方和STP分别知道什么?
  3. 如何把线性回归联合损失拆成A、本地B和交叉项?
  4. “无损VFL”不包含哪些保证?
  5. SecureBoost为什么由主动方计算
  6. 被动方为什么先分桶再发送聚合统计?
  7. 为什么SecureBoost预测仍需被动方在线?
  8. VFL的样本交集为什么可能带来选择偏差?
🔍 参考答案
  1. 不先确定共同实体,各方特征无法按同一训练样本组合。
  2. 主动方有标签和树结构;被动方有本地特征/阈值;STP只应看到受掩码的解密结果。
  3. 展开,得到
  4. 不包含对齐正确、恶意安全、结果隐私、无掉线和无有限精度误差。
  5. 一二阶导依赖真实标签,只有主动方持有标签。
  6. 减少从逐样本梯度到“特征×桶”统计的通信,也避免直接发送特征值。
  7. 部分树节点阈值只保存在被动方本地查找表。
  8. 同时出现在双方的数据主体可能与总体在人群、活跃度和信用等方面系统不同。

从教材到科研

现有方法隐含了哪些假设?

  • 实体对齐误差可忽略;
  • 共同样本能够代表部署人群;
  • 标签方、特征方与协调方不串谋;
  • 聚合统计和路径决策泄露可接受;
  • 推理期间所有必要参与方长期在线。

怎样构造让这些假设失效的实验?

  • 注入不同比例的错误匹配和漏匹配;
  • 让样本重叠概率与标签/敏感群体相关;
  • 构造小桶、稀有特征和重复路径查询;
  • 让恶意方提交单一非零特征探测梯度;
  • 模拟标签方或关键特征方在训练/推理中掉线;
  • 比较集中、VFL、单方模型在交集与非交集人群上的性能。

可以提出哪些可证伪的研究问题?

当样本重叠概率与正类标签相关时,仅在对齐交集上训练的SecureBoost是否会在非重叠部署人群中产生可测的校准偏差,而基于参与概率的安全重加权能否降低该偏差?

  • 现有方法:交集样本上的SecureBoost。
  • 失效条件:重叠非随机。
  • 可能机制:实体对齐后的选择偏差改变训练分布。
  • 可观察结果:交集/非交集标签率、分裂选择、校准曲线。
  • 验证指标:AUC、Brier分数、ECE、群体校准差和额外通信量。