第5章 纵向联邦学习
原书范围:PDF第116~133页。
本章定位
- 在全书中的位置:三类联邦学习算法主线的第二章,处理“同一批实体的特征分散在不同机构”问题。
- 前置知识:线性回归、梯度提升树、AHE、MPC、安全实体对齐。
- 后续基础:联邦迁移学习、Split Learning、跨机构风控和协同推理。
- 核心问题:如何先找出共同实体,再在不暴露各方特征和标签的情况下计算联合损失、梯度或树分裂?
一句话总结
纵向联邦先通过隐私实体对齐确定共同样本,再让特征方交换受保护的中间统计量共同训练分布式模型,因此训练和推理都通常依赖多方在线。
学习目标
- 区分HFL与VFL的数据、模型和通信方式。
- 重建VFL的实体对齐与加密训练流程。
- 推导安全联邦线性回归的损失分解和梯度。
- 闭卷重建SecureBoost一棵树的训练与预测。
- 说明VFL“无损”结论依赖的条件。
- 分析样本ID、梯度统计和树路径的隐私风险。
Mermaid思维导图
一、本章要解决的问题
银行、电商、医院等机构可能拥有大量共同用户,却分别保存收入、消费、病历、检查等不同字段。任何一方单独建模都缺少重要特征;直接拼表又会泄露个人数据和商业资产。
VFL必须连续解决两个不同问题:
- 哪些记录属于同一实体? 需要隐私集合求交或加密ID对齐。
- 如何在特征仍分散时训练? 需要安全计算联合点积、残差、梯度或分裂统计。
⭐ 核心结论
实体对齐不是模型训练的附属步骤,而是VFL的安全边界之一。对齐结果本身会暴露双方关系和共同用户集合;训练协议安全不代表实体对齐自动安全。
二、核心概念与定义
| 概念 | 准确定义 | 通俗理解 | 与相近概念的区别 |
|---|---|---|---|
| 纵向联邦学习(VFL) | 各方样本ID大量重叠而特征空间不同,通过协作训练共享模型 | 同一批行的列分散在不同机构 | HFL是相同列、不同记录 |
| 实体对齐 | 在不披露非共同实体的条件下识别各方共同样本 | 安全地找出“同一个人” | 只解决记录匹配,不完成模型训练 |
| 主动方 | 持有标签和特征,并协调计算的参与方 | 知道训练目标的一方 | 被动方通常只有特征 |
| 被动方 | 持有额外特征、不持有标签的参与方 | 补充字段的一方 | 需依赖主动方的标签信号训练 |
| 半诚实第三方(STP) | 遵守协议、负责密钥或解密受掩码中间量,且不与参与方串谋 | 协助安全计算的独立角色 | 不是无条件可信;可用MPC替代 |
| 中间结果 | 局部点积、残差份额、梯度统计、分支决策等协议消息 | 联合计算所需的最小信息 | 不是原始数据,但仍可能泄露 |
| 协同推理 | 预测时由不同模型分片和特征方共同完成输出 | 模型训练完也不能单方运行 | HFL完整模型常能单方部署 |
VFL的核心数据关系可概括为:
其中
三、核心机制
3.1 两阶段架构
A、B各自持有用户ID与不同特征
↓
隐私实体对齐,得到共同样本
↓
协调方生成密钥或多方建立秘密份额
↓
各方计算并交换加密中间结果
↓
计算加密损失与梯度/分裂统计
↓
解密受掩码结果,各方更新本地模型分片
↓
预测时继续协作- 输入:共同任务、各方特征、标签方标签、实体ID。
- 角色:A方、B方、可选协调方C。
- 各方状态:本地数据、本地模型参数、掩码或密钥状态。
- 交换信息:对齐协议消息、加密点积/梯度/统计量、掩码结果。
- 输出:分散在各方的模型分片或树结构/查找表。
- 训练与推理:通常都需要多方协作。


3.2 场景卡:银行与电商联合风控
| 项目 | 内容 |
|---|---|
| 应用任务 | 利用消费行为改善信用风险预测 |
| 参与方 | 银行、电商、可选协调方 |
| 各方拥有的数据 | 银行持有收入/信用/标签;电商持有浏览/购买特征 |
| 样本是否重叠 | 大量共同客户,但需安全对齐 |
| 特征是否重叠 | 少或不重叠 |
| 标签由谁持有 | 通常由银行/主动方持有 |
| 联邦学习类型 | VFL |
| 交换的信息 | PSI消息、加密残差/梯度或分裂统计 |
| 主要隐私风险 | 共同用户集合、标签、特征、梯度和树路径泄露 |
| 主要系统风险 | 任一方掉线、跨机构延迟、密钥和身份管理 |
| 为什么不能直接集中数据 | 法律、商业竞争、目的限制和数据主权 |
四、关键公式:安全联邦线性回归
设A方持有特征
原书式(5-2)的正则化平方损失为:
- 优化对象:联合特征上的线性预测误差与参数复杂度。
是正则化参数;增大可抑制参数幅度,但过大导致欠拟合。- 联合预测
无法由任一方单独计算。
令
其中:
原书式(5-5)、(5-6)的加密梯度为:
- 每方用自己的明文特征与加密残差计算本地参数梯度。
- C方只应解密加入随机掩码
、 后的梯度;A/B收到后去掩码更新。 - 原书的安全论证依赖半诚实、不串谋和“样本数远大于特征数”等代数条件;恶意方构造特殊输入会破坏该推理。
五、算法卡:安全联邦线性回归
- 解决的问题:特征纵向分割时训练联合线性回归而不公开特征/标签。
- 适用的数据划分:共同样本、不同特征,一方持有标签。
- 参与角色:A、B和可选受信第三方C。
- 客户端保存的状态:A保存
;B保存 。 - 服务端保存的状态:C保存密钥并临时解密受掩码损失/梯度。
- 每轮交换的信息:加密局部点积、残差份额、损失、掩码梯度。
- 本地更新:各方用去掩码梯度更新自己的
。 - 服务端更新:无统一模型参数;C只协助解密和协调。
- 核心公式:
及上述分解损失/梯度。 - 终止条件:联合损失收敛或达到迭代上限。
- 计算复杂度:每轮至少线性依赖重叠样本数和本地特征维度,另加逐元素AHE运算;具体常数取决于密码实现。
- 通信复杂度:每轮传输量随重叠样本数及参数维度增长;密文显著大于明文。
- 隐私机制:AHE、随机掩码;可用MPC移除C。
- 信任与攻击者假设:各方半诚实、不串谋,C不与A/B串谋,信道可靠。
- 主要优势:在相同目标和精确算术下,损失/梯度与集中训练相同。
- 主要局限:依赖C或重型MPC;不防恶意输入;高频通信;协同推理。
- 可能失效的条件:串谋、特殊探测输入、实体错配、样本数不满足代数安全条件、密钥泄露。
- 应该比较的基线:集中训练、A-only/B-only、明文VFL、MPC版本。
🔍 展开查看:训练与预测流程
训练:
1. C生成密钥对并向A、B发送公钥。
2. A计算[[uA]]、[[LA]]并发送B;B计算[[uB]]、[[dB]]、[[L]]。
3. A、B分别计算加密梯度,加随机掩码后发送C。
4. C解密受掩码梯度,分别返回A、B。
5. A、B去掩码并更新ThetaA、ThetaB。
6. 根据联合损失决定继续或停止。
预测:
1. 对待预测ID,A计算uA,B计算uB。
2. 通过C或安全协议计算uA+uB。
3. 输出只发送给获授权的结果方。⚡ “无损”的准确含义
原书称该协议“无损”,指在相同训练设置、精确密码运算和协议正确执行下,计算出的损失与梯度和集中式线性回归相同。它不表示实体对齐无误、有限精度无误、系统不掉线、结果不泄露或恶意攻击下仍无损。
六、关键公式:SecureBoost
6.1 树集成与二阶目标
原书式(5-7):
第
其中
6.2 分裂增益
对当前节点样本集合
- 增益越大,分裂越优。
抑制叶权重过大;增大通常使分裂更保守。- 被动方不能在AHE密文上完成除法和比较,因此只聚合密文统计;主动方解密后评分。
叶节点
七、算法卡:SecureBoost
- 解决的问题:标签和特征分散时,安全训练梯度提升树。
- 适用的数据划分:共同样本,不同特征,主动方持标签。
- 参与角色:一个主动方、一个或多个被动方。
- 客户端保存的状态:主动方保存标签、预测和树结构;被动方保存特征、分桶与本地查找表。
- 服务端保存的状态:无独立服务器;主动方承担协调和解密。
- 每轮交换的信息:主动方发送
;被动方返回按桶聚合的密文统计;主动方返回选中特征/阈值ID。 - 本地更新:被动方按特征分桶、聚合统计、执行样本划分并记录阈值。
- 服务端更新:主动方解密候选统计、计算全局最佳分裂、维护树结构。
- 核心公式:二阶目标、分裂增益、叶权重。
- 终止条件:最大深度、最小增益、叶样本条件或树数量上限。
- 计算复杂度:每节点依赖各方特征数、桶数和当前样本数;主动方需遍历所有候选统计。
- 通信复杂度:每节点约与各方“特征数×桶数”的加密统计量成正比,另有样本ID集合/路由消息。
- 隐私机制:AHE保护逐样本一二阶梯度;实体对齐协议保护ID交集。
- 信任与攻击者假设:半诚实、不串谋;主动方可解密聚合统计。
- 主要优势:在原书设定下可获得与对应集中式提升树相同的分裂计算精度。
- 主要局限:主动方看到聚合统计和树结构;交互密集;推理需多方在线。
- 可能失效的条件:小桶泄露、恶意特征/梯度、样本错配、参与方掉线、查询式路径探测。
- 应该比较的基线:集中XGBoost、Active-only、Passive-only不可用对照、明文VFL树。
🔍 展开查看:一棵树的完整流程
1. 主动方计算每个样本的gi、hi并AHE加密,发送所有被动方。
2. 每个被动方对每个特征分桶,在当前节点样本集合内累加[[gi]]、[[hi]],
将“特征ID、桶ID、加密统计”发送主动方。
3. 主动方解密聚合统计,对所有候选计算split gain,选择
[参与方ID, 特征ID kopt, 阈值ID vopt]。
4. 若最佳特征在被动方,主动方把kopt、vopt发给该方;该方找到真实阈值,
划分当前样本集合,在本地保存[记录ID, 特征, 阈值],返回记录ID和左样本集合IL。
5. 主动方据IL划分节点,并在树节点保存[参与方ID, 记录ID]。
6. 递归处理子节点;建树结束后用式(5-10)计算叶权重。
预测:
1. 主动方读取当前节点的[参与方ID, 记录ID]。
2. 对应被动方用本地阈值比较新样本特征,只返回左/右方向。
3. 主动方沿树前进,直到叶节点。
4. 遍历所有树并累加叶权重。八、HFL与VFL对比
样本分散、模型同构;客户端本地可独立计算完整损失,服务器聚合更新;最终模型通常可单方推理。
| 维度 | HFL | VFL |
|---|---|---|
| 数据扩展 | 增加样本 | 增加特征 |
| 对齐需求 | 通常弱 | 必须做实体对齐 |
| 交换对象 | 模型/梯度 | 中间激活、残差、统计、路径 |
| 参数归属 | 常共享完整模型 | 各方持本地模型分片 |
| 推理 | 常可单方 | 通常协同 |
| 故障耦合 | 每轮可部分参与 | 任一必要方掉线可阻断 |
九、关键假设
| 假设类型 | 具体假设 | 假设不成立时的后果 |
|---|---|---|
| 数据假设 | 有足够共同样本且实体对齐准确 | 错配导致训练噪声、偏差和隐私事故 |
| 系统假设 | 通信可靠、无损、按协议顺序进行 | 依赖链中断,训练/推理无法继续 |
| 模型假设 | 联合目标可分解为安全协议支持的操作 | 非线性、比较和除法成本升高 |
| 信任假设 | 各方半诚实且不串谋;C不串谋 | 输入探测、密钥滥用或联合恢复信息 |
| 攻击者假设 | 最多一方被半诚实对手控制 | 恶意输入、标签投毒和主动查询不在保证内 |
十、代价与权衡
| 维度 | 收益 | 代价或风险 |
|---|---|---|
| 模型效果 | 利用跨机构异构特征 | 只在重叠样本上训练,可能有选择偏差 |
| 本地计算 | 原始特征不外发 | 加密、分桶和模型分片计算增加 |
| 通信成本 | 交换中间量而非原始表 | 高频、按样本或按桶密文通信 |
| 存储成本 | 各方保留数据主权 | 密钥、查找表、树路径和协议状态 |
| 隐私保证 | HE/MPC隐藏部分输入和中间量 | 对齐集合、聚合统计和输出仍会泄露 |
| 安全与鲁棒性 | 可限制半诚实方所见内容 | 恶意输入和串谋防护不足 |
| 客户端公平性 | 各方特征共同产生价值 | 标签方/主动方控制更强,收益难量化 |
十一、局限与开放问题
原书明确指出
- VFL计算具有跨方依赖,需要频繁互动;
- 长距离通信降低资源利用率,需要流式调度和容错;
- 需要按运算类型组合混淆电路、秘密共享和HE;
- 高效隐私实体对齐仍是关键研究方向。
根据假设推导
- 共同样本通常不是双方用户的随机样本,模型可能只适配“交集人群”;
- 标签方控制损失和评价,存在权力与可验证性不对称;
- 树的分桶统计、样本集合大小和重复路径查询可形成侧信道;
- 协同推理使服务可用性、退出权和模型生命周期管理更复杂。
2020年后仍重要
- 恶意安全VFL、标签推断和特征重建防御;
- 纵向联邦深度网络的通信压缩与异步流水线;
- 无标签方退出时的模型蒸馏或单方部署;
- PSI结果最小披露与对齐偏差校正;
- 特征贡献、定价、公平和可审计性。
十二、图表回查
| 原书图/表 | PDF页码 | 应记住的关系 |
|---|---|---|
| 图5-1 | 121 | 先实体对齐,再加密训练 |
| 图5-2 | 121 | 只识别共同实体,不暴露非交集用户 |
| 表5-1 | 122 | 线性回归符号与各方状态 |
| 表5-2 | 124 | A/B/C的加密训练消息顺序 |
| 表5-3 | 125 | 预测时各方共同计算 |
| 算法5-1 | 128 | 被动方按特征桶聚合密文 |
| 算法5-2 | 130 | 主动方解密候选并寻找全局最佳分裂 |
十三、章节关系
第2章AHE/MPC/秘密共享
↓
第5章VFL
├─ 安全线性回归:安全点积与梯度
├─ SecureBoost:安全统计与比较
├─ 第6章FTL:重叠样本/特征进一步减少
└─ 第7章激励:跨机构贡献与收益分配十四、闭卷回忆问题
- VFL为什么必须先做实体对齐?
- 主动方、被动方和STP分别知道什么?
- 如何把线性回归联合损失拆成A、本地B和交叉项?
- “无损VFL”不包含哪些保证?
- SecureBoost为什么由主动方计算
? - 被动方为什么先分桶再发送聚合统计?
- 为什么SecureBoost预测仍需被动方在线?
- VFL的样本交集为什么可能带来选择偏差?
🔍 参考答案
- 不先确定共同实体,各方特征无法按同一训练样本组合。
- 主动方有标签和树结构;被动方有本地特征/阈值;STP只应看到受掩码的解密结果。
- 展开
,得到 、 和 。 - 不包含对齐正确、恶意安全、结果隐私、无掉线和无有限精度误差。
- 一二阶导依赖真实标签,只有主动方持有标签。
- 减少从逐样本梯度到“特征×桶”统计的通信,也避免直接发送特征值。
- 部分树节点阈值只保存在被动方本地查找表。
- 同时出现在双方的数据主体可能与总体在人群、活跃度和信用等方面系统不同。
从教材到科研
现有方法隐含了哪些假设?
- 实体对齐误差可忽略;
- 共同样本能够代表部署人群;
- 标签方、特征方与协调方不串谋;
- 聚合统计和路径决策泄露可接受;
- 推理期间所有必要参与方长期在线。
怎样构造让这些假设失效的实验?
- 注入不同比例的错误匹配和漏匹配;
- 让样本重叠概率与标签/敏感群体相关;
- 构造小桶、稀有特征和重复路径查询;
- 让恶意方提交单一非零特征探测梯度;
- 模拟标签方或关键特征方在训练/推理中掉线;
- 比较集中、VFL、单方模型在交集与非交集人群上的性能。
可以提出哪些可证伪的研究问题?
当样本重叠概率与正类标签相关时,仅在对齐交集上训练的SecureBoost是否会在非重叠部署人群中产生可测的校准偏差,而基于参与概率的安全重加权能否降低该偏差?
- 现有方法:交集样本上的SecureBoost。
- 失效条件:重叠非随机。
- 可能机制:实体对齐后的选择偏差改变训练分布。
- 可观察结果:交集/非交集标签率、分裂选择、校准曲线。
- 验证指标:AUC、Brier分数、ECE、群体校准差和额外通信量。
