第5章 纵向联邦学习
本章先记住
- VFL先安全确认“哪些记录属于同一实体”,再计算联合损失、梯度或分裂统计。
- 线性模型交换受保护的残差/梯度;SecureBoost交换加密的一二阶统计和路由信息。
- 模型和特征分片留在不同机构,因此训练后通常仍需协同推理。
🧭 学习目标与本章地图
本章定位
- 在知识体系中的位置:三类联邦学习算法主线的第二章,处理“同一批实体的特征分散在不同机构”问题。
- 前置知识:线性回归、梯度提升树、AHE、MPC、安全实体对齐。
- 后续基础:联邦迁移学习、Split Learning、跨机构风控和协同推理。
- 核心问题:如何先找出共同实体,再在不暴露各方特征和标签的情况下计算联合损失、梯度或树分裂?
学习目标
- 区分HFL与VFL的数据、模型和通信方式。
- 重建VFL的实体对齐与加密训练流程。
- 推导安全联邦线性回归的损失分解和梯度。
- 闭卷重建SecureBoost一棵树的训练与预测。
- 说明VFL“无损”结论依赖的条件。
- 分析样本ID、梯度统计和树路径的隐私风险。
Mermaid思维导图
一、本章要解决的问题
银行、电商、医院等机构可能拥有大量共同用户,却分别保存收入、消费、病历、检查等不同字段。任何一方单独建模都缺少重要特征;直接拼表又会泄露个人数据和商业资产。
VFL必须连续解决两个不同问题:
- 哪些记录属于同一实体? 需要隐私集合求交或加密ID对齐。
- 如何在特征仍分散时训练? 需要安全计算联合点积、残差、梯度或分裂统计。
⭐ 核心结论
实体对齐不是模型训练的附属步骤,而是VFL的安全边界之一。对齐结果本身会暴露双方关系和共同用户集合;训练协议安全不代表实体对齐自动安全。
二、核心概念与定义
| 概念 | 准确定义 | 通俗理解 | 与相近概念的区别 |
|---|---|---|---|
| 纵向联邦学习(VFL) | 各方样本ID大量重叠而特征空间不同,通过协作训练共享模型 | 同一批行的列分散在不同机构 | HFL是相同列、不同记录 |
| 实体对齐 | 在不披露非共同实体的条件下识别各方共同样本 | 安全地找出“同一个人” | 只解决记录匹配,不完成模型训练 |
| 主动方 | 持有标签和特征,并协调计算的参与方 | 知道训练目标的一方 | 被动方通常只有特征 |
| 被动方 | 持有额外特征、不持有标签的参与方 | 补充字段的一方 | 需依赖主动方的标签信号训练 |
| 协调/解密方C(部分协议) | 遵守协议、负责密钥或解密受掩码中间量,且不与A/B串谋 | 协助安全计算的可选角色 | 不是无条件可信;可用MPC移除 |
| 中间结果 | 局部点积、残差份额、梯度统计、分支决策等协议消息 | 联合计算所需的最小信息 | 不是原始数据,但仍可能泄露 |
| 协同推理 | 预测时由不同模型分片和特征方共同完成输出 | 模型训练完也不能单方运行 | HFL完整模型常能单方部署 |
VFL的核心数据关系可概括为:
其中
三、核心机制
3.1 两阶段架构
A、B各自持有用户ID与不同特征
↓
隐私实体对齐,得到共同样本
↓
可选协调/解密方C生成密钥,或A/B通过MPC建立秘密份额
↓
各方计算并交换加密中间结果
↓
计算加密损失与梯度/分裂统计
↓
解密受掩码结果,各方更新本地模型分片
↓
预测时继续协作2
3
4
5
6
7
8
9
10
11
12
13
- 输入:共同任务、各方特征、标签方标签、实体ID。
- 角色:被动方/特征方A、主动方/标签方B、可选协调/解密方C。
- 各方状态:本地数据、本地模型参数、掩码或密钥状态。
- 交换信息:对齐协议消息、加密点积/梯度/统计量、掩码结果。
- 输出:分散在各方的模型分片或树结构/查找表。
- 训练与推理:通常都需要多方协作。

3.2 贯穿案例B:银行—电商联合风控
为与后续公式保持一致,全文固定:电商A是被动方/特征方,持有
| 统一问题 | 本案例的回答 |
|---|---|
| 参与方是谁? | 电商A、银行B和可选协调/解密方C;银行B定义风控目标并接收授权结果 |
| 数据如何分布? | 双方有大量共同客户;电商持浏览/购买特征,银行持信用特征和标签 |
| 交换什么? | PSI消息、加密局部得分/残差/梯度,或SecureBoost中的加密分裂统计与路由信息 |
| 谁能看到什么? | 各方保留本地明文;协议只应暴露授权输出和必要元数据,具体边界见下表 |
| 模型归谁? | 参数或树查找表分散在双方;模型使用权和输出接收方必须另行约定 |
| 推理依赖谁? | 新客户预测通常需要电商提供局部得分或树路径,银行单方难以完整执行 |
| 哪个假设最脆弱? | 实体对齐准确、共同客户能代表部署人群,以及A/B/C不串谋 |
| 与谁比较? | B-only(银行单方)、可行的集中参考、明文VFL参考和同预算安全实现;A-only(电商单方)只有在另有合法标签时才是可训练基线 |
3.3 消息与可见性
| 阶段 | 受保护的消息流 | 接收方按协议可获得 | 仍需警惕 |
|---|---|---|---|
| 实体对齐 | A ↔ B:PSI协议消息 | 获授权的交集或交集大小 | 交集本身、集合规模、重复查询和低熵ID泄露 |
| 密钥建立 | C → A/B:公钥;C保留私钥 | A/B获得加密能力 | 私钥泄露、错误证书或C与参与方串谋 |
| 联合训练 | A ↔ B:加密局部得分、残差份额和损失项 | 密文及消息大小、时序等元数据 | 特殊输入、差分查询和实现侧信道 |
| 梯度解密 | A/B → C:加掩码密文梯度;C → A/B:解密后的掩码梯度 | C看到“真实梯度+随机掩码”;各方最终只获得自己的梯度 | 掩码复用、掩码泄露,或C与能获得相应掩码的角色串谋 |
| 协同推理 | A/B/C按协议组合局部得分或树路径 | 授权结果方获得预测;其他方只应获得必要路由/中间结果 | 高频查询、路径探测、输出反演和任一关键方掉线 |
⚡ 可见性不是固定属性
上表描述的是一种AHE加掩码实现的目标边界,不代表所有VFL协议都具有相同消息流。更换密钥持有者、输出接收方、PSI变体或MPC协议后,必须重新逐条填写这张表。
四、关键公式:安全联邦线性回归
设A方持有特征
两方联合模型的正则化平方损失为:
- 优化对象:联合特征上的线性预测误差与参数复杂度。
是正则化参数;增大可抑制参数幅度,但过大导致欠拟合。- 联合预测
无法由任一方单独计算。
令
其中:
两方的加密梯度分别为:
- 每方用自己的明文特征与加密残差计算本地参数梯度。
- C方只应解密加入随机掩码
、 后的梯度;A/B收到后去掩码更新。 - 该安全结论依赖半诚实、不串谋和“样本数远大于特征数”等代数条件;恶意方构造特殊输入会破坏这些条件。
💡 为什么不能像FedAvg那样平均模型?
教学构造示例:下面数值仅为演示联合残差的计算逻辑而设计,不代表真实预测得分。假设电商A只能算出本地得分
A不知道
💡 安全联邦线性回归完整算法卡见 09 算法卡片。
五、关键公式:SecureBoost
5.1 树集成与二阶目标
梯度提升树把多棵基学习器的输出相加:
其中
其中
5.2 分裂增益
对当前节点样本集合
- 增益越大,分裂越优。
抑制叶权重过大;增大通常使分裂更保守。- 被动方不能在AHE密文上完成除法和比较,因此只聚合密文统计;主动方解密后评分。
叶节点
💡 SecureBoost 完整算法卡见 09 算法卡片。
六、HFL与VFL对比
样本分散、模型同构;客户端本地可独立计算完整损失,服务器聚合更新;最终模型通常可单方推理。
| 维度 | HFL | VFL |
|---|---|---|
| 数据扩展 | 增加样本 | 增加特征 |
| 对齐需求 | 通常弱 | 必须做实体对齐 |
| 交换对象 | 模型/梯度 | 中间激活、残差、统计、路径 |
| 参数归属 | 常共享完整模型 | 各方持本地模型分片 |
| 推理 | 常可单方 | 通常协同 |
| 故障耦合 | 每轮可部分参与 | 任一必要方掉线可阻断 |
七、关键假设
| 假设类型 | 具体假设 | 假设不成立时的后果 |
|---|---|---|
| 数据假设 | 有足够共同样本且实体对齐准确 | 错配导致训练噪声、偏差和隐私事故 |
| 系统假设 | 通信可靠、无损、按协议顺序进行 | 依赖链中断,训练/推理无法继续 |
| 模型假设 | 联合目标可分解为安全协议支持的操作 | 非线性、比较和除法成本升高 |
| 信任假设 | 各方半诚实且不串谋;C不串谋 | 输入探测、密钥滥用或联合恢复信息 |
| 攻击者假设 | 最多一方被半诚实对手控制 | 恶意输入、标签投毒和主动查询不在保证内 |
八、代价与权衡
| 维度 | 收益 | 代价或风险 |
|---|---|---|
| 模型效果 | 利用跨机构异构特征 | 只在重叠样本上训练,可能有选择偏差 |
| 本地计算 | 原始特征不外发 | 加密、分桶和模型分片计算增加 |
| 通信成本 | 交换中间量而非原始表 | 高频、按样本或按桶密文通信 |
| 存储成本 | 各方保留数据主权 | 密钥、查找表、树路径和协议状态 |
| 隐私保证 | HE/MPC隐藏部分输入和中间量 | 对齐集合、聚合统计和输出仍会泄露 |
| 安全与鲁棒性 | 可限制半诚实方所见内容 | 恶意输入和串谋防护不足 |
| 参与方公平性 | 各方特征共同产生价值 | 标签方/主动方控制更强,收益难量化 |
九、复习与推演
- VFL为什么必须先做实体对齐?
- 主动方B、被动方A和协调/解密方C分别知道什么?
- 如何把线性回归联合损失拆成A、本地B和交叉项?
- “无损VFL”不包含哪些保证?
- SecureBoost为什么由主动方计算
? - 被动方为什么先分桶再发送聚合统计?
- 为什么SecureBoost预测仍需被动方在线?
- VFL的样本交集为什么可能带来选择偏差?
- 贯穿案例B中,协调/解密方C解密受掩码梯度后能看到什么?什么情况下掩码不再能保护真实梯度?
🔍 参考答案
- 不先确定共同实体,各方特征无法按同一训练样本组合。
- 主动方B有标签,并在SecureBoost中持树结构;被动方A有本地特征/阈值;可选协调/解密方C只应看到受掩码的解密结果。
- 展开
,得到 、 和 。 - 不包含对齐正确、恶意安全、结果隐私、无掉线和无有限精度误差。
- 一二阶导依赖真实标签,只有主动方持有标签。
- 减少从逐样本梯度到“特征×桶”统计的通信,也避免直接发送特征值。
- 部分树节点阈值只保存在被动方本地查找表。
- 同时出现在双方的数据主体可能与总体在人群、活跃度和信用等方面系统不同。
- C按协议只看到“真实梯度+随机掩码”;若掩码泄露、被不安全复用,或C与能获得相应掩码的角色串谋,真实梯度可能被恢复。
🧪 从理解到研究(进阶)
已知局限与隐含假设
VFL计算具有跨方依赖,需要频繁互动;
长距离通信降低资源利用率,需要流式调度和容错;
需要按运算类型组合混淆电路、秘密共享和HE;
高效隐私实体对齐仍是关键研究方向。
实体对齐误差可忽略;
共同样本能够代表部署人群;
标签方、特征方与协调方不串谋;
聚合统计和路径决策泄露可接受;
推理期间所有必要参与方长期在线。
从假设推导:
- 共同样本通常不是双方用户的随机样本,模型可能只适配“交集人群”;
- 标签方控制损失和评价,存在权力与可验证性不对称;
- 树的分桶统计、样本集合大小和重复路径查询可形成侧信道;
- 协同推理使服务可用性、退出权和模型生命周期管理更复杂。
失效条件实验
本节只列VFL特有扰动;实体对齐统计、对照组、独立重复与系统开销统一按实验规范报告。
- 注入不同比例的错误匹配和漏匹配;
- 让样本重叠概率与标签/敏感群体相关;
- 构造小桶、稀有特征和重复路径查询;
- 让恶意方提交单一非零特征探测梯度;
- 模拟标签方或关键特征方在训练/推理中掉线;
- 比较集中、VFL、单方模型在交集与非交集人群上的性能。
- 文献佐证:VFL 协议的安全结论建立在半诚实、非串谋与「样本数远大于特征数」等代数假设上(Hardy et al., 2017,arXiv:1711.10677);Paillier 方案提供的选择明文安全(CPA)只针对被动攻击者,恶意输入与串谋不在其保护范围内。
可证伪的研究问题
当样本重叠概率与正类标签相关时,仅在对齐交集上训练的SecureBoost是否会在非重叠部署人群中产生可测的校准偏差,而基于参与概率的安全重加权能否降低该偏差?
- 现有方法:交集样本上的SecureBoost。
- 失效条件:重叠非随机。
- 可能机制:实体对齐后的选择偏差改变训练分布。
- 可观察结果:交集/非交集标签率、分裂选择、校准曲线。
- 验证指标:AUC、Brier分数、ECE、群体校准差和额外通信量。
现代研究方向
- 恶意安全VFL、标签推断和特征重建防御;
- 纵向联邦深度网络的通信压缩与异步流水线;
- 无标签方退出时的模型蒸馏或单方部署;
- PSI结果最小披露与对齐偏差校正;
- 特征贡献、定价、公平和可审计性。
十、章节关系
第2章AHE/MPC/秘密共享
↓
第5章VFL
├─ 安全线性回归:安全点积与梯度
├─ SecureBoost:安全统计与比较
├─ 第6章FTL:重叠样本/特征进一步减少
└─ 第7章激励:跨机构贡献与收益分配2
3
4
5
6
7
原始论文与关键后续
- Hardy et al., Private Federated Learning on Vertically Partitioned Data via Entity Resolution and Additively Homomorphic Encryption, 2017(arXiv:1711.10677):VFL + 实体对齐 + AHE 的奠基工作,本专题安全线性回归卡片的出处。
- Paillier, Public-Key Cryptosystems Based on Composite Degree Residuosity Classes, EUROCRYPT 1999:加法同态加密(Paillier)出处。
- Cheng et al., SecureBoost: A Lossless Federated Learning Framework, IEEE Trans. Big Data 7(3), 2021(arXiv:1901.08755):联邦提升树出处,加密梯度统计与路由。
