联邦学习隐私与安全机制卡片
使用时先写威胁模型,再选机制;不要从“系统使用了某种加密”反推它已经保护所有数据、模型和输出。
⚡ 隐私边界
“原始数据不离开本地”不等于联邦学习自动获得隐私保证。模型参数、梯度、中间激活、实体交集、查询结果和最终模型仍可能泄露训练信息。
一、使用前的安全声明
先用一句话填完:在[阶段],保护[对象/单位]免受[攻击角色及能力]的[攻击目标],允许其看到[输出与元数据],并假设[串谋/腐败阈值]成立。
如果这句话无法填写,先回到第2章的威胁模型;本页不再重复半诚实、恶意、串谋和攻击阶段的概念教学,只用于选机制和核对保证。
二、快速选择
| 需求 | 首选机制 | 不能自动解决 | 主要代价 |
|---|---|---|---|
| 隐藏单个客户端更新 | 安全聚合 | 最终模型泄露、投毒 | 密钥协商、掉线恢复 |
| 限制声明保护单位对输出的影响 | DP | 密码学机密性、任意投毒 | 噪声、效用与预算累积 |
| 在密文上计算线性统计 | HE | 解密输出泄露、恶意输入 | 密文膨胀、非线性近似 |
| 保护多方输入并联合计算 | MPC/秘密共享 | 输出泄露、语义攻击 | 多轮通信、预处理 |
| 找出共同实体 | PSI | 交集本身、后续训练泄露 | 密码计算、对齐误差 |
| 只防链路窃听 | TLS | 端点服务器读取明文 | 证书与密钥管理 |
三、机制卡(按需展开)
安全聚合|隐藏单个客户端更新
- 出处:Bonawitz et al., Practical Secure Aggregation for Privacy-Preserving Machine Learning, CCS 2017(arXiv:1611.04482)
- 保护对象:单个客户端的模型更新/梯度。
- 典型目标:服务器获得
,但看不到任一 。 - 常见机制:客户端两两生成抵消掩码,配合秘密共享恢复掉线客户端相关掩码。
- 攻击者可见:参与集合、时序、消息大小、聚合结果及最终模型,具体取决于协议。
- 依赖假设:达到最小在线阈值;服务器与被控客户端串谋数不超过上限;随机掩码/密钥不泄露。
- 主要收益:降低服务器直接分析单个更新的能力。
- 主要代价:额外握手、密钥材料、掩码向量、掉线恢复和状态管理。
- 失效条件:参与集合太小;服务器通过差分选择集合隔离某客户端;串谋超过阈值;掩码复用。
⚡ 易混淆点
安全聚合不限制聚合结果的敏感度,也不给成员推断提供
差分隐私|限制保护单位对输出的影响
- 出处:Dwork et al., Calibrating Noise to Sensitivity in Private Data Analysis, TCC 2006(差分隐私奠基);McMahan et al., ICLR 2018(DP-FedAvg,arXiv:1710.06963);Kasiviswanathan et al., SIAM J. Comput. 2011(本地隐私学习,arXiv:0803.0924)
正式定义
若相邻数据集
则
越小,通常隐私越强。 是允许保证失败的极小概率,不应被随意设置。 - 敏感度:
记录级、用户级与客户端/机构级
相邻数据集差一条记录。适合保护单次病历、单条交互或单个样本;一个用户有多条相关记录时,不能自动保护其整体参与。
| 维度 | 记录/样本级 | 用户级 | 客户端/机构级 |
|---|---|---|---|
| 邻接单位 | 一条记录 | 一个自然人的全部贡献 | 一个客户端或机构的全部贡献 |
| 常见裁剪对象 | 单样本梯度 | 按用户汇总的贡献 | 客户端/机构更新 |
| 保护问题 | 单记录影响 | 用户是否参与及整体影响 | 客户端/机构是否参与及整体影响 |
| 典型注意点 | 同一用户多记录会组合 | 需正确关联用户跨轮贡献 | 不自动保护机构内部个人 |
FL中的必要组件
- 定义邻接关系和保护单位;
- 裁剪样本梯度或客户端更新,限制敏感度;
- 加入校准噪声;
- 结合采样和多轮组合做隐私会计;
- 报告
、裁剪阈值、噪声倍率、轮数及会计方法。
不能解决
- 不隐藏发送给不可信服务器的明文更新,除非与安全聚合/加密组合;
- 不验证客户端更新诚实;
- 不保证模型无偏、公平或高精度;
- 不允许把每轮小
直接当作全程小 。
同态加密|在密文上执行受支持运算
- 出处:Paillier, Public-Key Cryptosystems Based on Composite Degree Residuosity Classes, EUROCRYPT 1999(加法同态);全同态参考 Gentry 2009
令
| 类型 | 能力 | FL典型用途 | 局限 |
|---|---|---|---|
| PHE/AHE | 某类运算可多次执行 | 参数求和、线性/树统计 | 除法、比较和非线性困难 |
| SHE | 有限深度加乘 | 有限电路评估 | 深度受噪声预算限制 |
| FHE | 理论上任意电路 | 通用密文计算 | 成本很高 |
- 保护对象:传输和计算中的明文输入/中间量。
- 攻击者可见:密文、大小/时序元数据和获授权解密结果。
- 依赖假设:密码参数安全、密钥不泄露、随机数正确、解密接口受控。
- 主要代价:大整数/多项式运算、密文膨胀、编码和精度管理。
- 机器学习适配:对激活、Logistic损失、比较等非线性进行多项式近似或交给其他协议。
⚡ 易混淆点
HE保护“计算时不看明文”,不限制解密后输出或最终模型泄露训练信息,也不阻止输入方加密恶意更新。
MPC与秘密共享|联合计算多方私有输入
- 出处:Goldreich, Micali, Wigderson, How to Play any Mental Game, STOC 1987(通用 MPC);Shamir, How to Share a Secret, CACM 1979(秘密共享)
MPC目标
多方希望计算:
同时每方除自身输入和授权输出外,不获得额外信息。正式安全通常要求真实协议视图可由理想功能中的输入/输出模拟。
秘密共享直觉
将秘密
- 保护对象:多方输入和计算中间量。
- 攻击者可见:自身输入、份额、协议消息和授权输出。
- 依赖假设:半诚实/恶意模型、同步/异步网络、腐败阈值及是否允许串谋。
- 主要代价:通信轮数、预处理材料、份额存储和协议实现。
- 不能解决:输出本身允许泄露的内容、投毒、语义错误和拒绝服务。
Beaver乘法三元组
离线生成满足
私有集合求交|安全识别共同实体
- 出处:Freedman, Nissim, Pinkas, Efficient Private Matching and Set Intersection, EUROCRYPT 2004(PSI 奠基)
- 保护对象:双方非交集ID。
- 输出:通常是交集,或交集大小/带载荷交集,取决于协议。
- 应用:VFL/FTL训练前的实体对齐。
- 依赖假设:ID规范化一致;协议抵御规定的半诚实/恶意对手;字典攻击被处理。
- 主要风险:交集本身可能敏感;集合大小、重复查询和低熵ID可泄露;匹配错误导致模型偏差。
- 主要代价:公钥运算、哈希/不经意传输通信和大集合处理。
💡 通俗理解
PSI只能安全回答“我们共同认识谁”,并不能回答“这些共同用户上的联合建模是否安全”。交集一旦确定,后续梯度、统计和预测仍需独立保护。
四、隐私、鲁棒性与组合
4.1 隐私与鲁棒性
目标是限制攻击者从协议或模型中学到信息,常用安全聚合、HE、MPC、DP。
| 问题 | 机密性机制能否自动解决? | 原因 |
|---|---|---|
| 梯度反演 | 部分缓解 | 隐藏单个更新有帮助,但最终/聚合更新仍可能泄露 |
| 成员推断 | 否 | 需要限制个体影响,DP是典型机制 |
| 模型投毒 | 否 | 加密只隐藏恶意值,不判断其正确性 |
| 后门攻击 | 否 | 聚合模型仍可学习攻击目标 |
| 拒绝服务 | 否 | 隐私协议可能反而增加在线阈值依赖 |
| 串谋恢复 | 取决于协议 | 必须明确串谋上限和阈值 |
4.2 组合方式
按保护单位设计的DP + 安全聚合
按邻接定义形成并裁剪保护单位的贡献
↓
安全聚合隐藏单个裁剪贡献
↓
聚合端加入或分布式形成校准噪声
↓
隐私会计累计多轮预算2
3
4
5
6
7
- 安全聚合让服务器难以看到单个裁剪贡献;
- DP限制声明保护单位对发布模型的影响;
- 跨设备场景若客户端与用户一一对应,可实现用户级目标;跨医院场景裁剪整院更新通常是机构级目标;
- 必须验证噪声由谁加入、服务器能否去除、掉线是否改变噪声量。
HE/MPC混合
算术聚合可用秘密共享或HE,比较/选择可用混淆电路等专门协议。混合并不自动更安全,跨协议转换和密钥边界需纳入证明与实现审计。
4.3 机制选择矩阵
| 需求 | 首选思路 | 仍需补充 |
|---|---|---|
| 服务器不能看单个HFL更新 | 安全聚合 | 最终模型DP、投毒防御 |
| VFL联合算术不暴露输入 | MPC/HE | PSI、恶意输入验证、输出控制 |
| 限制成员推断 | 按记录/用户/机构邻接设计DP | 加密传输、效用和公平评估 |
| 防服务器链路窃听 | TLS | 端点不可信时HE/MPC/安全聚合 |
| 防客户端投毒 | 鲁棒聚合/验证/审计 | 隐私机制和安全聚合兼容性 |
| 支持实体对齐 | PSI | 交集最小披露和后续训练安全 |
| 高效算术、可离线预处理 | 秘密共享 | 三元组生成和腐败阈值 |
| 低交互但可承受密文计算 | HE | 密钥管理和非线性近似 |
五、闭卷检查
完成检查后,可前往闭卷复习题:隐私边界速测自动判分。
- 机制保护的对象是什么?
- 攻击者在协议结束后能看到什么?
- 正式保证对应哪个攻击模型和腐败阈值?
- 输出和最终模型是否仍会泄露?
- 是否保护单条记录、单个自然人,还是单个客户端/机构?
- 多轮训练的隐私预算如何累计?
- 掉线、串谋和恶意输入会怎样破坏保证?
- 是否同时需要鲁棒性、可用性和审计机制?
