Skip to content

《联邦学习》闭卷复习题

建议:先只看题目,在纸上写出定义、角色、消息、公式和失效条件;完成后再展开答案。算法题至少写到可以据此实现伪代码。

一、全书骨架

  1. 联邦学习与普通分布式机器学习的约束有何不同?
  2. HFL、VFL和FTL如何由样本与特征空间区分?
  3. 一次联邦任务启动前必须回答哪八类问题?
  4. 为什么联邦学习不是一个单独算法?
  5. 为什么平均精度不足以评价联邦系统?
🔍 参考答案
  1. 普通DML通常由同一控制方管理数据分片、节点和高速网络;FL加入数据自治、Non-IID、部分参与、不稳定通信、不完全信任、隐私和激励约束。
  2. HFL:特征/标签相同、样本不同;VFL:共同样本多、特征不同;FTL:样本和特征重叠都少。
  3. 参与方、数据划分、优化目标、交换信息、信任角色、隐私保护单位、系统约束、评价指标。
  4. 它是一类协作学习问题,可使用不同模型、优化器、架构和安全协议。
  5. 还需看最差/分位客户端、通信、墙钟时间、能耗、隐私预算、攻击成功率、公平和可用性。

二、定义与对比

  1. IID、Non-IID、数据量不平衡分别指什么?
  2. 数据并行、模型并行和任务并行分别划分什么?
  3. 同步与异步训练的主要风险是什么?
  4. 梯度平均与模型平均何时等价?
  5. 客户端漂移与随机梯度噪声有何区别?
  6. 半诚实与恶意攻击者的能力差异是什么?
  7. 安全聚合、DP、HE和MPC各保护什么?
  8. 隐私保护与投毒防御为什么不能混为一谈?
  9. 样本级DP与用户级DP的邻接单位是什么?
  10. PSI解决什么问题,又不解决什么问题?
🔍 参考答案
  1. IID表示各局部样本来自同一分布;Non-IID表示局部分布系统不同;数据量不平衡只描述差异,不等同于分布差异。
  2. 分别划分样本、模型参数/层、计算操作。
  3. 同步受慢节点/掉线阻塞;异步有陈旧更新、顺序和快节点偏差。
  4. 同一初始参数、一步相同学习率、本地梯度在同一点计算且聚合权重一致时。
  5. 漂移来自局部目标与全局目标系统不一致;梯度噪声来自有限批次随机采样。
  6. 半诚实者遵守协议但分析消息;恶意者可构造输入、伪造消息、串谋和拒绝服务。
  7. 安全聚合隐藏单更新;DP限制个体影响;HE保护密文计算;MPC保护多方输入和中间量。
  8. 加密恶意更新仍是恶意更新;机密性不判断更新是否正确。
  9. 一条记录与一个用户的全部记录/贡献。
  10. PSI安全找交集;不自动保护交集本身、后续训练、梯度和预测。

三、公式重建

题1:联邦目标

从总样本平均损失推导客户端加权目标,并解释每个量。

🔍 参考答案

是客户端的样本索引集,是其样本数。样本量加权优化样本平均风险,不保证客户端公平。

题2:FedSGD更新

写出客户端梯度和服务器更新。

🔍 参考答案

全集参与且时为全局梯度;部分参与需说明采样和归一化。

题3:VFL线性回归

展开联合平方损失,并说明为什么需要安全交叉项。

🔍 参考答案

展开后包含A本地项、B本地项和交叉项。交叉项依赖双方私有值,需HE/MPC计算。

题4:SecureBoost

写出分裂增益和叶权重,并解释谁计算。

🔍 参考答案

主动方持标签,计算并加密逐样本;被动方按特征桶聚合密文统计;主动方解密聚合量、比较候选并选择分裂。

题5:FTL联合目标

写出监督损失、对齐损失和正则项。

🔍 参考答案

利用标签优化目标预测,对齐共同样本的跨域表征,控制模型复杂度。过大可能造成负迁移。

题6:差分隐私

写出-DP定义,并解释邻接关系。

🔍 参考答案

的定义决定保护单位。差一条记录对应样本级DP;差一个用户全部贡献对应用户级DP。

题7:FLI

写出支付权重、预算分配和欠偿更新。

🔍 参考答案

是贡献,是成本,是欠偿,是等待队列。FLI假定可用,不负责证明它们真实。

四、算法重建

题1:FedAvg

不看笔记写出一轮的服务器端、客户端、本地步数、聚合权重和终止条件。

🔍 参考答案
text
服务器从全局模型wt开始,采样Ct并下发wt。
客户端k从wt开始,对本地mini-batch执行多步SGD,得到wk并上传。
服务器按本轮约定权重alpha_k聚合:wt+1=sum alpha_k wk。
达到损失/指标收敛、最大轮数或时间上限则停止。

必须明确参与率、本地训练量、批大小、学习率和部分参与时的权重归一化。

题2:安全联邦线性回归

写出A、B、C每轮交换顺序和随机掩码作用。

🔍 参考答案

C生成密钥;A/B交换公钥下加密局部点积/残差;各方计算加密梯度并加入自己的随机掩码后发C;C只解密受掩码梯度并返回;A/B去除自己的掩码并更新参数。加密防明文暴露,掩码防C获得确切梯度。

题3:SecureBoost

写出一棵树从到分布式预测的全过程。

🔍 参考答案

主动方算并加密;被动方按各特征分桶并聚合密文统计;主动方解密所有候选,算增益并选[参与方ID, 特征ID, 阈值ID];选中被动方确定真实阈值、保存查找表、返回左样本ID;主动方维护树节点关联。预测时主动方查询相应被动方的左/右决策,直到叶节点。

题4:AHE联邦迁移学习

解释加密与掩码在训练和预测中分别出现在哪些位置。

🔍 参考答案

双方本地生成表征;交换用于对方梯度/损失的加密中间量;各自计算加密梯度并加入随机掩码,交给对方解密再返回;掩码拥有方去掩码更新。预测时B发送加密表征,A计算受掩码预测,B解密后返回,A去掩码得到标签。

题5:纵向联邦DQN

说明持奖励方和观察协作方如何反向传播。

🔍 参考答案

各协作方用本地观察计算中间激活并加密发送Q网络方;Q网络方结合奖励计算DQN损失并反向传播,将相应加密梯度发回;协作方解密并更新本地网络。训练和推理都可能需要多方在线。

五、隐私边界判断

判断下列说法是否正确,并说明理由。

  1. “数据不出本地,因此系统满足差分隐私。”
  2. “使用HE后,最终模型不会泄露训练数据。”
  3. “安全聚合既保护隐私又能阻止投毒。”
  4. “PSI不会泄露任何实体关系。”
  5. “秘密共享版FTL没有精度损失,因此没有安全代价。”
  6. “半诚实安全协议可以防止客户端构造特殊输入。”
  7. “样本级DP可自动保护一个用户的全部历史记录。”
  8. “TLS足以防止聚合服务器分析客户端梯度。”
🔍 参考答案
  1. 错。DP需要邻接关系、裁剪、噪声和会计。
  2. 错。HE保护密文计算,不限制解密输出和最终模型。
  3. 错。安全聚合隐藏单个更新,不能验证其是否恶意。
  4. 错。协议通常输出交集,交集本身和大小也可能敏感。
  5. 错。仍有通信、预处理、三元组存储和串谋阈值代价。
  6. 错。构造特殊输入属于恶意偏离协议。
  7. 错。用户有多条记录时需用户级邻接或组合分析。
  8. 错。TLS只保护链路,端点服务器仍看到明文。

六、失效条件分析

  1. 增大FedAvg本地步数时,何时收益转为损失?
  2. 为什么速度优先客户端选择会产生统计偏差?
  3. 为什么VFL只在实体交集训练可能无法泛化到全体用户?
  4. FTL中对齐损失降低但目标性能下降说明什么?
  5. 为什么安全聚合和鲁棒聚合可能冲突?
  6. FLI在预算长期不足时会发生什么?
  7. HFRL平均回报提高为何仍可能不安全?
  8. 独立预训练模型为什么可能无法直接参数平均?
🔍 参考答案
  1. 当通信节省不足以抵消Non-IID漂移、本地过拟合和计算成本时。
  2. 设备速度可能与地区、群体和数据分布相关,选中数据不再代表目标总体。
  3. 同时出现在双方的用户可能是高活跃或特定群体,存在选择偏差。
  4. 可能发生负迁移:表示更接近但任务语义被抹平。
  5. 前者不让服务器看单个更新,后者常需检查/比较单个更新。
  6. 可能持续增长,参与方退出,机制不可持续。
  7. 最差环境或低概率灾难的约束违反率可能上升。
  8. 神经元排列、尺度和参数语义不对齐。

七、科研设计题

题1:Non-IID与系统偏差

设计实验检验“慢客户端集中持有少数标签时,速度优先选择损害尾部群体”。

🔍 参考答案
  • 方法:FedAvg随机选择 vs 速度优先 vs 参与率校正。
  • 操作:将客户端速度与标签分布相关联,扫描相关强度。
  • 控制:相同墙钟时间、通信量和调参预算。
  • 指标:平均/10%分位/最差精度、参与率、有效标签分布、通信和时间。
  • 可证伪结果:若速度优先在相同时间内不降低尾部性能,则假设不成立。

题2:安全聚合与投毒

设计实验检验“隐藏单更新会削弱异常检测”。

🔍 参考答案

比较明文逐客户端检测、安全聚合无检测、安全聚合兼容鲁棒协议;扫描恶意比例、攻击强度和Non-IID。报告干净精度、攻击成功率、误报/漏报、通信与隐私可见性。

题3:VFL交集偏差

设计实验检验“非随机重叠导致非交集人群校准偏差”。

🔍 参考答案

按标签/活跃度控制重叠概率;在交集训练SecureBoost;分别测试交集与非交集;比较无校正和参与概率重加权。指标为AUC、Brier、ECE和群体校准差。

题4:FTL负迁移

设计实验区分“真正迁移知识”与“过拟合少量对齐样本”。

🔍 参考答案

扫描域相关性、重叠样本量与对齐偏差;基线包括B-only、无对齐损失、集中TL;在未参与对齐的目标样本和时间外数据测试;报告负迁移率、AUC和表征距离。

题5:用户级DP公平

设计实验检验统一裁剪阈值是否系统伤害小数据客户端。

🔍 参考答案

设置客户端数据量长尾和Non-IID;比较统一裁剪、自适应裁剪及无DP;保持相同隐私预算;报告客户端裁剪率、更新信噪比、平均/尾部精度、和收敛轮数。

八、最终口试题

用不超过10分钟完整回答:

某银行与电商希望利用共同用户训练信用模型。银行持有标签,电商持有消费特征。双方不信任但愿意遵守协议;协调方可能好奇;模型上线后要求低延迟、可审计、支持用户删除。请设计系统,并明确你不能保证什么。

🔍 参考答案要点
  1. 数据划分为VFL,先做PSI/实体对齐并分析交集选择偏差。
  2. 模型可选安全线性回归或SecureBoost,说明主动方/被动方/协调方。
  3. HE/MPC保护训练中间量,TLS保护信道;明确半诚实、串谋和密钥假设。
  4. 评估更新/输出泄露,必要时加入合适保护单位的DP。
  5. 单独设计恶意输入、标签投毒、后门和拒绝服务防御。
  6. 协同推理延迟可能不满足要求,应评估本地蒸馏/模型分片部署的效用与泄露。
  7. 报告集中、银行单方、VFL基线;同时测交集/非交集、群体公平、通信和墙钟。
  8. 设计审计、访问控制、密钥轮换、参与方退出和删除/联邦遗忘流程。
  9. 明确不能仅凭“数据不出域”保证合规、DP、恶意安全、无偏、公平或可删除。
  10. 由当前法律与合规人员确定角色、合法基础、目的限制、跨境和数据主体权利。