《联邦学习》闭卷复习题
建议:先只看题目,在纸上写出定义、角色、消息、公式和失效条件;完成后再展开答案。算法题至少写到可以据此实现伪代码。
一、全书骨架
- 联邦学习与普通分布式机器学习的约束有何不同?
- HFL、VFL和FTL如何由样本与特征空间区分?
- 一次联邦任务启动前必须回答哪八类问题?
- 为什么联邦学习不是一个单独算法?
- 为什么平均精度不足以评价联邦系统?
🔍 参考答案
- 普通DML通常由同一控制方管理数据分片、节点和高速网络;FL加入数据自治、Non-IID、部分参与、不稳定通信、不完全信任、隐私和激励约束。
- HFL:特征/标签相同、样本不同;VFL:共同样本多、特征不同;FTL:样本和特征重叠都少。
- 参与方、数据划分、优化目标、交换信息、信任角色、隐私保护单位、系统约束、评价指标。
- 它是一类协作学习问题,可使用不同模型、优化器、架构和安全协议。
- 还需看最差/分位客户端、通信、墙钟时间、能耗、隐私预算、攻击成功率、公平和可用性。
二、定义与对比
- IID、Non-IID、数据量不平衡分别指什么?
- 数据并行、模型并行和任务并行分别划分什么?
- 同步与异步训练的主要风险是什么?
- 梯度平均与模型平均何时等价?
- 客户端漂移与随机梯度噪声有何区别?
- 半诚实与恶意攻击者的能力差异是什么?
- 安全聚合、DP、HE和MPC各保护什么?
- 隐私保护与投毒防御为什么不能混为一谈?
- 样本级DP与用户级DP的邻接单位是什么?
- PSI解决什么问题,又不解决什么问题?
🔍 参考答案
- IID表示各局部样本来自同一分布;Non-IID表示局部分布系统不同;数据量不平衡只描述
差异,不等同于分布差异。 - 分别划分样本、模型参数/层、计算操作。
- 同步受慢节点/掉线阻塞;异步有陈旧更新、顺序和快节点偏差。
- 同一初始参数、一步相同学习率、本地梯度在同一点计算且聚合权重一致时。
- 漂移来自局部目标与全局目标系统不一致;梯度噪声来自有限批次随机采样。
- 半诚实者遵守协议但分析消息;恶意者可构造输入、伪造消息、串谋和拒绝服务。
- 安全聚合隐藏单更新;DP限制个体影响;HE保护密文计算;MPC保护多方输入和中间量。
- 加密恶意更新仍是恶意更新;机密性不判断更新是否正确。
- 一条记录与一个用户的全部记录/贡献。
- PSI安全找交集;不自动保护交集本身、后续训练、梯度和预测。
三、公式重建
题1:联邦目标
从总样本平均损失推导客户端加权目标,并解释每个量。
🔍 参考答案
题2:FedSGD更新
写出客户端梯度和服务器更新。
🔍 参考答案
全集参与且
题3:VFL线性回归
展开联合平方损失,并说明为什么需要安全交叉项。
🔍 参考答案
令
展开后包含A本地项
题4:SecureBoost
写出分裂增益和叶权重,并解释谁计算。
🔍 参考答案
主动方持标签,计算并加密逐样本
题5:FTL联合目标
写出监督损失、对齐损失和正则项。
🔍 参考答案
题6:差分隐私
写出
🔍 参考答案
题7:FLI
写出支付权重、预算分配和欠偿更新。
🔍 参考答案
四、算法重建
题1:FedAvg
不看笔记写出一轮的服务器端、客户端、本地步数、聚合权重和终止条件。
🔍 参考答案
服务器从全局模型wt开始,采样Ct并下发wt。
客户端k从wt开始,对本地mini-batch执行多步SGD,得到wk并上传。
服务器按本轮约定权重alpha_k聚合:wt+1=sum alpha_k wk。
达到损失/指标收敛、最大轮数或时间上限则停止。必须明确参与率
题2:安全联邦线性回归
写出A、B、C每轮交换顺序和随机掩码作用。
🔍 参考答案
C生成密钥;A/B交换公钥下加密局部点积/残差;各方计算加密梯度并加入自己的随机掩码后发C;C只解密受掩码梯度并返回;A/B去除自己的掩码并更新参数。加密防明文暴露,掩码防C获得确切梯度。
题3:SecureBoost
写出一棵树从
🔍 参考答案
主动方算并加密[参与方ID, 特征ID, 阈值ID];选中被动方确定真实阈值、保存查找表、返回左样本ID;主动方维护树节点关联。预测时主动方查询相应被动方的左/右决策,直到叶节点。
题4:AHE联邦迁移学习
解释加密与掩码在训练和预测中分别出现在哪些位置。
🔍 参考答案
双方本地生成表征;交换用于对方梯度/损失的加密中间量;各自计算加密梯度并加入随机掩码,交给对方解密再返回;掩码拥有方去掩码更新。预测时B发送加密表征,A计算受掩码预测,B解密后返回,A去掩码得到标签。
题5:纵向联邦DQN
说明持奖励方和观察协作方如何反向传播。
🔍 参考答案
各协作方用本地观察计算中间激活并加密发送Q网络方;Q网络方结合奖励计算DQN损失并反向传播,将相应加密梯度发回;协作方解密并更新本地网络。训练和推理都可能需要多方在线。
五、隐私边界判断
判断下列说法是否正确,并说明理由。
- “数据不出本地,因此系统满足差分隐私。”
- “使用HE后,最终模型不会泄露训练数据。”
- “安全聚合既保护隐私又能阻止投毒。”
- “PSI不会泄露任何实体关系。”
- “秘密共享版FTL没有精度损失,因此没有安全代价。”
- “半诚实安全协议可以防止客户端构造特殊输入。”
- “样本级DP可自动保护一个用户的全部历史记录。”
- “TLS足以防止聚合服务器分析客户端梯度。”
🔍 参考答案
- 错。DP需要邻接关系、裁剪、噪声和会计。
- 错。HE保护密文计算,不限制解密输出和最终模型。
- 错。安全聚合隐藏单个更新,不能验证其是否恶意。
- 错。协议通常输出交集,交集本身和大小也可能敏感。
- 错。仍有通信、预处理、三元组存储和串谋阈值代价。
- 错。构造特殊输入属于恶意偏离协议。
- 错。用户有多条记录时需用户级邻接或组合分析。
- 错。TLS只保护链路,端点服务器仍看到明文。
六、失效条件分析
- 增大FedAvg本地步数
时,何时收益转为损失? - 为什么速度优先客户端选择会产生统计偏差?
- 为什么VFL只在实体交集训练可能无法泛化到全体用户?
- FTL中对齐损失降低但目标性能下降说明什么?
- 为什么安全聚合和鲁棒聚合可能冲突?
- FLI在预算长期不足时会发生什么?
- HFRL平均回报提高为何仍可能不安全?
- 独立预训练模型为什么可能无法直接参数平均?
🔍 参考答案
- 当通信节省不足以抵消Non-IID漂移、本地过拟合和计算成本时。
- 设备速度可能与地区、群体和数据分布相关,选中数据不再代表目标总体。
- 同时出现在双方的用户可能是高活跃或特定群体,存在选择偏差。
- 可能发生负迁移:表示更接近但任务语义被抹平。
- 前者不让服务器看单个更新,后者常需检查/比较单个更新。
可能持续增长,参与方退出,机制不可持续。 - 最差环境或低概率灾难的约束违反率可能上升。
- 神经元排列、尺度和参数语义不对齐。
七、科研设计题
题1:Non-IID与系统偏差
设计实验检验“慢客户端集中持有少数标签时,速度优先选择损害尾部群体”。
🔍 参考答案
- 方法:FedAvg随机选择 vs 速度优先 vs 参与率校正。
- 操作:将客户端速度与标签分布相关联,扫描相关强度。
- 控制:相同墙钟时间、通信量和调参预算。
- 指标:平均/10%分位/最差精度、参与率、有效标签分布、通信和时间。
- 可证伪结果:若速度优先在相同时间内不降低尾部性能,则假设不成立。
题2:安全聚合与投毒
设计实验检验“隐藏单更新会削弱异常检测”。
🔍 参考答案
比较明文逐客户端检测、安全聚合无检测、安全聚合兼容鲁棒协议;扫描恶意比例、攻击强度和Non-IID。报告干净精度、攻击成功率、误报/漏报、通信与隐私可见性。
题3:VFL交集偏差
设计实验检验“非随机重叠导致非交集人群校准偏差”。
🔍 参考答案
按标签/活跃度控制重叠概率;在交集训练SecureBoost;分别测试交集与非交集;比较无校正和参与概率重加权。指标为AUC、Brier、ECE和群体校准差。
题4:FTL负迁移
设计实验区分“真正迁移知识”与“过拟合少量对齐样本”。
🔍 参考答案
扫描域相关性、重叠样本量与对齐偏差;基线包括B-only、无对齐损失、集中TL;在未参与对齐的目标样本和时间外数据测试;报告负迁移率、AUC和表征距离。
题5:用户级DP公平
设计实验检验统一裁剪阈值是否系统伤害小数据客户端。
🔍 参考答案
设置客户端数据量长尾和Non-IID;比较统一裁剪、自适应裁剪及无DP;保持相同隐私预算;报告客户端裁剪率、更新信噪比、平均/尾部精度、
八、最终口试题
用不超过10分钟完整回答:
某银行与电商希望利用共同用户训练信用模型。银行持有标签,电商持有消费特征。双方不信任但愿意遵守协议;协调方可能好奇;模型上线后要求低延迟、可审计、支持用户删除。请设计系统,并明确你不能保证什么。
🔍 参考答案要点
- 数据划分为VFL,先做PSI/实体对齐并分析交集选择偏差。
- 模型可选安全线性回归或SecureBoost,说明主动方/被动方/协调方。
- HE/MPC保护训练中间量,TLS保护信道;明确半诚实、串谋和密钥假设。
- 评估更新/输出泄露,必要时加入合适保护单位的DP。
- 单独设计恶意输入、标签投毒、后门和拒绝服务防御。
- 协同推理延迟可能不满足要求,应评估本地蒸馏/模型分片部署的效用与泄露。
- 报告集中、银行单方、VFL基线;同时测交集/非交集、群体公平、通信和墙钟。
- 设计审计、访问控制、密钥轮换、参与方退出和删除/联邦遗忘流程。
- 明确不能仅凭“数据不出域”保证合规、DP、恶意安全、无偏、公平或可删除。
- 由当前法律与合规人员确定角色、合法基础、目的限制、跨境和数据主体权利。
