联邦学习闭卷复习题
先完成自动判分速测,定位薄弱章节;再在纸上重建公式与算法;最后完成科研和系统设计题。
三层验收
- 概念速测:能否准确分类并判断机制边界?
- 主动重建:能否不看笔记写出公式与一轮算法?
- 压力测试:能否指出假设、构造失效条件并设计验证?
一、知识体系与定义速测
- 与普通分布式机器学习相比,联邦学习新增的典型约束是?
- [ ] 所有节点必须位于同一数据中心
- [x] 数据自治、Non-IID、部分参与与不完全信任
- [ ] 只能训练线性模型
- [ ] 每轮必须让全部客户端参与
解析
普通DML通常可由同一控制方管理数据分片、节点和网络;联邦学习面对现实数据分布、设备状态和跨组织信任边界。
- 两家医院使用相同病历字段,但拥有不同患者,最接近哪类联邦学习?
- [x] 横向联邦学习(HFL)
- [ ] 纵向联邦学习(VFL)
- [ ] 联邦迁移学习(FTL)
- [ ] 纵向联邦强化学习(VFRL)
解析
特征和标签接口相同、样本ID不同,属于“同列不同行”的HFL。
- 银行与电商拥有大量共同客户,但分别持有信用和消费特征,最接近哪类联邦学习?
- [ ] HFL
- [x] VFL
- [ ] FTL
- [ ] 普通数据并行
解析
共同样本较多而特征不同,属于“同行不同列”的VFL,通常需要先做隐私实体对齐。
- 哪些条件提示应该考虑FTL而不是HFL或VFL?(多选)
- [x] 样本重叠很少
- [x] 特征空间也难以直接对齐
- [x] 两个领域仍存在可检验的迁移关系
- [ ] 只要数据敏感就必须使用FTL
解析
样本和特征重叠都少时,HFL与VFL的直接协作条件不足;FTL还要求存在可迁移语义,否则强行对齐会导致负迁移。
- 为什么平均精度不足以评价联邦系统?(多选)
- [x] 可能掩盖最差客户端和少数群体损失
- [x] 没有反映通信、墙钟时间与能耗
- [x] 没有反映隐私预算和攻击成功率
- [ ] 因为联邦学习完全不需要精度指标
解析
精度仍然重要,但必须与尾部、公平、系统、安全和隐私指标一起报告。
- 数据并行与模型并行的主要区别是?
- [x] 前者划分样本并复制模型,后者拆分模型本身
- [ ] 前者只用于VFL,后者只用于HFL
- [ ] 前者没有通信,后者没有计算
- [ ] 二者完全等价
解析
数据并行主要扩展样本和吞吐;模型并行主要解决完整模型无法装入单节点的问题。
- 同步与异步训练各自最典型的风险是?
- [x] 同步受慢节点阻塞;异步受陈旧更新和快节点偏差影响
- [ ] 同步必然泄露数据;异步必然满足DP
- [ ] 同步无法聚合;异步无法训练
- [ ] 二者只在推理阶段不同
解析
同步需要等待本轮指定节点;异步提高吞吐,却让更新基于不同版本参数,并可能过度代表速度快的客户端。
- 梯度平均与模型平均在什么条件下等价?
- [ ] 任意本地步数和优化器下都等价
- [x] 同一初始点、一步相同学习率、相同聚合权重
- [ ] 只有使用HE时等价
- [ ] 只有Non-IID时等价
解析
多步本地更新后,各客户端在不同参数点计算梯度,模型平均通常不再等价于共同参数点上的梯度平均。
- 半诚实攻击者的准确描述是?
- [x] 遵守协议,但保存并分析所有可见消息
- [ ] 可以任意伪造输入且仍属于半诚实
- [ ] 完全不会尝试推断隐私
- [ ] 只指外部网络窃听者
解析
构造特殊输入、伪造消息、串谋或拒绝服务属于更强的恶意攻击能力,不能直接套用半诚实安全结论。
- PSI能直接解决什么问题?
- [ ] 保证后续模型训练满足DP
- [x] 在规定威胁模型下找出实体交集并隐藏非交集元素
- [ ] 阻止模型投毒
- [ ] 保证交集本身不敏感
解析
PSI只负责实体对齐;交集、集合大小、后续梯度和预测仍需单独分析与保护。
二、公式重建
题1:联邦目标
从总样本平均损失推导客户端加权目标,并解释每个量。
🔍 参考答案
题2:FedSGD更新
写出客户端梯度和服务器更新。
🔍 参考答案
这是本文默认的本轮参与集合内样本量归一化。全集参与时分母为
题3:VFL线性回归
展开联合平方损失,并说明为什么需要安全交叉项。
🔍 参考答案
令
展开后包含A本地项
题4:SecureBoost
写出分裂增益和叶权重,并解释谁计算。
🔍 参考答案
主动方持标签,计算并加密逐样本
题5:FTL联合目标
写出监督损失、对齐损失和正则项。
🔍 参考答案
题6:差分隐私
写出
🔍 参考答案
题7:FLI
写出支付权重、预算分配和欠偿更新。
🔍 参考答案
题8:Per-FedAvg元目标
写出一步本地适配时的客户端元目标、精确元梯度和最终个性化模型。
🔍 参考答案
三、算法重建
题1:FedAvg
不看笔记写出一轮的服务器端、客户端、本地步数、聚合权重和终止条件。
🔍 参考答案
服务器从全局模型wt开始,采样Ct并下发wt。
客户端k从wt开始,对本地mini-batch执行多步SGD,得到wk并上传。
服务器计算alpha_{k,t}=nk/sum_{j in Ct}nj,聚合wt+1=sum_{k in Ct}alpha_{k,t}wk。
达到损失/指标收敛、最大轮数或时间上限则停止。2
3
4
必须明确参与率
题2:安全联邦线性回归
写出被动/特征方A、主动/标签方B和可选协调/解密方C每轮的交换顺序与随机掩码作用。
🔍 参考答案
C生成密钥;A/B交换公钥下加密局部点积/残差;各方计算加密梯度并加入自己的随机掩码后发C;C只解密受掩码梯度并返回;A/B去除自己的掩码并更新参数。加密防止协议参与者直接看到明文中间量,掩码防C获得确切梯度。
题3:SecureBoost
写出一棵树从
🔍 参考答案
主动方算并加密[参与方ID, 特征ID, 阈值ID];选中被动方确定真实阈值、保存查找表、返回左样本ID;主动方维护树节点关联。预测时主动方查询相应被动方的左/右决策,直到叶节点。
题4:AHE联邦迁移学习
解释加密与掩码在训练和预测中分别出现在哪些位置。
🔍 参考答案
双方本地生成表征;交换用于对方梯度/损失的加密中间量;各自计算加密梯度并加入随机掩码,交给对方解密再返回;掩码拥有方去掩码更新。预测时B发送加密表征,A计算受掩码预测,B解密后返回,A去掩码得到标签。
题5:纵向联邦DQN
说明持奖励方和观察协作方如何反向传播。
🔍 参考答案
各协作方用本地观察计算中间激活并加密发送Q网络方;Q网络方结合奖励计算DQN损失并反向传播,将相应加密梯度发回;协作方解密并更新本地网络。训练和推理都可能需要多方在线。
四、隐私边界速测
- “原始数据不出本地,因此系统自动满足差分隐私。”
- [ ] 对
- [x] 错
解析
DP需要明确邻接关系,通过裁剪限制敏感度、加入噪声,并对多轮训练做隐私会计;数据留在本地不包含这些条件。
- “使用HE后,最终模型不会泄露训练数据。”
- [ ] 对
- [x] 错
解析
HE保护密文计算过程,不限制获授权的解密结果或最终模型泄露训练信息。
- “安全聚合既隐藏单个更新,又能自动阻止模型投毒。”
- [ ] 对
- [x] 错
解析
安全聚合解决机密性,不验证更新是否正确;隐藏单个更新还可能削弱逐客户端异常检测。
- “PSI通常会输出交集,因此交集本身和集合大小仍可能敏感。”
- [x] 对
- [ ] 错
解析
PSI主要隐藏非交集元素,协议允许输出的交集、大小及重复查询模式仍需治理。
- “秘密共享版FTL没有近似精度损失,所以没有任何安全或系统代价。”
- [ ] 对
- [x] 错
解析
它仍有份额通信、乘法三元组预处理、存储、在线阈值和串谋假设等代价。
- “半诚实安全结论可以直接覆盖客户端构造特殊探测输入。”
- [ ] 对
- [x] 错
解析
构造特殊输入属于偏离诚实协议行为,通常需要恶意安全协议、输入验证或审计机制。
- “把整家医院视为一个客户端并裁剪其更新,就自动获得院内患者级用户DP。”
- [ ] 对
- [x] 错
解析
裁剪整家医院更新对应的通常是客户端/机构级贡献边界。患者级用户DP需要以单名患者的全部记录为邻接单位,并据此裁剪、加噪和会计;医院是一个客户端不表示它是一个自然人用户。
- “TLS可以阻止链路窃听,但不能阻止端点服务器分析收到的明文梯度。”
- [x] 对
- [ ] 错
解析
TLS提供信道机密性与完整性;消息到达端点并解密后,服务器仍能读取明文,需要安全聚合、HE或MPC处理端点不可信问题。
五、失效条件分析
- 增大FedAvg本地步数
时,何时收益转为损失? - 为什么速度优先客户端选择会产生统计偏差?
- 为什么VFL只在实体交集训练可能无法泛化到全体用户?
- FTL中对齐损失降低但目标性能下降说明什么?
- 为什么安全聚合和鲁棒聚合可能冲突?
- FLI在预算长期不足时会发生什么?
- HFRL平均回报提高为何仍可能不安全?
- 独立预训练模型为什么可能无法直接参数平均?
🔍 参考答案
- 当通信节省不足以抵消Non-IID漂移、本地过拟合和计算成本时。
- 设备速度可能与地区、群体和数据分布相关,选中数据不再代表目标总体。
- 同时出现在双方的用户可能是高活跃或特定群体,存在选择偏差。
- 可能发生负迁移:表示更接近但任务语义被抹平。
- 前者不让服务器看单个更新,后者常需检查/比较单个更新。
可能持续增长,参与方退出,机制不可持续。 - 最差环境或低概率灾难的约束违反率可能上升。
- 神经元排列、尺度和参数语义不对齐。
六、科研与设计开放题
本节分三部分:科研设计题(给定问题设计实验)、三案例综合推演(从数据关系一路推到基线)、最终口试(完整系统设计)。
题1:Non-IID与系统偏差
设计实验检验“慢客户端集中持有少数标签时,速度优先选择损害尾部群体”。
🔍 参考答案
- 方法:FedAvg随机选择 vs 速度优先 vs 参与率校正。
- 操作:将客户端速度与标签分布相关联,扫描相关强度。
- 控制:相同墙钟时间、通信量和调参预算。
- 指标:平均/10%分位/最差精度、参与率、有效标签分布、通信和时间。
- 可证伪结果:若速度优先在相同时间内不降低尾部性能,则假设不成立。
题2:安全聚合与投毒
设计实验检验“隐藏单更新会削弱异常检测”。
🔍 参考答案
比较明文逐客户端检测、安全聚合无检测、安全聚合兼容鲁棒协议;扫描恶意比例、攻击强度和Non-IID。报告干净精度、攻击成功率、误报/漏报、通信与隐私可见性。
题3:VFL交集偏差
设计实验检验“非随机重叠导致非交集人群校准偏差”。
🔍 参考答案
按标签/活跃度控制重叠概率;在交集训练SecureBoost;分别测试交集与非交集;比较无校正和参与概率重加权。指标为AUC、Brier、ECE和群体校准差。
题4:FTL负迁移
设计实验区分“真正迁移知识”与“过拟合少量对齐样本”。
🔍 参考答案
扫描域相关性、重叠样本量与对齐偏差;基线包括B-only目标域对照、
题5:跨设备用户级DP公平
在客户端与用户一一对应的跨设备FL中,设计实验检验统一裁剪阈值是否系统伤害小数据用户。
🔍 参考答案
设置每用户数据量长尾和Non-IID;比较统一裁剪、自适应裁剪及无DP;保持相同用户级隐私预算;报告用户更新裁剪率、信噪比、平均/尾部精度、
题6:个性化方法公平比较
设计实验检验“个性化收益只是来自额外本地计算,而非个性化目标”。
🔍 参考答案
- 基线:Local-only、未适配FedAvg、FedAvg+本地微调、Per-FedAvg;特征偏移时再加FedBN及其BN聚合消融。
- 控制:各方法使用相同适配样本、适配步数、梯度调用、调参预算和墙钟上限。
- 切片:适配前/后、训练期已见/新客户端、不同本地样本量。
- 指标:平均、10%分位与最差客户端性能,适配增益、通信、计算和新客户端失败率。
- 可证伪结果:若Per-FedAvg在同预算下不优于FedAvg+微调,则不支持元目标带来独立收益的假设。
三案例综合推演
这一部分不再按单个知识点出题,而是检查能否从数据关系一路推到算法、可见性、部署依赖、失效条件和实验基线。
| 案例 | 核心任务 | 回看章节 |
|---|---|---|
| A:跨医院联合诊断 | HFL分类、FedAvg计算、参与偏差 | 第4章 |
| B:银行—电商联合风控 | VFL分类、消息可见性、协同推理 | 第5章 |
| C:跨地区弱标签迁移 | FTL分类、对齐权重、负迁移 | 第6章 |
作答顺序
先闭卷完成速测,再在纸上写过程,最后改变一个关键假设做压力测试。过程题应主动回答:参与方、数据分布、交换消息、可见内容、模型归属、推理依赖、脆弱假设和比较基线。
客观速测
- 案例A中,医院A有100名患者并上传
,医院B有300名患者并上传 。按本轮样本量聚合得到? - [ ]
- [ ]
- [x]
- [ ]
- [ ]
解析
样本权重分别为
- 对案例A的聚合与掉线,哪些说法正确?(多选)
- [x] 样本量加权对应每名患者权重相同
- [x] 客户端均匀加权对应每家医院权重相同
- [x] 若B掉线并按参与方重新归一化,本轮结果为
- [ ] 安全聚合会自动消除B掉线造成的训练分布变化
解析
两种权重对应不同优化目标。B掉线后只剩A的更新,本轮有效训练分布也只代表A院;安全聚合保护更新机密性,不负责纠正参与偏差。
- 对案例A的安全机制,哪些边界判断正确?(多选)
- [x] 安全聚合可隐藏服务器所见的单家医院更新
- [x] DP需要先明确保护一条病历、一名患者还是整家医院
- [x] 鲁棒聚合主要处理异常或恶意更新,而不是提供DP
- [ ] TLS可以保证最终诊断模型不泄露训练信息
解析
安全聚合、DP、鲁棒聚合和TLS分别面向更新机密性、声明保护单位的输出影响、完整性和链路安全;它们不能相互替代。一条病历、一名患者和整家医院分别对应记录级、用户级和机构级邻接。
- 案例B中的角色对应关系是?
- [ ] 电商A持标签,银行B只持特征
- [x] 电商A持消费特征,银行B持信用特征和标签,C是可选协调/解密方
- [ ] C持有全部原始数据和标签
- [ ] 银行与电商各自训练完整模型后直接平均
解析
案例B中,电商A是被动方,银行B是持标签的主动方。双方共同计算跨方中间量,而不是平均两个完整模型。
- 在案例B的一种AHE加掩码实现中,协调/解密方C解密梯度时按协议应看到什么?
- [ ] A、B的全部原始特征
- [ ] 精确的未掩码梯度
- [x] 真实梯度与随机掩码之和
- [ ] 只有最终模型,完全看不到元数据
解析
A、B先对密文梯度加入随机掩码,再交给C解密。若掩码泄露、复用不当或C与能获得相应掩码的角色串谋,真实梯度仍可能暴露。
- 关于案例B的模型与推理,哪项正确?
- [ ] 银行在训练后必然拥有全部电商特征和参数
- [ ] 使用PSI后,银行一定可以独立执行完整推理
- [x] 模型组件通常分散在双方,新客户预测可能需要电商持续在线
- [ ] 协同推理只影响隐私,不影响延迟和可用性
解析
VFL参数或树查找表通常分散保存。若希望银行单方部署,需要额外设计蒸馏或模型迁移,并重新评估效用与泄露边界。
- 案例C中,候选模型P与Q的监督/对齐损失分别为
和 ,正则贡献均为 。二者总损失相等时的 是? - [ ]
- [x]
- [ ]
- [ ]
- [ ]
解析
令
- 当案例C取
时,训练目标选择Q;目标域测试损失为B-only 、P 、Q 。正确结论是? - [ ] Q实现正迁移,因为它的对齐损失最低
- [ ] Q实现正迁移,因为训练目标选择了它
- [x] Q发生负迁移,因为目标域测试性能差于B-only
- [ ] 无法使用B-only判断迁移是否有益
解析
在损失越低越好的前提下,Q的目标域测试损失
- 对案例C的实验评价,哪些做法必要?(多选)
- [x] 将B-only目标域对照作为最低限度基线
- [x] 比较
的无对齐版本 - [x] 在未参与调参的目标域测试集上评价
- [x] 同时报告监督损失、对齐距离和目标域性能
解析
这里的B-only只使用B方特征与同等授权监督,不使用A方源域知识。这些比较可以区分“目标域数据本身能学到的能力”“对齐项带来的增益”和“只在训练/对齐样本上表现良好”的假象。
过程重建
任务A:从局部目标走完一轮FedAvg
设
医院A、B分别有100和300名患者。闭卷完成:
- 求两家医院每一步的梯度和两步后的本地参数;
- 计算样本量加权、医院均匀加权和B掉线三种结果;
- 解释三种结果分别代表什么训练目标或参与分布;
- 说明为什么本例不能化成共同参数点上的一次梯度平均。
🔍 参考答案
局部梯度为:
- A:
时梯度为 ,更新到 ; 时梯度为 ,最终 。 - B:
时梯度为 ,更新到 ; 时梯度为 ,最终 。 - 样本量加权:
,对应每名患者权重相同。 - 医院均匀加权:
,对应每家医院权重相同。 - B掉线并按参与方重新归一化:结果为
,本轮只代表A院患者。
第二步梯度分别在
任务B:重建VFL消息与可见性
案例B中,电商A持
🔍 参考答案
- 实体对齐
- 消息流:A与B交换PSI协议消息。
- 可见内容:获授权的交集或交集大小。
- 风险:共同客户集合、集合规模、低熵ID和重复查询模式。
- 密钥建立
- 消息流:C向A、B发送公钥并保留私钥。
- 可见内容:A、B获得加密能力,C掌握解密能力。
- 风险:私钥泄露、错误证书和串谋。
- 联合训练
- 消息流:A、B交换加密局部得分、残差份额、损失项或分裂统计。
- 可见内容:接收方看到密文,以及消息大小和时序等元数据。
- 风险:特殊输入、差分查询和实现侧信道。
- 梯度解密
- 消息流:A、B向C发送加掩码密文梯度;C返回解密后的掩码梯度。
- 可见内容:C只应看到“真实梯度+随机掩码”,各方最终只得到自己的梯度。
- 风险:掩码泄露或复用,以及C与能获得相应掩码的角色串谋。
- 协同推理
- 消息流:A、B按协议组合局部得分或树路径,必要时由C辅助。
- 可见内容:授权结果方获得预测,其他方只获得必要中间结果。
- 风险:高频探测、输出反演、路径泄露和关键方掉线。
双方拥有的是不同特征上的模型组件,更新依赖同一个跨方残差或分裂统计,不存在两个可直接平均的完整同构模型,因此不能照搬FedAvg。
任务C:从训练目标判断迁移是否有效
候选模型P与Q的数据沿用速测。闭卷完成:
- 分别写出
与 ; - 求模型选择切换点并判断
和 时的选择; - 使用目标域测试损失判断P、Q是正迁移还是负迁移;
- 写出至少四个实验基线或报告项。
🔍 参考答案
二者在
目标域测试损失为B-only
压力测试
压力测试A:慢医院持有稀有病例
医院B网络更慢,却持有大多数稀有病患者。系统为了缩短墙钟时间,经常只选择医院A。分析这会怎样影响优化目标、平均性能和稀有病召回率,并设计一个可证伪的对照实验。
🔍 参考答案
频繁缺少B会使实际参与分布偏向A;即使每轮权重归一化正确,也不能恢复从未参与的数据。总体平均指标可能保持稳定,但稀有病召回率和B院性能可能下降。
实验应比较随机选择、速度优先和带参与率/群体约束的选择策略,控制相同墙钟时间、通信或调参预算;报告每院参与频次、有效标签分布、平均性能、稀有病召回率、最差医院性能和通信成本。若速度优先没有降低稀有病或尾部性能,则“速度选择造成群体损害”的假设在该设置下不成立。
压力测试B:掩码泄露与上线约束
假设C保留了历史受掩码梯度,之后对应掩码泄露;同时银行要求低延迟预测并支持用户删除。分别说明哪项安全假设被破坏、为什么协同推理难以满足上线要求,以及删除请求为什么不能只删除一行原始数据。
🔍 参考答案
获得“受掩码梯度+对应掩码”即可恢复历史真实梯度,原来的梯度机密性结论失效;还需分析历史日志、备份、密钥轮换和串谋范围。
VFL推理通常依赖电商提供局部得分或树路径,网络延迟和任一方掉线都会影响服务。可评估蒸馏或模型迁移,但这会改变精度、模型归属和泄露边界。
删除原始记录不会自动消除其已经影响的参数、树结构、缓存、交集结果和审计日志。需要定义删除范围、传播路径、保留义务、重训或联邦遗忘方案,并验证删除效果。
压力测试C:对齐样本存在选择偏差
案例C的少量共同样本全部来自目标地区的高活跃用户,且
🔍 参考答案
共同样本只代表高活跃用户,降低对齐损失只能说明模型拟合了这一子群的跨域关系,不保证低活跃用户共享同样语义。在同一小集合上选择
应把调参与最终测试分离,保留未参与对齐的目标域样本,并分别报告高/低活跃群体的B-only、
最终口试
用不超过10分钟完整回答:
某银行与电商希望利用共同用户训练信用模型。银行持有标签,电商持有消费特征。双方不信任但愿意遵守协议;协调方可能好奇;模型上线后要求低延迟、可审计、支持用户删除。请设计系统,并明确你不能保证什么。
🔍 参考答案要点
- 数据划分为VFL,先做PSI/实体对齐并分析交集选择偏差。
- 模型可选安全线性回归或SecureBoost,说明主动方/被动方/协调方。
- HE/MPC保护训练中间量,TLS保护信道;明确半诚实、串谋和密钥假设。
- 评估更新/输出泄露,必要时加入合适保护单位的DP。
- 单独设计恶意输入、标签投毒、后门和拒绝服务防御。
- 协同推理延迟可能不满足要求,应评估本地蒸馏/模型分片部署的效用与泄露。
- 报告集中、银行单方、VFL基线;同时测交集/非交集、群体公平、通信和墙钟。
- 设计审计、访问控制、密钥轮换、参与方退出和删除/联邦遗忘流程。
- 明确不能仅凭“数据不出域”保证合规、DP、恶意安全、无偏、公平或可删除。
- 由当前法律与合规人员确定角色、合法基础、目的限制、跨境和数据主体权利。
七、方法鉴别(审稿视角)
给一段方法描述,判断它对应哪个已知方法及其与 FedAvg 的本质差异。这是审稿训练:方法名跟着机制走,不是跟着论文标题走。
- 服务器维护全局控制变量
,客户端 跨轮保留 ;本地训练用 校正梯度,并同时上传模型差与控制变量差。这是哪个方法,与FedAvg的本质差异是什么? - [ ] FedProx:近端正则化
- [x] SCAFFOLD:显式估计并校正客户端漂移
- [ ] FedNova:归一化不同本地进度
- [ ] FedOpt:在聚合步使用自适应优化器
解析
SCAFFOLD用
- 本地目标中加入与全局模型距离的平方正则项(超参数
控制强度)。这是哪个方法,本质机制是什么? - [x] FedProx:近端正则,容忍部分参与与异构本地迭代
- [ ] FedDyn:动态正则项
- [ ] SCAFFOLD:控制变量校正
- [ ] Per-FedAvg:元学习初始化
解析
FedProx的
- 聚合时不用样本量加权,而是用服务器在公共根数据集上训练的全局模型作为信任锚,按各客户端更新与锚更新的余弦相似度加权。这是哪个方法?
- [ ] Krum:挑选单个最可信更新
- [ ] Trimmed Mean:逐坐标裁剪极端值
- [x] FLTrust:信任引导的鲁棒加权
- [ ] Secure Aggregation:掩码后求和
解析
FLTrust 的信任评分来自与锚更新的相似度,权重与数据量无关;Krum 是从集合中选一个,Trimmed Mean 是逐坐标聚合,Secure Aggregation 解决的是「服务器看不见单个更新」而非「恶意更新」,三者与 FLTrust 解决的问题不同。
- 客户端本地使用批归一化层,且 BN 参数从不参与服务器聚合。这是哪个方法,针对哪类 Non-IID?
- [ ] FedProx:目标异质性
- [ ] FedOpt:优化器异质性
- [x] FedBN:特征偏移(feature shift)
- [ ] FedNova:步数不一致
解析
FedBN 把 BN 统计与参数本地化,针对客户端特征分布偏移(feature shift)型 Non-IID;FedProx 解决目标异质性,FedNova 解决本地步数不一致,FedOpt 解决服务器聚合的优化器选择——诊断 Non-IID 类型是选择方法的前提。
- 把联邦优化抽象为服务器优化器与客户端优化器的组合,把平均模型差的负值作为伪梯度,聚合步使用Adagrad、Adam或Yogi。这是哪个方法?
- [x] FedOpt
- [ ] FedNova
- [ ] FedDyn
- [ ] FedAvg
解析
FedOpt 的关键是把「聚合」看作服务器端的优化步骤,引入自适应动量;FedNova 是本地更新的步数归一化,FedDyn 是动态正则,FedAvg 是普通加权平均——「聚合步用什么优化器」是独立于「本地怎么训练」的设计维度。
- 客户端本轮分别执行2、10和30次本地更新。直接聚合累计模型差会让本地步数改变隐式目标权重;方法先按每个客户端的累计进度归一化方向,再单独设置全局有效步长。这是哪个方法?
- [ ] FedProx:近端约束
- [ ] SCAFFOLD:控制变量校正
- [x] FedNova:归一化本地累计更新
- [ ] FedOpt:服务器自适应优化
解析
FedNova把“方向权重”和“沿该方向走多远”分开,避免本地步数更多的客户端仅因计算进度更大而获得更高隐式权重。它修正目标不一致,但不会自动消除Non-IID导致的方向冲突。
- 某实验同时存在本地步数差异和服务器SGD难调两个问题。哪种设计最直接对应这两个失败来源?
- [ ] 只增大FedProx的
- [ ] 只增加SCAFFOLD控制变量
- [x] 用FedNova归一化本地进度,再明确选择FedOpt服务器优化器
- [ ] 用安全聚合隐藏所有更新
- [ ] 只增大FedProx的
解析
FedNova与FedOpt作用于不同位置:前者修正客户端累计进度造成的目标权重偏差,后者处理服务器如何使用聚合方向。可以组合不代表自动继承任一论文的全部理论结论,实验仍需重新报告目标、状态、调参和预算。
- 客户端目标同时包含与服务器模型的二次项和由前一轮局部梯度生成的线性项;服务器还维护动态校正状态。这是哪个方法,它的输出是否个性化模型?
- [ ] FedProx:输出个性化模型
- [x] FedDyn:动态对齐驻点,输出仍是共享模型
- [ ] FedBN:保留本地BN
- [ ] Per-FedAvg:学习元初始化
解析
FedDyn与FedProx都出现二次项,但FedDyn还使用历史局部梯度的动态线性校正和服务器状态,使收敛时的局部共识点与全局驻点一致。它优化共享模型,不因客户端持有历史状态就变成个性化方法。
- 联邦训练直接优化
,部署时客户端再从 做少量本地梯度步。这是哪个方法,公平基线是什么? - [ ] FedBN;基线只需FedAvg
- [ ] FedDyn;基线只需FedProx
- [x] Per-FedAvg;必须比较FedAvg+同预算本地微调
- [ ] FedOpt;必须比较安全聚合
解析
Per-FedAvg的目标是学习适配后表现良好的初始化。若不与使用相同本地数据、步数和调参预算的FedAvg+微调比较,就无法排除“只是额外本地计算带来收益”的解释。
- 某新医院从未参与训练,模型含BN层,且只有极少量本地样本。直接宣称FedBN已解决该院的特征偏移,缺少哪项关键验证?
- [ ] 只需验证服务器Adam的学习率
- [ ] 只需验证密文长度
- [x] 验证新客户端BN校准/适配和小batch统计稳定性
- [ ] 验证FedNova的本地步数归一化
解析
FedBN的旧客户端保留了历史BN状态,新客户端却没有可直接复用的
