联邦学习实验规范
面向研究复现与论文报告的统一实验设置约定。与知识地图的基线定义配套使用:报告结果前先明确「集中参考 / 明文协议参考 / 同预算实现」三组对照的身份,避免把额外资源误当成方法增益。
一句话原则
每个实验都要能回答:数据怎么划分、谁参与、跑了多少轮、报告哪些数、和谁比、预算是否相同。
一、数据划分协议
- 横向(HFL):
- Pathological 划分:按标签把样本分给各客户端(例如每客户端只含 1-2 类标签),异质性最强、最容易被低估真实场景;
- Real-world 划分:用 Dirichlet 分布
按标签采样划分, 越小异质性越强;报告使用的 值; - 数据量长尾:客户端样本量按幂律分布,同时报告样本量加权与均匀加权两种聚合。
- 纵向(VFL):明确共同样本比例、特征划分与标签方;报告实体对齐的错误匹配与漏匹配率(真实对齐存在噪声)。
- 迁移(FTL):明确源域/目标域、域相似度度量(如 MMD)、对齐样本量与标签量。
- 异质性报告:至少报告一个量化指标(如标签分布差异、MMD 距离、样本量基尼系数),不能只说 "non-IID"。
二、训练配置报告
| 配置项 | 报告要求 |
|---|---|
| 本地步数 | 必报;扫参范围与最终值 |
| 参与率 | 必报;说明选择依据 |
| 随机种子 | 至少 3 个不同 seed,报告 mean ± std |
| 客户端选择 | 随机 / 速度优先 / 质量优先,说明是否与数据分布相关 |
| 优化器与调度 | 客户端与服务器两侧分别说明 |
| 硬件与实现 | 框架、版本、设备类型(CPU/GPU 型号) |
三、评估与统计
- 核心指标:平均性能 + 最差群体性能(10% 分位或最差客户端/医院),单报平均会掩盖异质性下的退化;
- 校准类任务:额外报告 AUC、Brier 分数、ECE(期望校准误差)等与阈值无关的指标;
- 显著性:多个 seed 下使用配对检验(t 检验或 Wilcoxon 符号秩),报告效应量;不做显著性说明时应声明为初步结果;
- 消融矩阵:每个模块(如客户端筛选、梯度稀疏化、DP)单独移除的实验,缺一不可;
- 隐私实验:报告
、裁剪率、更新信噪比、成员推断攻击成功率;DP 实验必须注明保护单位(记录级/用户级/客户端级)。
四、通信与系统指标
- 通信量:报告总上行字节数与相对基线的降幅,说明是否含模型、梯度和掩码/密文开销;
- 墙钟时间:区分计算时间与通信时间,说明带宽与延迟假设;
- 带宽分档:在低速/高速网络两档分别报告,避免单一带宽结论;
- 能耗与内存:移动端场景报告峰值内存与能耗。
五、复现清单
- 数据划分脚本与种子;
- 训练配置(超参数网格与最终值);
- 代码与依赖版本(框架、CUDA、库);
- 基线实现来源(自实现 / 官方仓库 / 第三方实现,注明版本);
- 评价脚本与统计检验代码。
六、常见失分点(论文写作对照)
- 只报平均精度,不报最差群体 → 异质性方法无法体现价值;
- 基线缺「同预算」约束 → 方法增益可能来自更多轮数/更多计算;
- 隐私实验不说明保护单位 → 记录级与用户级的
不可比; - 消融不完整 → 无法判断每个模块的独立贡献;
- 不报告随机种子 → 结果不可复现。
本页为规范清单而非实验结果;与「教学构造声明」一致,本专题内的数值示例不得作为规范验证的替代。
