第3章 分布式机器学习基础
原书范围:PDF第68~90页。
本章定位
- 在全书中的位置:连接第2章的隐私工具与第4~6章的联邦算法,是联邦学习的分布式计算前置知识。
- 前置知识:梯度下降、随机梯度下降、监督学习、基本分布式系统概念。
- 后续基础:第4章FedAvg继承数据并行和参数聚合;第5~6章继承隐私保护梯度下降与安全计算。
- 核心问题:多节点协作学习时,应划分数据、模型还是任务;当节点不完全可信时,又如何保护输入和中间结果?
一句话总结
分布式机器学习用并行计算突破数据、模型和训练时间的单机上限,而联邦学习在此基础上进一步加入数据自治、隐私、Non-IID和不可靠通信约束。
学习目标
- 区分面向扩展性和面向隐私保护的DML。
- 比较数据并行、模型并行、任务并行及混合并行。
- 重建同步与异步参数聚合的流程。
- 解释普通DML为什么不能直接等同于联邦学习。
- 按隐私、精度和效率分析隐私梯度下降方法。
Mermaid思维导图
一、本章要解决的问题
单机学习主要受两类上限约束:训练数据或模型放不进单机内存,以及串行训练耗时过长。DML通过多个计算节点分担存储和计算解决这些问题;但当节点属于不同机构或用户时,还必须避免从原始数据、梯度和模型中间量中泄露隐私。
原书据此区分两条主线:
- 面向扩展性的DML:重点是吞吐、容量和训练时间,节点通常由同一方控制。
- 面向隐私保护的DML:重点是多方数据协作时的机密性,参与方不一定互相信任。
⭐ 核心结论
联邦学习可以看作DML的一种特殊发展,但两者的优化环境不同:普通DML通常可以控制数据分片、节点和网络;联邦学习中的数据分布、参与行为和设备状态来自现实世界,协调方不能任意重排。
二、核心概念与定义
| 概念 | 准确定义 | 通俗理解 | 与相近概念的区别 |
|---|---|---|---|
| 分布式机器学习(DML) | 利用多个计算节点执行机器学习,以改善性能、隐私或可扩展性 | 多台机器共同完成一次学习任务 | 不必然满足数据自治或正式隐私保证 |
| 参数服务器 | 保存或协调全局参数,接收工作节点梯度/参数并聚合 | 模型更新的中心账本 | 联邦聚合服务器面对更弱控制和更强威胁模型 |
| 数据并行 | 不同节点持有数据分片和同一模型副本,并周期性交换更新 | 模型复制,数据分片 | 不能解决单个完整模型放不进设备的问题 |
| 模型并行 | 将一个模型拆分到多个节点,节点依序或并行完成前后向计算 | 数据流过被拆开的模型 | 主要解决模型内存上限,不一定提高吞吐 |
| 任务并行 | 并行执行不同操作或任务 | 不同处理器做不同工作 | 划分对象是计算任务,不只是数据或模型 |
| 同步训练 | 等待本轮所有指定节点完成后再聚合 | 快节点等慢节点 | 更新一致但受慢节点限制 |
| 异步训练 | 节点完成后立即提交,服务器随到随更 | 谁先算完谁先更新 | 吞吐高,但存在陈旧梯度和顺序偏差 |
| 面向隐私保护的DML | 在分布式训练中保护输入、标签、模型、身份等信息 | 不只分开算,还限制各方能看到什么 | 保护范围取决于威胁模型和具体协议 |
三、核心机制
3.1 参数服务器式数据并行
text
数据集切成互不相交的分片
↓
各工作节点保存同一模型副本
↓
节点用本地分片计算梯度或模型参数
↓
参数服务器同步或异步聚合
↓
服务器更新全局模型并下发- 输入:训练数据分片、模型、优化器状态。
- 角色:工作节点和参数服务器。
- 节点状态:本地数据分片、模型副本、本地梯度。
- 交换信息:梯度或模型参数。
- 输出:聚合后的全局模型。
- 训练/推理:协作主要发生在训练期;若最终模型完整可部署,推理可单机完成。

3.2 同步与异步
服务器等待本轮所有指定工作节点,将同一模型版本计算出的更新聚合。它便于定义一轮训练并减少参数版本差异,但整体速度受最慢节点影响。
| 维度 | 同步 | 异步 |
|---|---|---|
| 聚合时机 | 收齐本轮更新后 | 更新到达时 |
| 参数一致性 | 较强 | 较弱 |
| 慢节点影响 | 容易阻塞整轮 | 不阻塞其他节点 |
| 主要风险 | 等待和掉线 | 陈旧更新、顺序偏差 |
| 联邦场景难点 | 移动客户端慢且不稳定 | 在线率与速度可能和数据分布相关 |
3.3 并行方式对比
| 方式 | 划分对象 | 每节点保存什么 | 主要解决 | 关键代价/失效条件 |
|---|---|---|---|---|
| 数据并行 | 样本 | 完整模型+数据分片 | 数据规模、吞吐 | 模型必须能装入单节点;聚合通信大 |
| 模型并行 | 模型层或参数 | 部分模型 | 模型内存上限 | 节点间激活/梯度通信;流水线空泡 |
| 图并行 | 图数据及依赖 | 局部图和状态 | 稀疏图计算 | 分区质量和一致性控制 |
| 任务并行 | 操作/任务 | 指定任务状态 | 资源利用率 | 调度和任务依赖复杂 |
| 混合/交叉并行 | 多种对象 | 按层/阶段组合 | 同时扩展数据和模型 | 配置空间大,通信模式复杂 |
3.4 面向隐私保护的梯度下降
text
参与方保留本地输入
↓
计算本地梯度或中间结果
↓
明文、稀疏、扰动或加密后交换
↓
协调方/多方协议完成聚合
↓
各方更新整体模型或本地模型分片| 方法 | 交换信息 | 主要收益 | 主要代价 | 隐私强度 |
|---|---|---|---|---|
| 朴素联邦/明文平均 | 明文梯度或参数 | 高效率、无额外近似 | 梯度泄露 | 只避免直接上传原始数据 |
| 代数方法 | 利用欠定方程隐藏输入 | 计算较轻 | 依赖维度和背景知识假设 | 无统一的强密码学保证 |
| 稀疏/压缩更新 | 明文更新子集 | 减少通信 | 精度损失,非零位置仍泄露 | 原书指出正式分析较少 |
| 模糊处理 | 加噪或映射后的数据/梯度 | 可改善隐私,DP可量化 | 精度损失、会计要求 | 取决于机制;不能一概而论 |
| HE/MPC | 密文或秘密份额 | 隐藏输入和中间量 | 计算、通信和协议成本 | 取决于攻击者及串谋阈值 |
⚡ 隐私边界
稀疏化、压缩或“不传原始数据”不自动构成正式隐私保证。明文梯度的一个子集仍可能泄露样本信息;安全聚合隐藏单个更新,也不能限制最终模型对个体信息的泄露。
四、关键公式
4.1 数据划分
对任意两个参与方数据集
横向划分满足:
纵向划分满足:
- 横向划分相当于增加样本数量,适合数据并行和第4章HFL。
- 纵向划分相当于增加特征数量,需要跨方计算分裂统计量、点积或梯度,通向第5章VFL。
- 实际系统中“相等”常指任务所需空间已对齐,并非所有字段或样本绝对相同。
4.2 参数聚合的抽象形式
第3章用参数服务器示意聚合梯度或参数,没有规定统一目标函数。可将机制抽象为:
其中
- 优化目标:合并各数据分片产生的训练信号。
- 算法对应:节点本地计算
,服务器执行 Aggregate,再更新。 - 参数影响:同步频率增大通常减少参数漂移,但通信和等待增加。
Aggregate是否加权、鲁棒或安全,决定了它能否适配联邦场景;这些内容在第4章展开。
五、关键假设
| 假设类型 | 具体假设 | 假设不成立时的后果 |
|---|---|---|
| 数据假设 | 扩展性DML可由控制方合理分片,通常近似IID | 局部更新方向差异大,简单平均可能不稳定 |
| 系统假设 | 计算节点和高速网络由同一组织管理 | 广域网、掉线和慢节点使同步训练低效 |
| 模型假设 | 数据并行时完整模型能装入每个节点 | 必须采用模型并行或压缩 |
| 信任假设 | 普通参数服务器常被视为可信 | 明文梯度和参数可被服务器分析 |
| 攻击者假设 | 隐私协议需规定半诚实/恶意和串谋数 | 超出腐败阈值后,理论保证不成立 |
六、代价与权衡
| 维度 | 收益 | 代价或风险 |
|---|---|---|
| 模型效果 | 利用更多数据和算力 | 异步陈旧更新或非IID会损害收敛 |
| 本地计算 | 多节点并行缩短墙钟时间 | 资源利用受依赖和慢节点影响 |
| 通信成本 | 周期聚合实现协同 | 模型、梯度、激活或密文传输昂贵 |
| 存储成本 | 分散存储突破单机容量 | 模型副本、优化器和协议状态重复 |
| 隐私保证 | HE/MPC/DP可保护特定对象 | 密文计算、噪声和隐私会计带来成本 |
| 安全与鲁棒性 | 可组合安全协议 | 隐藏更新后异常检测更困难 |
| 客户端公平性 | 分布式训练可覆盖多方 | 快节点或大数据方可能主导结果 |
七、局限与开放问题
原书明确指出的局限
- 扩展性DML仍受内存、训练时间和通信限制。
- 扰动方法需要在隐私与模型性能间权衡。
- 密码学方法需要在计算/通信复杂度与安全间权衡。
- 稀疏梯度和压缩更新的隐私正式分析不足。
- 安全聚合可能因匿名性而更容易遭受投毒。
根据方法假设推导出的局限
- 以吞吐为目标的异步调度可能让在线率高的群体在统计上被过度代表。
- 模型并行虽解决显存问题,却会让训练依赖更频繁的跨节点交互。
- 把分布式训练直接迁移到跨机构环境,会遗漏身份认证、审计、利益冲突和退出机制。
2020年后仍值得研究的问题
- 大模型的张量、流水线、专家与数据并行如何和联邦数据自治结合;
- 安全聚合下的恶意更新检测;
- 异步和部分参与条件下的隐私会计;
- 系统异构、统计异构和群体公平的联合调度;
- 可信执行环境、MPC和HE的混合协议。
八、图示回查
| 原书图 | PDF页码 | 应记住的关系 |
|---|---|---|
| 图3-1 | 70 | 数据分片位于工作节点,梯度或参数在参数服务器聚合 |
第3章其余结构主要通过文字分类展开;决策树和隐私梯度下降的具体算法在引用文献及后续章节中延伸。
九、章节关系
text
第2章隐私工具
↓
第3章DML计算与隐私坐标系
├─ 数据并行 + 本地SGD + 参数聚合 → 第4章FedAvg
├─ 纵向划分 + 安全点积/梯度 → 第5章VFL
└─ 分布式表征 + 安全计算 → 第6章FTL十、闭卷回忆问题
- 面向扩展性DML与面向隐私保护DML的目标分别是什么?
- 数据并行和模型并行分别解决什么上限?
- 同步与异步参数更新的主要失效条件是什么?
- 为什么明文梯度平均只有低级别隐私保护?
- 稀疏更新为什么不能被直接当作隐私机制?
- HE/MPC与差分隐私分别牺牲什么来换取什么?
- 普通DML迁移到联邦环境时新增了哪些假设?
🔍 参考答案
- 前者解决数据、模型和训练时间的规模问题;后者限制分布式计算中的信息泄露。
- 数据并行扩展数据和吞吐,但每个节点需容纳完整模型;模型并行把过大的模型拆到多个节点。
- 同步受慢节点和掉线阻塞;异步受陈旧更新、更新顺序和快节点偏差影响。
- 原始数据虽不上传,但梯度仍携带样本和模型信息。
- 它只减少或变换可见更新,没有给出攻击者区分相邻数据集的正式上界。
- HE/MPC主要以计算和通信换机密性;DP以噪声和效用损失换可量化的个体影响界限。
- 数据自治、Non-IID、部分参与、不可靠网络、不完全信任、审计和激励等。
从教材到科研
现有方法隐含了哪些假设?
- 同步等待时间与客户端数据分布无关。
- 参数服务器能够正确聚合且不会滥用明文更新。
- 数据或模型的划分边界相对稳定。
- 压缩带来的误差对各客户端影响相近。
怎样构造让这些假设失效的实验?
- 让少数类客户端同时拥有更慢网络,比较同步和异步训练的群体性能;
- 逐步增加梯度陈旧度,测收敛轮数和最终误差;
- 联合改变数据Non-IID程度、模型大小和带宽;
- 对同一更新依次应用明文、压缩、DP和安全聚合,测泄露与效用;
- 在安全聚合中加入恶意客户端,比较隐私与异常检测能力。
可以提出哪些可证伪的研究问题?
对异步数据并行方法,当客户端速度与标签分布相关时,陈旧度加权能否在不增加相同墙钟时间下损失的前提下,缩小最差群体与平均群体的精度差?
- 现有方法:随到随更的异步SGD。
- 失效条件:慢客户端集中持有少数标签。
- 可能机制:速度偏差使快客户端更新占比过高。
- 可观察结果:更新占比、陈旧度、平均/最差群体精度和墙钟时间。
- 验证指标:最差群体精度差、达到目标精度时间、通信量和方差。
