Skip to content

第3章 分布式机器学习基础

原书范围:PDF第68~90页。

本章定位

  • 在全书中的位置:连接第2章的隐私工具与第4~6章的联邦算法,是联邦学习的分布式计算前置知识。
  • 前置知识:梯度下降、随机梯度下降、监督学习、基本分布式系统概念。
  • 后续基础:第4章FedAvg继承数据并行和参数聚合;第5~6章继承隐私保护梯度下降与安全计算。
  • 核心问题:多节点协作学习时,应划分数据、模型还是任务;当节点不完全可信时,又如何保护输入和中间结果?

一句话总结

分布式机器学习用并行计算突破数据、模型和训练时间的单机上限,而联邦学习在此基础上进一步加入数据自治、隐私、Non-IID和不可靠通信约束。

学习目标

  1. 区分面向扩展性和面向隐私保护的DML。
  2. 比较数据并行、模型并行、任务并行及混合并行。
  3. 重建同步与异步参数聚合的流程。
  4. 解释普通DML为什么不能直接等同于联邦学习。
  5. 按隐私、精度和效率分析隐私梯度下降方法。

Mermaid思维导图

一、本章要解决的问题

单机学习主要受两类上限约束:训练数据或模型放不进单机内存,以及串行训练耗时过长。DML通过多个计算节点分担存储和计算解决这些问题;但当节点属于不同机构或用户时,还必须避免从原始数据、梯度和模型中间量中泄露隐私。

原书据此区分两条主线:

  • 面向扩展性的DML:重点是吞吐、容量和训练时间,节点通常由同一方控制。
  • 面向隐私保护的DML:重点是多方数据协作时的机密性,参与方不一定互相信任。

⭐ 核心结论

联邦学习可以看作DML的一种特殊发展,但两者的优化环境不同:普通DML通常可以控制数据分片、节点和网络;联邦学习中的数据分布、参与行为和设备状态来自现实世界,协调方不能任意重排。

二、核心概念与定义

概念准确定义通俗理解与相近概念的区别
分布式机器学习(DML)利用多个计算节点执行机器学习,以改善性能、隐私或可扩展性多台机器共同完成一次学习任务不必然满足数据自治或正式隐私保证
参数服务器保存或协调全局参数,接收工作节点梯度/参数并聚合模型更新的中心账本联邦聚合服务器面对更弱控制和更强威胁模型
数据并行不同节点持有数据分片和同一模型副本,并周期性交换更新模型复制,数据分片不能解决单个完整模型放不进设备的问题
模型并行将一个模型拆分到多个节点,节点依序或并行完成前后向计算数据流过被拆开的模型主要解决模型内存上限,不一定提高吞吐
任务并行并行执行不同操作或任务不同处理器做不同工作划分对象是计算任务,不只是数据或模型
同步训练等待本轮所有指定节点完成后再聚合快节点等慢节点更新一致但受慢节点限制
异步训练节点完成后立即提交,服务器随到随更谁先算完谁先更新吞吐高,但存在陈旧梯度和顺序偏差
面向隐私保护的DML在分布式训练中保护输入、标签、模型、身份等信息不只分开算,还限制各方能看到什么保护范围取决于威胁模型和具体协议

三、核心机制

3.1 参数服务器式数据并行

text
数据集切成互不相交的分片

各工作节点保存同一模型副本

节点用本地分片计算梯度或模型参数

参数服务器同步或异步聚合

服务器更新全局模型并下发
  • 输入:训练数据分片、模型、优化器状态。
  • 角色:工作节点和参数服务器。
  • 节点状态:本地数据分片、模型副本、本地梯度。
  • 交换信息:梯度或模型参数。
  • 输出:聚合后的全局模型。
  • 训练/推理:协作主要发生在训练期;若最终模型完整可部署,推理可单机完成。

图3-1 分布式机器学习系统示例

3.2 同步与异步

服务器等待本轮所有指定工作节点,将同一模型版本计算出的更新聚合。它便于定义一轮训练并减少参数版本差异,但整体速度受最慢节点影响。

维度同步异步
聚合时机收齐本轮更新后更新到达时
参数一致性较强较弱
慢节点影响容易阻塞整轮不阻塞其他节点
主要风险等待和掉线陈旧更新、顺序偏差
联邦场景难点移动客户端慢且不稳定在线率与速度可能和数据分布相关

3.3 并行方式对比

方式划分对象每节点保存什么主要解决关键代价/失效条件
数据并行样本完整模型+数据分片数据规模、吞吐模型必须能装入单节点;聚合通信大
模型并行模型层或参数部分模型模型内存上限节点间激活/梯度通信;流水线空泡
图并行图数据及依赖局部图和状态稀疏图计算分区质量和一致性控制
任务并行操作/任务指定任务状态资源利用率调度和任务依赖复杂
混合/交叉并行多种对象按层/阶段组合同时扩展数据和模型配置空间大,通信模式复杂

3.4 面向隐私保护的梯度下降

text
参与方保留本地输入

计算本地梯度或中间结果

明文、稀疏、扰动或加密后交换

协调方/多方协议完成聚合

各方更新整体模型或本地模型分片
方法交换信息主要收益主要代价隐私强度
朴素联邦/明文平均明文梯度或参数高效率、无额外近似梯度泄露只避免直接上传原始数据
代数方法利用欠定方程隐藏输入计算较轻依赖维度和背景知识假设无统一的强密码学保证
稀疏/压缩更新明文更新子集减少通信精度损失,非零位置仍泄露原书指出正式分析较少
模糊处理加噪或映射后的数据/梯度可改善隐私,DP可量化精度损失、会计要求取决于机制;不能一概而论
HE/MPC密文或秘密份额隐藏输入和中间量计算、通信和协议成本取决于攻击者及串谋阈值

⚡ 隐私边界

稀疏化、压缩或“不传原始数据”不自动构成正式隐私保证。明文梯度的一个子集仍可能泄露样本信息;安全聚合隐藏单个更新,也不能限制最终模型对个体信息的泄露。

四、关键公式

4.1 数据划分

对任意两个参与方数据集,令表示特征空间,表示样本ID空间。

横向划分满足:

纵向划分满足:

  • 横向划分相当于增加样本数量,适合数据并行和第4章HFL。
  • 纵向划分相当于增加特征数量,需要跨方计算分裂统计量、点积或梯度,通向第5章VFL。
  • 实际系统中“相等”常指任务所需空间已对齐,并非所有字段或样本绝对相同。

4.2 参数聚合的抽象形式

第3章用参数服务器示意聚合梯度或参数,没有规定统一目标函数。可将机制抽象为:

其中是工作节点数,是第个节点的更新,是全局参数,是学习率。

  • 优化目标:合并各数据分片产生的训练信号。
  • 算法对应:节点本地计算,服务器执行Aggregate,再更新
  • 参数影响:同步频率增大通常减少参数漂移,但通信和等待增加。
  • Aggregate是否加权、鲁棒或安全,决定了它能否适配联邦场景;这些内容在第4章展开。

五、关键假设

假设类型具体假设假设不成立时的后果
数据假设扩展性DML可由控制方合理分片,通常近似IID局部更新方向差异大,简单平均可能不稳定
系统假设计算节点和高速网络由同一组织管理广域网、掉线和慢节点使同步训练低效
模型假设数据并行时完整模型能装入每个节点必须采用模型并行或压缩
信任假设普通参数服务器常被视为可信明文梯度和参数可被服务器分析
攻击者假设隐私协议需规定半诚实/恶意和串谋数超出腐败阈值后,理论保证不成立

六、代价与权衡

维度收益代价或风险
模型效果利用更多数据和算力异步陈旧更新或非IID会损害收敛
本地计算多节点并行缩短墙钟时间资源利用受依赖和慢节点影响
通信成本周期聚合实现协同模型、梯度、激活或密文传输昂贵
存储成本分散存储突破单机容量模型副本、优化器和协议状态重复
隐私保证HE/MPC/DP可保护特定对象密文计算、噪声和隐私会计带来成本
安全与鲁棒性可组合安全协议隐藏更新后异常检测更困难
客户端公平性分布式训练可覆盖多方快节点或大数据方可能主导结果

七、局限与开放问题

原书明确指出的局限

  • 扩展性DML仍受内存、训练时间和通信限制。
  • 扰动方法需要在隐私与模型性能间权衡。
  • 密码学方法需要在计算/通信复杂度与安全间权衡。
  • 稀疏梯度和压缩更新的隐私正式分析不足。
  • 安全聚合可能因匿名性而更容易遭受投毒。

根据方法假设推导出的局限

  • 以吞吐为目标的异步调度可能让在线率高的群体在统计上被过度代表。
  • 模型并行虽解决显存问题,却会让训练依赖更频繁的跨节点交互。
  • 把分布式训练直接迁移到跨机构环境,会遗漏身份认证、审计、利益冲突和退出机制。

2020年后仍值得研究的问题

  • 大模型的张量、流水线、专家与数据并行如何和联邦数据自治结合;
  • 安全聚合下的恶意更新检测;
  • 异步和部分参与条件下的隐私会计;
  • 系统异构、统计异构和群体公平的联合调度;
  • 可信执行环境、MPC和HE的混合协议。

八、图示回查

原书图PDF页码应记住的关系
图3-170数据分片位于工作节点,梯度或参数在参数服务器聚合

第3章其余结构主要通过文字分类展开;决策树和隐私梯度下降的具体算法在引用文献及后续章节中延伸。

九、章节关系

text
第2章隐私工具

第3章DML计算与隐私坐标系
  ├─ 数据并行 + 本地SGD + 参数聚合 → 第4章FedAvg
  ├─ 纵向划分 + 安全点积/梯度 → 第5章VFL
  └─ 分布式表征 + 安全计算 → 第6章FTL

十、闭卷回忆问题

  1. 面向扩展性DML与面向隐私保护DML的目标分别是什么?
  2. 数据并行和模型并行分别解决什么上限?
  3. 同步与异步参数更新的主要失效条件是什么?
  4. 为什么明文梯度平均只有低级别隐私保护?
  5. 稀疏更新为什么不能被直接当作隐私机制?
  6. HE/MPC与差分隐私分别牺牲什么来换取什么?
  7. 普通DML迁移到联邦环境时新增了哪些假设?
🔍 参考答案
  1. 前者解决数据、模型和训练时间的规模问题;后者限制分布式计算中的信息泄露。
  2. 数据并行扩展数据和吞吐,但每个节点需容纳完整模型;模型并行把过大的模型拆到多个节点。
  3. 同步受慢节点和掉线阻塞;异步受陈旧更新、更新顺序和快节点偏差影响。
  4. 原始数据虽不上传,但梯度仍携带样本和模型信息。
  5. 它只减少或变换可见更新,没有给出攻击者区分相邻数据集的正式上界。
  6. HE/MPC主要以计算和通信换机密性;DP以噪声和效用损失换可量化的个体影响界限。
  7. 数据自治、Non-IID、部分参与、不可靠网络、不完全信任、审计和激励等。

从教材到科研

现有方法隐含了哪些假设?

  • 同步等待时间与客户端数据分布无关。
  • 参数服务器能够正确聚合且不会滥用明文更新。
  • 数据或模型的划分边界相对稳定。
  • 压缩带来的误差对各客户端影响相近。

怎样构造让这些假设失效的实验?

  • 让少数类客户端同时拥有更慢网络,比较同步和异步训练的群体性能;
  • 逐步增加梯度陈旧度,测收敛轮数和最终误差;
  • 联合改变数据Non-IID程度、模型大小和带宽;
  • 对同一更新依次应用明文、压缩、DP和安全聚合,测泄露与效用;
  • 在安全聚合中加入恶意客户端,比较隐私与异常检测能力。

可以提出哪些可证伪的研究问题?

对异步数据并行方法,当客户端速度与标签分布相关时,陈旧度加权能否在不增加相同墙钟时间下损失的前提下,缩小最差群体与平均群体的精度差?

  • 现有方法:随到随更的异步SGD。
  • 失效条件:慢客户端集中持有少数标签。
  • 可能机制:速度偏差使快客户端更新占比过高。
  • 可观察结果:更新占比、陈旧度、平均/最差群体精度和墙钟时间。
  • 验证指标:最差群体精度差、达到目标精度时间、通信量和方差。