1. 数据并行(Data Parallel, DP)、模型并行(Tensor/Pipeline Parallel, TP/PP)、专家并行(Expert Parallel, EP)的工程取舍?
请说明数据并行(DP)、模型并行(Tensor/Pipeline Parallel, TP/PP)、专家并行(Expert Parallel, EP)的工程取舍?
- 理解各并行策略的原理
- 掌握各策略的通信与显存特征
- 理解组合使用与取舍
数据并行(DP)把数据分到各设备,每设备有完整模型副本,梯度 All-Reduce 同步,通信量随模型大小增长,适合显存够用、模型不大时;模型并行把模型切分:张量并行(TP)把一层的权重矩阵切到多设备,计算前需通信,适合单节点内(NVLink);流水线并行(PP)把层按顺序分配到多设备,按阶段流水执行,通信量小但存在 bubble。专家并行(EP)用于 MoE 模型,把 expert 分配到不同设备,token 通过 all-to-all 路由到 expert,通信量较大但显存高效。取舍:DP 通信简单但显存受限;TP 适合不可切分的层内并行但通信频繁;PP 节省显存但需填 bubble;EP 适合 MoE 但通信开销高。实际大模型常组合使用(如 DP+TP+PP 的 3D 并行),根据显存、通信拓扑与集群规模权衡。
各并行策略的本质是"切什么":DP 切数据、TP 切层内权重、PP 切层、EP 切 expert。取舍看显存、通信带宽与扩展性,大模型用组合并行在各维度平衡。