1. AI 基础设施的分层设计中算力、存储与网络如何按训练/推理负载分别规划
AI 基础设施的分层设计中,算力、存储与网络如何按训练/推理负载分别规划?
- 算力规划
- 存储规划
- 网络规划
分层规划:算力——训练负载需高算力、大显存、多卡集群(H100/A100 集群、分布式训练),推理负载需低延迟、高吞吐、弹性(可整卡/分片/MIG);存储——训练需高速缓存(检查点、数据)、大容量数据集湖,推理需模型仓库与 KV cache 缓存;网络——训练需高带宽 RDMA(InfiniBand/RoCE,多卡通信),推理需低延迟网络(请求转发)。按负载特性分别规划:训练重带宽/算力,推理重延迟/弹性。
训练与推理负载特征差异大——训练写密集、算力/带宽密集,推理延迟敏感、弹性要求高。规划要"按负载建池":训练池(大卡、RDMA、高速存储)、推理池(弹性、低延迟、模型缓存)。避免资源浪费与性能错配。