AI 基础设施

共 17 题
📑 题目列表 17 题
#
★★★

1. AI 基础设施的分层设计中算力、存储与网络如何按训练/推理负载分别规划

AI 基础设施的分层设计中,算力、存储与网络如何按训练/推理负载分别规划?

  • 算力规划
  • 存储规划
  • 网络规划

分层规划:算力——训练负载需高算力、大显存、多卡集群(H100/A100 集群、分布式训练),推理负载需低延迟、高吞吐、弹性(可整卡/分片/MIG);存储——训练需高速缓存(检查点、数据)、大容量数据集湖,推理需模型仓库与 KV cache 缓存;网络——训练需高带宽 RDMA(InfiniBand/RoCE,多卡通信),推理需低延迟网络(请求转发)。按负载特性分别规划:训练重带宽/算力,推理重延迟/弹性。

训练与推理负载特征差异大——训练写密集、算力/带宽密集,推理延迟敏感、弹性要求高。规划要"按负载建池":训练池(大卡、RDMA、高速存储)、推理池(弹性、低延迟、模型缓存)。避免资源浪费与性能错配。

#
★★

2. AI 基础设施的层次中 GPU 集群、调度(K8s + 设备插件)、存储(模型/数据)与网络(RDMA)如何协同?

AI 基础设施的层次:GPU 集群、调度(K8s + 设备插件)、存储、网络(RDMA)如何协同?

  • 各层次职责
  • 协同机制
  • 整体架构

协同架构:GPU 集群(算力底座)→ 调度层(K8s + GPU Device Plugin/nvidia-device-plugin,把 GPU 资源调度给任务)→ 存储层(模型/数据存储,供训练/推理拉取)→ 网络层(RDMA 提供卡间/节点间高速通信)。协同:调度器把训练任务调度到有 GPU 的节点,任务从存储加载数据/模型,跨节点用 RDMA 通信。设备插件上报 GPU 资源,调度器分配;存储用高性能文件系统(GPFS/共享存储)支撑训练;网络用 NCCL over RDMA 支撑分布式训练。

协同核心是"调度分配算力 + 存储供数据 + 网络保通信"。各层配合保障训练/推理性能。运维上要保证设备插件识别 GPU、存储带宽够、RDMA 连通,缺一不可。整体是"算力-调度-存储-网络"的垂直打通。

#
★★

3. Argo Workflows + AI 在 AI Pipeline 的工程价值

Argo Workflows + AI 在 AI Pipeline 中的工程价值是什么?

  • Argo Workflows 功能
  • AI Pipeline 应用
  • 价值

Argo Workflows 是 K8s 原生的工作流引擎,用 DAG 定义步骤,K8s 原生、支持 GPU 资源、可复现、并行、重试。AI Pipeline 价值:编排训练/推理/数据管道(数据准备→训练→评测→部署),K8s 调度 GPU,步骤并行与重试,可复现与可观测。价值:把 AI 多步骤流程自动化、可复现、可扩展,与 K8s 生态无缝集成。适用:训练管道、数据管道、评测流水线。

Argo Workflows 的价值是"K8s 原生 + DAG 编排 + GPU 支持",适合 AI 管道自动化。比脚本更可复现、比 Airflow 更 K8s 原生。运维上用它编排 AI 流水线,与 K8s 资源调度结合。

#
★★

4. GPU 调度与共享中显存隔离、MIG/时间片、Binpack/Spread 策略与抢占(preemption)如何配置?

GPU 调度与共享中,显存隔离、MIG/时间片、Binpack/Spread 策略与抢占如何配置?

  • 显存隔离与共享
  • 调度策略
  • 抢占配置

配置:显存隔离——整卡/分片(MIG 硬隔离、vGPU 软隔离);共享——MIG(硬件切分)、时间片(Time-Slicing 软共享);调度策略——Binpack(紧凑放置,提升利用率,适合同规格)、Spread(分散放置,提升容错,适合避免单点);抢占(preemption)——高优先级任务抢占低优先级任务的 GPU,配置优先级与抢占策略(如允许抢占、队列)。运维上按负载需求配置隔离与调度策略,抢占用于保障关键任务。

配置要点是"隔离保安全、共享提利用、策略按需求、抢占保关键"。Binpack/Spread 权衡利用率与容错。抢占需谨慎(可能打断任务)。运维上按负载类型(隔离需求、优先级)配置。

#
★★

5. K8s + AI Cost Optimization(Spot、Reserved)的工程价值

K8s + AI 成本优化(Spot、Reserved)的工程价值是什么?

  • Spot/Reserved 在 AI 应用
  • 成本优化
  • 权衡

K8s + AI 成本优化:Reserved/Savings Plans——覆盖稳定、长期运行的训练/推理负载(如常驻推理、稳定训练),显著降成本;Spot——用于可中断、可重跑的批处理/训练任务(checkpoint 可恢复),低成本。工程价值:结合负载特性选择计费——稳定负载用 Reserved、弹性批处理用 Spot,降低 AI 算力成本。权衡:Spot 需中断容忍(checkpoint/重放),Reserved 需预测稳定负载。K8s 用节点池/优先级/调度策略落地。

AI 成本优化核心是"按负载特性匹配计费"。训练/推理都有稳定与弹性部分,混合用 Reserved + Spot。Spot 中断需 checkpoint 支撑。价值是数倍成本降。运维上建立负载画像,按画像选择计费策略。

#
★★

6. K8s + Multi-Region AI 的 DR 工程价值

K8s + Multi-Region AI 的 DR(灾备)工程价值是什么?

  • 多区域部署
  • DR 设计
  • 价值

Multi-Region AI DR:把 AI 服务/训练部署到多个区域,实现故障容灾、就近接入、数据冗余。价值:可用性——单区故障时故障切换,服务不中断;就近——模型推理就近降低延迟;数据冗余——模型/数据跨区备份。DR 设计:多区集群、流量切换(DNS/网关)、数据同步(跨区复制)、模型权重多区存储、故障演练。权衡:数据跨境合规、成本增加、一致性。价值是"高可用 + 低延迟 + 数据安全"。

Multi-Region DR 的价值是容灾与就近。需处理数据合规与复杂度。运维上做故障切换演练、数据跨区同步、多区负载均衡。成本与一致性是权衡点。

#
★★

7. KServe、Seldon Core、BentoML 在 K8s 的 Model Serving

KServe、Seldon Core、BentoML 在 K8s 上的 Model Serving 有什么差异?

  • 三者定位
  • 功能差异
  • 选型

KServe 是 K8s 原生的模型推理平台(Kubeflow 系),提供 Serverless 推理(scale from zero)、InferenceGraph 路由、多框架、自动扩缩,与 K8s 深度集成;Seldon Core 是 K8s 的模型部署平台,提供多框架、自定义服务、监控、解释、A/B,成熟稳定;BentoML 是模型打包/部署框架,把模型打包成 Bento 部署到 K8s,简化部署。差异:KServe 强 Serverless/路由,Seldon 强多框架/监控/解释,BentoML 强打包部署。选型:需 Serverless 用 KServe,需多框架完善用 Seldon,需简化打包用 BentoML。

三者都是 K8s Model Serving,侧重不同。KServe 是主流(Serverless + 路由),Seldon 功能全,BentoML 简化部署。运维上按需求量与生态选型,KServe 与 Seldon 都可配合 vLLM 等推理引擎。

#
★★

8. Knative + AI 在 Serverless AI 推理的工程价值

Knative + AI 在 Serverless AI 推理中的工程价值是什么?

  • Knative 功能
  • Serverless AI 推理
  • 价值

Knative 提供 Serverless 能力(scale from zero、自动扩缩、事件驱动、按需启动),用于 AI 推理:流量低时缩到零,流量高时快速拉起,实现按需付费、弹性推理。价值:节省成本——空闲时零资源;弹性——应对突发流量;简化——免管理常驻实例。权衡:冷启动(模型加载+预热)延迟,需预热/最小实例策略。KServe 基于 Knative 实现 Serverless inference。价值是"按需、弹性、省钱"的推理服务。

Serverless AI 的价值是"按需弹性、降低成本",但冷启动是挑战(模型加载慢)。需用最小实例、预热、冷启动优化。运维上适合低峰/突发型推理,用 scale-from-zero 与预热结合。

#
★★

9. NVIDIA GPU Operator + K8s 在 AI 集群的工程价值

NVIDIA GPU Operator + K8s 在 AI 集群中的工程价值是什么?

  • GPU Operator 功能
  • 工程价值
  • 部署

NVIDIA GPU Operator 自动化部署和管理 K8s 节点的 GPU 组件:驱动、Fabric Manager、Device Plugin、MIG、Time-Slicing、DCGM 监控、健康检查。工程价值:自动化——免手动装驱动/插件,声明式管理;标准化——统一 GPU 组件的运维;能力——MIG/Time-Slicing 共享、DCGM 监控、GPU 健康检查(故障检测)。价值:简化 GPU 集群运维,让 K8s 高效调度与监控 GPU。部署:用 Helm 安装,Operator 自动管理节点 GPU 组件。

GPU Operator 的价值是"把 GPU 组件运维自动化与标准化",是 AI 集群 K8s 化的底座。运维上用它统一驱动/插件/监控,减少人工操作。是 GPU 进 K8s 的标准方案。

#

10. AI 基础设施排障中驱动/CUDA 版本不匹配、显存 OOM 与 ECC 错误的定位方法

AI 基础设施排障中,驱动/CUDA 版本不匹配、显存 OOM 与 ECC 错误的定位方法是什么?

  • 版本不匹配定位
  • 显存 OOM 定位
  • ECC 错误定位

定位方法:驱动/CUDA 不匹配——检查 nvidia-smi、CUDA 版本、容器内 driver 与 cuda 库版本,报错(版本不兼容、库找不到)时核对驱动≥CUDA 要求、升级驱动或重装 CUDA;显存 OOM——看 cudaErrorMemoryAllocation、显存占用,用 nvidia-smi 查显存,定位是模型大/并发高/泄漏,调 batch/量化/增加显存;ECC 错误——用 nvidia-smi/DCGM 查 ECC 计数,可纠正错误增多预示显存退化,不可纠正错误导致计算错误,需隔离/更换 GPU。定位统一靠"日志 + nvidia-smi/DCGM + 版本核对"。

三类问题定位:版本用"核对驱动/库/容器",OOM 用"显存占用+报错",ECC 用"硬件健康指标"。运维上建立排障命令集与监控,快速定位。ECC 是硬件问题需换卡。

#

11. AI 基础设施的弹性中突发训练/推理任务如何扩缩容以及冷启动与模型预热如何优化?

AI 基础设施的弹性:突发训练/推理任务如何扩缩容?冷启动与模型预热如何优化?

  • 扩缩容机制
  • 冷启动优化
  • 模型预热

弹性扩缩容:推理用 HPA/KPA 基于队列/吞吐/GPU 利用率扩缩副本,训练用节点池/队列调度突发任务。冷启动优化:模型预热——启动时预加载权重+预热请求触发 CUDA graph;最小实例——保留常驻副本避免缩到零;共享模型存储——本地缓存/页缓存加速加载;镜像预加载。冷启动与扩缩矛盾:缩容多则冷启动多,用"最小实例+预热"平衡。突发任务用突发队列/预留容量。

弹性核心是"按需扩缩 + 冷启动可控"。冷启动是弹性最大障碍,用预热/最小实例/缓存优化。运维上监控扩缩容与冷启动时间,平衡成本与延迟。突发任务预置容量。

#

12. AI 基础设施监控中 GPU 温度/功耗、NVLink 带宽与利用率如何纳入统一监控

AI 基础设施监控中,GPU 温度/功耗、NVLink 带宽与利用率如何纳入统一监控?

  • 硬件指标
  • 统一监控
  • 告警

纳入统一监控:用 DCGM exporter 采集 GPU 温度、功耗、NVLink 带宽/利用率、显存、SM 利用率,接入 Prometheus;与 K8s 资源、任务指标统一到监控平台。告警:温度过热(降频风险)、功耗异常、NVLink 带宽异常(通信瓶颈)、利用率低(浪费)。统一监控让硬件指标与任务/资源指标关联,定位性能瓶颈(如 NVLink 带宽不足导致训练慢)。横向看板展示 GPU 健康与利用率。

硬件指标是 AI 性能/故障的底层信号。DCGM 采集、Prometheus 接入、统一看板。温度/NVLink 反映健康与通信瓶颈,利用率反映资源效率。运维上把硬件与任务指标关联定位。

#

13. AI 存储的分层中数据集湖、检查点高速存储与模型仓库的容量与性能如何规划

AI 存储的分层:数据集湖、检查点高速存储与模型仓库的容量与性能如何规划?

  • 存储分层
  • 容量与性能规划
  • 选型

存储分层:数据集湖(大规模、低成本、容量大,如对象存储,存原始数据,吞吐中等);检查点高速存储(高吞吐、低延迟,如并行文件系统/SSD,存训练 checkpoint,需快速读写);模型仓库(模型权重,容量中等、需高并发读取,如对象存储/共享存储)。规划:数据集湖按 GB-PB 级、低成本;检查点存储按训练规模、高带宽(IO 是训练瓶颈);模型仓库按模型数量、读取延迟。按访问频率/性能分层,冷热分离。

AI 存储分层核心是"按数据特性匹配性能与成本"。数据集湖大而便宜、检查点快而贵、模型仓读取快。训练性能瓶颈常在存储(IO)。运维上按访问模式分层,冷热分离,控制成本并保性能。

#

14. AI 集群网络选型中 InfiniBand 与 RoCE 的带宽、拥塞控制与运维复杂度对比

AI 集群网络选型:InfiniBand 与 RoCE 的带宽、拥塞控制与运维复杂度对比是什么?

  • 两种网络差异
  • 拥塞控制
  • 运维复杂度

InfiniBand(IB):高带宽、原生无损(硬件拥塞控制)、低延迟,但成本高、封闭生态;RoCE(RoCE v2):基于以太网、相对便宜、可扩展,但需软件配置拥塞控制(PFC/ECN/DCQCN)实现无损,延迟略高、运维复杂。对比:带宽 IB 略优、拥塞控制 IB 原生、RoCE 需调优;运维复杂度 IB 简单(硬件)、RoCE 复杂(配置)。选型:追求极致性能且预算足用 IB,成本敏感/生态开源用 RoCE,需调优。

选型权衡"性能 vs 成本 vs 运维"。IB 性能好但贵、封闭,RoCE 便宜开放但需调拥塞控制。AI 训练网络是瓶颈,需保证无损高带宽。运维上 RoCE 需精细调优(PFC/ECN),IB 简单。

#

15. GPU 调度的关键参数中显存请求、设备插件分配策略与优先级抢占的配置要点

GPU 调度的关键参数:显存请求、设备插件分配策略与优先级抢占的配置要点是什么?

  • 显存请求配置
  • 设备插件分配
  • 优先级抢占

配置要点:显存请求——用 resources.limits 的 nvidia.com/gpu 请求卡数,分片场景用显存请求(如 vGPU 显存大小);设备插件分配策略——配置 Device Plugin 的资源类型(整卡/MIG/时间片之分)、调度策略(按需分配);优先级抢占——配置 PriorityClass 与抢占策略(高优先级任务可抢占低优先级),用配额保证。要点:显存请求要准确(不超售)、设备插件按共享方式配置、抢占保关键任务但要谨慎。

配置核心是"显存请求准确 + 分配策略合适 + 优先级保障"。显存请求过小 OOM、过大浪费。设备插件决定共享方式。抢占保障关键任务。运维上按负载画像配置,避免超售与浪费。

#

16. KubeRay、Ray on K8s 在分布式 AI 训练的工程价值

KubeRay、Ray on K8s 在分布式 AI 训练中的工程价值是什么?

  • KubeRay 功能
  • Ray on K8s 价值
  • 调度

KubeRay 是 Ray 的 K8s 原生集成,用 Operator 管理 Ray 集群(RayCluster CRD),在 K8s 上调度 Ray 的 head/worker 节点,支持 GPU 资源、自动扩缩、可观测。Ray on K8s 价值:把 Ray 的分布式训练/服务能力与 K8s 的调度/弹性结合——K8s 管理资源,Ray 做分布式计算/训练,支持动态扩缩(Ray 的 autoscaler)、GPU 调度、多租户。工程价值:分布式训练(Ray Train)在 K8s 上可弹性、可扩展、可观测。

KubeRay 的价值是"Ray 的分布式计算 + K8s 的调度弹性"。KubeRay Operator 管理 Ray 集群生命周期,支持动态扩缩 GPU。运维上用它做分布式训练的平台化,弹性扩缩与故障恢复。

#

17. Tekton + AI 在 CI/CD for AI 的工程价值

Tekton + AI 在 CI/CD for AI 中的工程价值是什么?

  • Tekton 功能
  • AI CI/CD
  • 价值

Tekton 是 K8s 原生的 CI/CD 框架,用 Pipeline/Task 定义步骤,K8s 原生、可声明、支持 GPU 资源、可复用。CI/CD for AI 价值:用 Tekton 编排 AI 流水线——数据准备、训练、评测、模型打包、部署,K8s 调度 GPU 训练任务,评测门禁卡在 CI,模型注册/部署在 CD。价值:AI 的 CI/CD 自动化(训练/评测/发布),可复现、可追踪、K8s 原生。适用:ML 训练/评测/部署流水线。

Tekton 的价值是"K8s 原生 CI/CD + GPU 支持",适合 AI 流水线自动化。把训练/评测/部署纳入 CI/CD,评测门禁保证质量。运维上用它做 AI 的持续集成与交付,与 K8s 资源绑定。