GPU 调度与优化

共 18 题
#

1. GPU Time-Slicing 在 K8s(NVIDIA GPU Operator)的工程价值

A Time-Slicing 提供硬隔离
B 时间片共享 GPU 提升利用率,但无显存与性能隔离 ✓ 正确答案
C Time-Slicing 无法提升利用率
D Time-Slicing 与 MIG 效果相同
#

2. K8s 中 GPU 的 Device Plugin 机制与显存分配(整卡/分片/MIG)如何实现?

A Device Plugin 不涉及资源上报
B Device Plugin 上报 GPU 资源,整卡/分片/MIG 分别靠独占、虚拟化与硬件切分 ✓ 正确答案
C MIG 是软件切分
D 分片提供硬隔离
#

3. MIG(Multi-Instance GPU)在 A100/H100 的工程价值

A MIG 是软件共享
B MIG 无隔离性
C MIG 提供硬件级隔离与灵活切分,让多任务共享大卡且互不干扰 ✓ 正确答案
D MIG 只适用于小模型
#

4. MPS(Multi-Process Service)在多进程共享 GPU 的工程价值

A MPS 让多 CUDA 进程共享 GPU 提升利用率,但隔离性弱 ✓ 正确答案
B MPS 提供硬隔离
C MPS 无法提升利用率
D MPS 与 MIG 等价
#

5. Run:ai、Kubernetes GPU Operator 的对比

A 两者功能相同
B Run:ai 是底层驱动
C GPU Operator 已含高级调度
D GPU Operator 提供基础 GPU 使能,Run:ai 提供高级调度与多租户治理 ✓ 正确答案
#

6. vGPU、GPU Sharing 在 K8s 的工程价值

A GPU Sharing 提供硬隔离
B vGPU 只能整卡使用
C 把 GPU 容量按需切分给多任务,提升利用率、降低小任务门槛 ✓ 正确答案
D GPU Sharing 无法提升利用率
#

7. 多 GPU 通信库(NCCL、GLOO、RCCL)在 NVLink、Infinity Fabric 与 RoCE 网络上的差异与选型

A 所有库性能相同
B GLOO 性能最优
C RCCL 用于 NVIDIA
D NCCL 适配 NVIDIA 与 NVLink/IB/RoCE,RCCL 适配 AMD,GLOO 通用但性能弱 ✓ 正确答案
#

8. AI 集群的 RDMA(RoCE v2、InfiniBand)网络调优

A RoCE 需配置 PFC/ECN/DCQCN,IB 天然无损,调优重 MTU 与 NUMA 亲和 ✓ 正确答案
B RoCE 无需拥塞控制
C IB 配置最复杂
D 网络与训练性能无关
#

9. CUDA 延迟优化技术中 CUDA Graph、stream 优先级与 cudaMallocAsync 在推理服务中的收益与代价

A CUDA Graph 对推理无收益
B stream 优先级无意义
C CUDA Graph 减少启动开销、stream 优先级保关键计算、cudaMallocAsync 提分配效率 ✓ 正确答案
D cudaMallocAsync 增加同步开销
#

10. GPU 存储层次的延迟梯度中寄存器、共享内存、L1/L2 缓存与 HBM 显存的带宽与延迟差异及其对推理算子优化的意义

A HBM 带宽不是瓶颈
B 存储层次仅影响延迟不影响吞吐
C 用共享内存/寄存器做数据复用,减少 HBM 访问,HBM 带宽是主要瓶颈 ✓ 正确答案
D 无需考虑数据局部性
#

11. GPU 故障的检测、隔离与自动重启机制如何设计?

A 故障 GPU 无需隔离
B DCGM 检测故障→标记不可调度隔离→自动重启重调度 ✓ 正确答案
C 不用区分可纠正与不可纠正错误
D 检测只能人工
#

12. GPU 硬件加速单元的使用中 Tensor Core、RT Core 与稀疏计算单元在推理/训练中的卸载策略

A Tensor Core 与 AI 无关
B Tensor Core 加速矩阵乘是 AI 核心,稀疏单元加速稀疏模型,RT Core 用于图形 ✓ 正确答案
C RT Core 用于 AI 推理
D 稀疏化无收益
#

13. GPU 编程生态对比中 CUDA、ROCm、SYCL 与 OpenCL 在抽象层次、生态成熟度与迁移成本上的差异

A 所有生态性能相同
B CUDA 可移植到所有 GPU
C OpenCL 生态最成熟
D CUDA 性能生态最优但绑定 NVIDIA,SYCL/OpenCL 可移植但性能弱 ✓ 正确答案
#

14. GPU 资源分割方案对比中 MIG、MPS 与 Time-Slicing 在隔离性、性能与调度上的差异

A MIG 隔离最强、MPS 软件共享、Time-Slicing 时间片,隔离性 MIG>MPS>Time-Slicing ✓ 正确答案
B MIG 无性能保证
C Time-Slicing 隔离最强
D 三方案隔离性相同
#

15. Ray、Kubeflow 在分布式 AI 训练的工程价值

A 两者功能完全相同
B Ray 是灵活分布式计算框架,Kubeflow 是 K8s 原生 ML 平台与工作流编排 ✓ 正确答案
C Kubeflow 不做工作流
D Ray 只做推理
#

16. 大模型推理的 GPU 利用率如何度量与优化(batch、KV Cache、并发)?

A batch 越大越好,无显存约束
B 增大 batch 与并发填满 GPU,用 KV cache 优化放大可承载并发 ✓ 正确答案
C 利用率与 KV cache 无关
D 并发必然降低性能
#

17. DeepSpeed、Megatron、FSDP 在分布式训练的工程价值

A 三者功能完全相同
B Megatron 只做优化器分片
C FSDP 原生易用、DeepSpeed 提供 ZeRO 优化、Megatron 做张量/流水线并行 ✓ 正确答案
D FSDP 无法分布式训练
#

18. 异构 GPU(A100/H100/国产)混部调度与任务优先级如何设计?

A 所有 GPU 性能相同
B 异构无需区分
C 优先级无意义
D 用标签区分 GPU 类型按需匹配,优先级队列与配额保障关键任务 ✓ 正确答案