# 1. AI 基础设施的分层设计中算力、存储与网络如何按训练/推理负载分别规划 A 训练与推理负载相同 B 训练重算力/带宽/RDMA,推理重延迟/弹性,按负载分别建池 ✓ 正确答案 C 推理需要 RDMA 高带宽 D 存储规划与负载无关
# 2. AI 基础设施的层次中 GPU 集群、调度(K8s + 设备插件)、存储(模型/数据)与网络(RDMA)如何协同? A 调度分配 GPU、存储供数据、RDMA 保通信,四层垂直打通 ✓ 正确答案 B 各层独立运行 C 存储与训练无关 D 网络只影响推理
# 3. Argo Workflows + AI 在 AI Pipeline 的工程价值 A 只能做简单脚本 B 不支持 GPU C K8s 原生 DAG 编排 AI 步骤,支持 GPU 调度与可复现 ✓ 正确答案 D 无法并行重试
# 4. GPU 调度与共享中显存隔离、MIG/时间片、Binpack/Spread 策略与抢占(preemption)如何配置? A MIG/时间片做隔离/共享,Binpack/Spread 权衡利用率与容错,抢占保关键任务 ✓ 正确答案 B 抢占无需配置 C 显存无需隔离 D 只有一种调度策略
# 5. K8s + AI Cost Optimization(Spot、Reserved)的工程价值 A 全用 Spot B 稳定负载用 Reserved、可中断批处理用 Spot,按负载特性匹配计费 ✓ 正确答案 C 全用 Reserved D 计费策略与负载无关
# 7. KServe、Seldon Core、BentoML 在 K8s 的 Model Serving A 三者功能相同 B KServe 不支持 scale from zero C BentoML 是 Serverless 平台 D KServe 强 Serverless 路由、Seldon 强多框架监控、BentoML 简化打包 ✓ 正确答案
# 9. NVIDIA GPU Operator + K8s 在 AI 集群的工程价值 A 自动化部署驱动/插件/MIG/监控等 GPU 组件,标准化 GPU 集群运维 ✓ 正确答案 B 只安装驱动 C 不支持 MIG D 无健康检查
# 10. AI 基础设施排障中驱动/CUDA 版本不匹配、显存 OOM 与 ECC 错误的定位方法 A 版本不匹配核对驱动/CUDA,OOM 查显存占用,ECC 查硬件健康 ✓ 正确答案 B 三类问题同一原因 C ECC 错误无需处理 D OOM 无需查显存
# 11. AI 基础设施的弹性中突发训练/推理任务如何扩缩容以及冷启动与模型预热如何优化? A 冷启动无法优化 B 无需最小实例 C 突发任务无需容量 D 按队列/吞吐扩缩容,用预热/最小实例/缓存优化冷启动 ✓ 正确答案
# 12. AI 基础设施监控中 GPU 温度/功耗、NVLink 带宽与利用率如何纳入统一监控 A 硬件指标无需监控 B NVLink 带宽不影响训练 C DCGM 采集温度/功耗/NVLink/利用率,与任务指标关联定位 ✓ 正确答案 D 温度不影响性能
# 13. AI 存储的分层中数据集湖、检查点高速存储与模型仓库的容量与性能如何规划 A 存储分层与成本无关 B 所有数据用同一存储 C 检查点存储无需高带宽 D 数据集湖低成本大容量、检查点存储高带宽、模型仓库快读,按访问分层 ✓ 正确答案
# 14. AI 集群网络选型中 InfiniBand 与 RoCE 的带宽、拥塞控制与运维复杂度对比 A IB 原生无损高性能但贵,RoCE 便宜开放但需调拥塞控制 ✓ 正确答案 B RoCE 无需拥塞控制 C IB 运维最复杂 D 带宽完全相同
# 15. GPU 调度的关键参数中显存请求、设备插件分配策略与优先级抢占的配置要点 A 显存请求可随意 B 抢占无需配置 C 显存请求准确、设备插件按共享方式配置、优先级抢占保关键任务 ✓ 正确答案 D 设备插件与调度无关
# 16. KubeRay、Ray on K8s 在分布式 AI 训练的工程价值 A Ray 与 K8s 无关 B KubeRay 不支持 GPU C KubeRay 用 Operator 在 K8s 管理 Ray 集群,支持 GPU 调度与弹性扩缩 ✓ 正确答案 D 无法自动扩缩
# 17. Tekton + AI 在 CI/CD for AI 的工程价值 A Tekton 用 K8s 原生流水线编排训练/评测/部署,支持 GPU 与门禁 ✓ 正确答案 B Tekton 只做代码 CI C 不支持 GPU 任务 D 无法做评测门禁