# 1. GPU 与 CPU 的架构差异,SIMT(Single Instruction Multiple Thread)模型如何为高吞吐并行设计? A 同一 warp 内的线程共享指令流,但各自拥有独立的寄存器与状态 ✓ 正确答案 B 每个线程拥有独立的指令流,可执行完全不同的指令 C SIMT 与 SIMD 完全相同,没有调度上的区别 D GPU 的核心设计目标是最小化单线程延迟
# 2. GPU 内存层次中 Global Memory、Shared Memory、Register、L1/L2 Cache 的容量与延迟,如何为 LLM 推理优化内存访问? A 寄存器容量最大,Global Memory 速度最快 B 全局内存访问总能命中 L1 缓存,无需优化 C Shared Memory 的延迟接近寄存器,但容量远小于 Global Memory ✓ 正确答案 D 所有内存层次访问延迟相同
# 3. NVIDIA Hopper(H100/H200)与 Blackwell(B100/B200)架构核心,Transformer Engine、FP8 Tensor Core、NVLink Switch 系统有哪些创新点? A NVLink Switch 只能用于单卡内部 B NVLink Switch 与 InfiniBand 完全等价 C NVLink Switch 将多卡互联从点到点拓扑升级为交换机拓扑,提升带宽与扩展性 ✓ 正确答案 D NVLink Switch 只提升计算精度,不影响通信
# 4. Warp 与调度模型,Warp Size、Occupancy、Warp Divergence 如何影响核函数性能,为什么 SIMT 下的分支发散会造成吞吐损失? A 分支发散会让 GPU 并行执行所有分支,不损失性能 B Warp size 越大,发散代价越小 C 分支发散只影响 CPU,不影响 GPU D 同一 warp 内出现分支发散时各路径被串行执行并屏蔽不相关线程,导致吞吐损失 ✓ 正确答案
# 5. Shared Memory 与 Bank Conflict,GPU 共享内存的 bank 组织方式,bank 冲突如何用 padding 或调整访问模式规避? A 所有线程访问同一 bank 时不会冲突 B 增大共享内存容量即可消除 bank conflict C 同周期内多个线程访问同一 bank 的不同地址会串行化,造成吞吐损失 ✓ 正确答案 D bank conflict 只影响全局内存,不影响共享内存
# 6. CUDA kernel launch 的开销组成,为什么小 kernel 频繁启动会受限于 launch overhead,CUDA Graphs 如何批量提交并降低开销? A CUDA Graphs 会增大每次 kernel launch 的开销 B CUDA Graphs 只能用于 CPU 端计算 C CUDA Graphs 通过捕获并回放整个计算图,减少逐次 launch 的开销 ✓ 正确答案 D CUDA Graphs 无法减少启动延迟
# 7. AMD MI300/MI325 与 NVIDIA 的竞争,ROCm 与 CUDA 生态的差距及项目(PyTorch native support)进展如何? A ROCm 与 CUDA 完全等价,无任何差异 B AMD 没有任何 PyTorch 支持 C ROCm 生态在工具链、算子库成熟度上总体落后于 CUDA,但通过 HIP 兼容层和 PyTorch 原生支持在加速追赶 ✓ 正确答案 D ROCm 只支持 AMD CPU,不支持 GPU
# 8. 国产 GPU(寒武纪、燧原、摩尔线程、天数智芯、华为昇腾)的工程现状与软件栈成熟度? A 国产 GPU 软件栈已与 CUDA 完全对齐 B 国产 GPU 只能用于推理,不能用于训练 C 华为昇腾没有任何 PyTorch 适配 D 国产 GPU 硬件部分场景可用,但软件栈在算子覆盖、通信库、编译器成熟度上普遍弱于 CUDA,生态建设是规模化关键 ✓ 正确答案
# 9. Roof-line 模型,如何判断一个 GPU kernel 是 memory-bound 还是 compute-bound,算力与 HBM 带宽的比值如何指导优化方向? A 当算术强度低于 ridge point 时,kernel 是 compute-bound B 当算术强度低于 ridge point 时,kernel 是 memory-bound,优化应侧重减少访存量 ✓ 正确答案 C 算术强度与瓶颈类型无关 D 所有 kernel 都是 compute-bound
# 10. 矩阵乘的优化路线,从 Naive 到 Shared Memory Tiling 再到 Tensor Core(WMMA/MMA),各阶段分别优化了什么瓶颈? A Naive 实现的主要瓶颈是寄存器不足 B 各阶段优化目标完全相同 C Tensor Core 只优化访存,不提升算力 D 共享内存 tiling 通过减少全局内存访问次数来缓解带宽瓶颈 ✓ 正确答案
# 11. GPU 虚拟化与共享,MIG、vGPU 与 K8s 设备插件的隔离粒度差异,在推理服务中如何选择共享与隔离策略? A MIG 是软件级隔离,vGPU 是硬件级隔离 B MIG 在硬件层面划分独立 GPU 实例,隔离性强于基于时间分片的共享 ✓ 正确答案 C vGPU 与 MIG 隔离粒度完全相同 D 设备插件只能独占 GPU,不能共享
# 12. 统一内存(unified/managed memory)的页迁移机制,GPU 与 CPU 访问时页面如何迁移,与显式 cudaMemcpy 如何取舍? A 显式 cudaMemcpy 比统一内存更易用 B 统一内存永远不会发生页迁移 C 统一内存由 CPU 与 GPU 共享物理页,按需迁移,但频繁跨设备访问会因缺页产生开销 ✓ 正确答案 D 统一内存与显式拷贝在性能上完全等价
# 13. 树形归约(tree reduction)kernel 中 __syncthreads 的作用,为什么跨 block 归约必须分两阶段,漏掉同步会怎样? A __syncthreads 可以同步不同 block 的线程 B 树形归约中 __syncthreads 保证 block 内线程同步,漏掉会导致共享内存数据竞争 ✓ 正确答案 C 跨 block 归约只需一个阶段即可完成 D __syncthreads 只影响寄存器,不影响共享内存
# 14. GPU CUDA ROCm SYCL interoperability 的 SIMT 执行模型与 CPU SIMD 在分支发散上的根本差异? A SIMT 与 SIMD 在分支处理上完全相同 B GPU SIMT 在 warp 发散时串行执行各路径并屏蔽不相关线程,而 CPU SIMD 有分支预测缓冲,代价更小 ✓ 正确答案 C CPU SIMD 没有分支概念 D GPU 有强大的分支预测器处理发散
# 15. GPU CUDA ROCm SYCL interoperability 的存储层次(Register → Shared → L1 → L2 → DRAM → HBM)在 AI 推理中的延迟梯度? A 寄存器与共享内存延迟显著低于 L2 与 HBM,AI 推理优化应尽量把热数据放在片上低延迟层 ✓ 正确答案 B HBM 延迟最低,寄存器延迟最高 C 所有存储层次延迟相同 D L1 缓存延迟高于 HBM
# 16. GPU CUDA ROCm SYCL interoperability 的 CUDA、ROCm、SYCL、OpenCL 在软件栈上的等价抽象与生态对比? A CUDA 生态最成熟但绑定 NVIDIA,SYCL 强调跨厂商可移植,ROCm 绑定 AMD ✓ 正确答案 B 四者生态完全等价 C OpenCL 性能优化能力与 CUDA 相同 D SYCL 只能用于 NVIDIA
# 17. TPU(Google)与 Trainium(AWS)的非 NVIDIA 加速路线,在 LLM 训练与推理中的位置如何? A TPU 采用脉动阵列架构,通过 XLA 编译栈优化矩阵运算,主要服务 Google 生态 ✓ 正确答案 B TPU 与 Trainium 完全兼容 CUDA C Trainium 只用于推理,不用于训练 D 非 NVIDIA 路线拥有比 CUDA 更完备的通用算子生态
# 18. FlashAttention 的 tiling 为什么能减少 HBM 读写,与 GPU 片上 SRAM 容量和分块大小的关系如何? A 分块大小与 SRAM 容量无关 B tiling 增加了 HBM 读写量 C tiling 把 Attention 的 HBM 读写从 O(N²) 降到 O(N),块大小受片上 SRAM 容量约束 ✓ 正确答案 D FlashAttention 仍需要把整个 S 矩阵写回 HBM
# 19. 多卡通信拓扑,NVLink/NVSwitch/InfiniBand 对 All-Reduce 带宽与训练/推理扩展性的影响,通信占比如何估算? A NVLink 只用于跨节点,不用于机内 B NVSwitch 提供机内全互联高带宽,InfiniBand 用于跨节点,通信占比越高扩展性越差 ✓ 正确答案 C 通信占比与扩展性无关 D InfiniBand 带宽恒高于 NVLink
# 20. GPU 的 Grid/Block/Thread 并行层次与 warp 调度如何组织? A Block 被分派到 SM 执行,warp 是硬件调度与执行的最小单位 ✓ 正确答案 B warp 是软件层面的组织,与硬件无关 C 跨 block 可直接同步,无需额外机制 D Grid 是硬件执行单位
# 21. GPU 内存层级中全局/共享/寄存器内存与带宽的关系? A 共享内存容量大于全局内存 B 全局内存带宽最低 C 寄存器带宽最高但容量最小,全局内存带宽最大但延迟最高,高频数据应尽量放寄存器/共享内存 ✓ 正确答案 D 寄存器与全局内存带宽相同
# 22. GPU CUDA ROCm SYCL interoperability 在光线追踪、矩阵运算(Tensor Core)、稀疏计算上的硬件卸载策略? A Tensor Core 只能用于光线追踪 B Tensor Core 通过 WMMA/MMA 指令卸载矩阵乘,RT Core 卸载光线追踪,各专用单元与通用核心并行 ✓ 正确答案 C 稀疏单元无法跳过零元素 D 所有计算都必须由通用核心完成
# 23. GPU CUDA ROCm SYCL interoperability 的 cudaGraph、stream priority、cudaMallocAsync 在推理中的延迟优化? A stream priority 会增大 launch 开销 B cudaGraph 减少 launch 开销,stream priority 保证关键 kernel 优先,cudaMallocAsync 消除分配阻塞 ✓ 正确答案 C cudaMallocAsync 是同步内存分配 D cudaGraph 无法批量回放 kernel
# 24. GPU CUDA ROCm SYCL interoperability 在 MIG(Multi-Instance GPU)、MPS、Time-Slicing 上的资源分割能力? A MIG 无法隔离内存 B MPS 提供硬件级隔离 C Time-Slicing 隔离性最强 D MIG 提供硬件级隔离,MPS 与 Time-Slicing 提高利用率但隔离性较弱 ✓ 正确答案