GPU 架构与计算模型

共 24 题
#

1. GPU 与 CPU 的架构差异,SIMT(Single Instruction Multiple Thread)模型如何为高吞吐并行设计?

A 同一 warp 内的线程共享指令流,但各自拥有独立的寄存器与状态 ✓ 正确答案
B 每个线程拥有独立的指令流,可执行完全不同的指令
C SIMT 与 SIMD 完全相同,没有调度上的区别
D GPU 的核心设计目标是最小化单线程延迟
#

2. GPU 内存层次中 Global Memory、Shared Memory、Register、L1/L2 Cache 的容量与延迟,如何为 LLM 推理优化内存访问?

A 寄存器容量最大,Global Memory 速度最快
B 全局内存访问总能命中 L1 缓存,无需优化
C Shared Memory 的延迟接近寄存器,但容量远小于 Global Memory ✓ 正确答案
D 所有内存层次访问延迟相同
#

3. NVIDIA Hopper(H100/H200)与 Blackwell(B100/B200)架构核心,Transformer Engine、FP8 Tensor Core、NVLink Switch 系统有哪些创新点?

A NVLink Switch 只能用于单卡内部
B NVLink Switch 与 InfiniBand 完全等价
C NVLink Switch 将多卡互联从点到点拓扑升级为交换机拓扑,提升带宽与扩展性 ✓ 正确答案
D NVLink Switch 只提升计算精度,不影响通信
#

4. Warp 与调度模型,Warp Size、Occupancy、Warp Divergence 如何影响核函数性能,为什么 SIMT 下的分支发散会造成吞吐损失?

A 分支发散会让 GPU 并行执行所有分支,不损失性能
B Warp size 越大,发散代价越小
C 分支发散只影响 CPU,不影响 GPU
D 同一 warp 内出现分支发散时各路径被串行执行并屏蔽不相关线程,导致吞吐损失 ✓ 正确答案
#

5. Shared Memory 与 Bank Conflict,GPU 共享内存的 bank 组织方式,bank 冲突如何用 padding 或调整访问模式规避?

A 所有线程访问同一 bank 时不会冲突
B 增大共享内存容量即可消除 bank conflict
C 同周期内多个线程访问同一 bank 的不同地址会串行化,造成吞吐损失 ✓ 正确答案
D bank conflict 只影响全局内存,不影响共享内存
#

6. CUDA kernel launch 的开销组成,为什么小 kernel 频繁启动会受限于 launch overhead,CUDA Graphs 如何批量提交并降低开销?

A CUDA Graphs 会增大每次 kernel launch 的开销
B CUDA Graphs 只能用于 CPU 端计算
C CUDA Graphs 通过捕获并回放整个计算图,减少逐次 launch 的开销 ✓ 正确答案
D CUDA Graphs 无法减少启动延迟
#

7. AMD MI300/MI325 与 NVIDIA 的竞争,ROCm 与 CUDA 生态的差距及项目(PyTorch native support)进展如何?

A ROCm 与 CUDA 完全等价,无任何差异
B AMD 没有任何 PyTorch 支持
C ROCm 生态在工具链、算子库成熟度上总体落后于 CUDA,但通过 HIP 兼容层和 PyTorch 原生支持在加速追赶 ✓ 正确答案
D ROCm 只支持 AMD CPU,不支持 GPU
#

8. 国产 GPU(寒武纪、燧原、摩尔线程、天数智芯、华为昇腾)的工程现状与软件栈成熟度?

A 国产 GPU 软件栈已与 CUDA 完全对齐
B 国产 GPU 只能用于推理,不能用于训练
C 华为昇腾没有任何 PyTorch 适配
D 国产 GPU 硬件部分场景可用,但软件栈在算子覆盖、通信库、编译器成熟度上普遍弱于 CUDA,生态建设是规模化关键 ✓ 正确答案
#

9. Roof-line 模型,如何判断一个 GPU kernel 是 memory-bound 还是 compute-bound,算力与 HBM 带宽的比值如何指导优化方向?

A 当算术强度低于 ridge point 时,kernel 是 compute-bound
B 当算术强度低于 ridge point 时,kernel 是 memory-bound,优化应侧重减少访存量 ✓ 正确答案
C 算术强度与瓶颈类型无关
D 所有 kernel 都是 compute-bound
#

10. 矩阵乘的优化路线,从 Naive 到 Shared Memory Tiling 再到 Tensor Core(WMMA/MMA),各阶段分别优化了什么瓶颈?

A Naive 实现的主要瓶颈是寄存器不足
B 各阶段优化目标完全相同
C Tensor Core 只优化访存,不提升算力
D 共享内存 tiling 通过减少全局内存访问次数来缓解带宽瓶颈 ✓ 正确答案
#

11. GPU 虚拟化与共享,MIG、vGPU 与 K8s 设备插件的隔离粒度差异,在推理服务中如何选择共享与隔离策略?

A MIG 是软件级隔离,vGPU 是硬件级隔离
B MIG 在硬件层面划分独立 GPU 实例,隔离性强于基于时间分片的共享 ✓ 正确答案
C vGPU 与 MIG 隔离粒度完全相同
D 设备插件只能独占 GPU,不能共享
#

12. 统一内存(unified/managed memory)的页迁移机制,GPU 与 CPU 访问时页面如何迁移,与显式 cudaMemcpy 如何取舍?

A 显式 cudaMemcpy 比统一内存更易用
B 统一内存永远不会发生页迁移
C 统一内存由 CPU 与 GPU 共享物理页,按需迁移,但频繁跨设备访问会因缺页产生开销 ✓ 正确答案
D 统一内存与显式拷贝在性能上完全等价
#

13. 树形归约(tree reduction)kernel 中 __syncthreads 的作用,为什么跨 block 归约必须分两阶段,漏掉同步会怎样?

A __syncthreads 可以同步不同 block 的线程
B 树形归约中 __syncthreads 保证 block 内线程同步,漏掉会导致共享内存数据竞争 ✓ 正确答案
C 跨 block 归约只需一个阶段即可完成
D __syncthreads 只影响寄存器,不影响共享内存
#

14. GPU CUDA ROCm SYCL interoperability 的 SIMT 执行模型与 CPU SIMD 在分支发散上的根本差异?

A SIMT 与 SIMD 在分支处理上完全相同
B GPU SIMT 在 warp 发散时串行执行各路径并屏蔽不相关线程,而 CPU SIMD 有分支预测缓冲,代价更小 ✓ 正确答案
C CPU SIMD 没有分支概念
D GPU 有强大的分支预测器处理发散
#

15. GPU CUDA ROCm SYCL interoperability 的存储层次(Register → Shared → L1 → L2 → DRAM → HBM)在 AI 推理中的延迟梯度?

A 寄存器与共享内存延迟显著低于 L2 与 HBM,AI 推理优化应尽量把热数据放在片上低延迟层 ✓ 正确答案
B HBM 延迟最低,寄存器延迟最高
C 所有存储层次延迟相同
D L1 缓存延迟高于 HBM
#

16. GPU CUDA ROCm SYCL interoperability 的 CUDA、ROCm、SYCL、OpenCL 在软件栈上的等价抽象与生态对比?

A CUDA 生态最成熟但绑定 NVIDIA,SYCL 强调跨厂商可移植,ROCm 绑定 AMD ✓ 正确答案
B 四者生态完全等价
C OpenCL 性能优化能力与 CUDA 相同
D SYCL 只能用于 NVIDIA
#

17. TPU(Google)与 Trainium(AWS)的非 NVIDIA 加速路线,在 LLM 训练与推理中的位置如何?

A TPU 采用脉动阵列架构,通过 XLA 编译栈优化矩阵运算,主要服务 Google 生态 ✓ 正确答案
B TPU 与 Trainium 完全兼容 CUDA
C Trainium 只用于推理,不用于训练
D 非 NVIDIA 路线拥有比 CUDA 更完备的通用算子生态
#

18. FlashAttention 的 tiling 为什么能减少 HBM 读写,与 GPU 片上 SRAM 容量和分块大小的关系如何?

A 分块大小与 SRAM 容量无关
B tiling 增加了 HBM 读写量
C tiling 把 Attention 的 HBM 读写从 O(N²) 降到 O(N),块大小受片上 SRAM 容量约束 ✓ 正确答案
D FlashAttention 仍需要把整个 S 矩阵写回 HBM
#

19. 多卡通信拓扑,NVLink/NVSwitch/InfiniBand 对 All-Reduce 带宽与训练/推理扩展性的影响,通信占比如何估算?

A NVLink 只用于跨节点,不用于机内
B NVSwitch 提供机内全互联高带宽,InfiniBand 用于跨节点,通信占比越高扩展性越差 ✓ 正确答案
C 通信占比与扩展性无关
D InfiniBand 带宽恒高于 NVLink
#

20. GPU 的 Grid/Block/Thread 并行层次与 warp 调度如何组织?

A Block 被分派到 SM 执行,warp 是硬件调度与执行的最小单位 ✓ 正确答案
B warp 是软件层面的组织,与硬件无关
C 跨 block 可直接同步,无需额外机制
D Grid 是硬件执行单位
#

21. GPU 内存层级中全局/共享/寄存器内存与带宽的关系?

A 共享内存容量大于全局内存
B 全局内存带宽最低
C 寄存器带宽最高但容量最小,全局内存带宽最大但延迟最高,高频数据应尽量放寄存器/共享内存 ✓ 正确答案
D 寄存器与全局内存带宽相同
#

22. GPU CUDA ROCm SYCL interoperability 在光线追踪、矩阵运算(Tensor Core)、稀疏计算上的硬件卸载策略?

A Tensor Core 只能用于光线追踪
B Tensor Core 通过 WMMA/MMA 指令卸载矩阵乘,RT Core 卸载光线追踪,各专用单元与通用核心并行 ✓ 正确答案
C 稀疏单元无法跳过零元素
D 所有计算都必须由通用核心完成
#

23. GPU CUDA ROCm SYCL interoperability 的 cudaGraph、stream priority、cudaMallocAsync 在推理中的延迟优化?

A stream priority 会增大 launch 开销
B cudaGraph 减少 launch 开销,stream priority 保证关键 kernel 优先,cudaMallocAsync 消除分配阻塞 ✓ 正确答案
C cudaMallocAsync 是同步内存分配
D cudaGraph 无法批量回放 kernel
#

24. GPU CUDA ROCm SYCL interoperability 在 MIG(Multi-Instance GPU)、MPS、Time-Slicing 上的资源分割能力?

A MIG 无法隔离内存
B MPS 提供硬件级隔离
C Time-Slicing 隔离性最强
D MIG 提供硬件级隔离,MPS 与 Time-Slicing 提高利用率但隔离性较弱 ✓ 正确答案