# 1. WebGPU 作为浏览器端 Transformer 推理的加速后端的优势 A WebGPU 只能用于渲染,不能用于推理 B WebGPU 不支持显存管理 C WebGPU 推理性能与 CPU 完全一致 D WebGPU 通过 Compute Shader 与 GPU 并行加速 Transformer 推理,性能优于 CPU/WebGL ✓ 正确答案
# 2. WebGPU Compute Shader 实现矩阵乘法的 tiling/共享内存优化与推理算子工程价值 A tiling 会增加全局内存访问次数 B 共享内存与带宽优化无关 C tiling 分块把数据载入共享内存复用,减少全局访问,直接提升矩阵乘法等推理算子性能 ✓ 正确答案 D 矩阵乘法无需任何优化
# 3. 在 WebGPU 上布置注意力(attention)计算的并行策略 A attention 计算只能串行执行,无法并行 B 并行策略与 head 维度无关 C attention 的 softmax 无法并行化 D attention 可按 head/batch 并行,并用 tiling 与分块在线 softmax 优化 QK^T、PV 与显存 ✓ 正确答案
# 4. WebGPU 推理的显存(GPUBuffer)管理与大模型权重的分块加载 A GPUBuffer 无需管理,系统自动释放 B 大模型权重必须一次性全部载入显存 C WebGPU 推理需管理 GPUBuffer 生命周期,大模型权重分块加载控制显存峰值并做降级 ✓ 正确答案 D 显存耗尽无需处理
# 5. WebGPU 与 WebNN API 的定位差异与未来走向 A WebGPU 与 WebNN 定位完全相同,是可替代的标准 B WebGPU 是通用计算/渲染 API,WebNN 是面向推理的高层 API,二者互补并趋向融合 ✓ 正确答案 C WebNN 未来会完全取代 WebGPU D WebGPU 与 WebNN 无法在浏览器中共存
# 6. 多设备(集成显卡/独显)下 WebGPU 适配器选择策略 A requestAdapter() 只能返回一个固定 GPU,无法选择 B 集成显卡性能一定优于独显 C 可通过 powerPreference 选择 high-performance 或 low-power 适配器,按性能与功耗需求在多 GPU 下取舍 ✓ 正确答案 D 适配器选择与功耗无关
# 7. WebGPU 推理管线的 BindGroup 设计(模型权重/输入/输出 Buffer 的 binding 策略) A BindGroup 与资源绑定无关,可随意设计 B 权重 buffer 每次推理都必须重建 C BindGroup 布局不影响推理性能 D 推理管线应合理分组绑定权重/输入/输出 buffer,复用权重绑定并动态更新输入,提升效率 ✓ 正确答案
# 8. 模型量化(INT4/INT8)与权重格式转换(GGUF/ONNX 到 WebGPU 可加载格式)在端侧部署的显存与精度权衡 A INT4 量化精度高于 FP32,且无损 B 量化与格式转换需在显存占用与精度间权衡,按任务与显存预算选择位宽并验证精度 ✓ 正确答案 C 量化只影响显存,不影响精度 D GGUF/ONNX 无需转换即可被 WebGPU 直接加载
# 9. WebGPU 推理在低功耗设备的散热与节流问题 A 低功耗设备可无限满负荷推理,不会发热 B 热节流会提升推理速度 C 推理功耗与散热无关 D 持续 WebGPU 推理会触发 thermal throttling,需控制负载、动态降级并选择低功耗策略 ✓ 正确答案
# 10. WebGPU 与 WebGL 推理(TensorFlow.js)的性能对比实测 A WebGL 推理性能必然优于 WebGPU B WebGPU 与 WebGL 推理性能完全相同 C WebGPU 的 Compute Shader 与缓冲管理通常使其推理性能优于 WebGL,应控制变量实测对比 ✓ 正确答案 D 实测无需控制变量,结果稳定
# 11. WGSL 与 GLSL 在编写推理算子时的语法差异与调试工具链(Tint vs GLSLang) A GLSL 比 WGSL 更适合 WebGPU 推理 B WGSL 与 GLSL 语法完全相同,可混用 C WGSL 提供更现代的并行与内存控制,适合推理算子,WebGPU 用 Tint 编译校验 ✓ 正确答案 D Tint 是 GLSL 编译器,GLSLang 是 WGSL 编译器
# 12. WebGPU Compute Pipeline 的 dispatchWorkgroupSize 与 GPU occupancy 调优在端侧推理的工程实践 A workgroup 尺寸越大,occupancy 必然越高 B occupancy 与 workgroup 尺寸完全无关 C Compute Pipeline 无需调优即可达最佳性能 D dispatchWorkgroupSize 与 workgroup 尺寸决定并行度,需结合共享内存与寄存器调优 occupancy ✓ 正确答案
# 13. 浏览器端 LLM 推理框架(llama.cpp WebGPU、WebLLM、Transformer.js)的架构差异与适用场景 A 三个框架完全相同,只是名字不同 B Transformer.js 只能运行 LLM 模型 C WebLLM 不支持 WebGPU D llama.cpp WebGPU 专注 LLM 底层、WebLLM 提供易用 LLM 推理、Transformer.js 面向通用 Transformer 模型,按场景选型 ✓ 正确答案
# 14. 模型权重分片加载与 pipeline 复用对端侧大模型(7B/13B)首 token 延迟的优化 A 首 token 延迟与权重加载、管线初始化无关 B pipeline 复用会增大首 token 延迟 C 7B/13B 模型首 token 延迟无法优化 D 权重分片加载与 pipeline 复用可减少初始化与加载开销,显著降低端侧大模型首 token 延迟 ✓ 正确答案
# 15. WebGPU 计算着色器精度(f16/f32)对推理结果的影响 A f16 与 f32 精度完全相同,可任意替换 B 用 f16 一定提升推理精度 C f16 省显存、更快但可能引入误差,需按算子敏感度混合精度并验证 ✓ 正确答案 D 精度选择对推理结果无影响
# 16. WebGPU 推理的进度反馈与取消机制 A WebGPU 推理应分阶段反馈进度,并用取消机制停止任务、释放 GPU 资源 ✓ 正确答案 B 进度反馈只能显示一条不可变的提示 C 长推理无法取消,只能等待完成 D 取消推理无需管理资源
# 17. CPU-GPU 数据搬运路径,queue.writeBuffer、mapAsync 与 staging buffer 的选择及带宽瓶颈 A 三种搬运路径性能完全相同,随便选 B writeBuffer、mapAsync、staging buffer 各有适用场景,且需减少搬运以缓解带宽瓶颈 ✓ 正确答案 C 带宽瓶颈无法缓解 D mapAsync 适合频繁小批量上传
# 18. 模型权重的持久化缓存与版本更新,Cache API/IndexedDB 的离线可用与增量更新策略 A 模型权重只能存内存,无法持久化 B Cache API/IndexedDB 可持久化模型权重以支持离线,并用版本与增量更新管理缓存 ✓ 正确答案 C 增量更新每次都要全量下载 D 缓存失效无需管理
# 19. WebGPU 推理在 iOS Safari(WebGPU 实验性支持)与 Android Chrome 的兼容性与降级到 WebNN/WebGL 策略 A WebGPU 在所有平台的可用性完全一致 B 降级策略只适用于 Android,不适用于 iOS C 实验性支持的平台无需任何处理 D WebGPU 在 iOS Safari 等平台可能为实验性支持,需能力探测并降级到 WebNN/WebGL/CPU ✓ 正确答案
# 20. 端侧推理的数值回归与基准对齐,与 CPU/WebGL 输出一致性校验及性能基线建立 A 端侧推理结果无需与基准校验 B 需与 CPU/WebGL 基准做输出一致性校验,并建立性能基线进行回归监控 ✓ 正确答案 C 容差阈值可随意设定,无需校准 D 性能基线建立一次即可,无需更新
# 21. WebGPU device lost 事件的处理,重建管线与降级到 CPU/WASM 推理的切换策略 A device lost 无需处理,推理会自动恢复 B 应监听 device lost 事件,重建 device 与管线,失败时降级到 CPU/WASM 推理保证可用 ✓ 正确答案 C 降级策略与 GPU 异常无关 D device lost 后无法做任何恢复