WebNN 端侧推理

共 17 题
#

1. ONNX Runtime Web 的 InferenceSession.create() 与 executionProvider(WebNN/WebGPU/WebGL/WebCPU)回退链设计

A ORT Web 只能使用一个固定 executionProvider,无法切换
B InferenceSession.create() 可配置 executionProviders 列表按优先级回退,如 WebGPU→WebGL→WebCPU ✓ 正确答案
C WebCPU 永远性能最佳,应作为首选
D executionProvider 列表与硬件能力无关
#

2. WebNN 推理的数值精度与量化误差验证,INT8 量化误差评估、与 CPU/FP32 基准对比的容差阈值与回归测试?

A 需以 FP32/CPU 基准对比评估 INT8 量化误差,设定容差阈值并建立回归测试 ✓ 正确答案
B 容差阈值只需给定任意值即可,无需校准
C 量化误差与任务无关,无需分类评估
D INT8 量化不会引入任何精度损失
#

3. WebNN API 的 navigator.ml.createContext() 与 MLGraphBuilder 在跨设备(CPU/NPU/GPU)推理的工程取舍

A createContext() 创建设备上下文、MLGraphBuilder 构建计算图,需跨设备择优并回退 ✓ 正确答案
B MLGraphBuilder 与设备选择无关
C 所有设备都支持相同算子集
D navigator.ml.createContext() 只能创建 CPU 上下文
#

4. WebNN 的 matmul/concat/conv2d/gelu 算子覆盖与 ONNX 模型转换中的算子兼容性排查

A 所有 ONNX 算子都能在 WebNN 上原样运行
B WebNN 算子覆盖因设备而异,ONNX 转换需排查算子兼容性并在不支持时回退 ✓ 正确答案
C matmul/concat 等算子在所有设备上必然全部支持
D 算子兼容性无需排查,转换一定成功
#

5. ORT Web 的 ort.env.wasm 配置(numThreads、simd、proxy)在端侧推理性能调优的工程实践

A ort.env.wasm 通过 numThreads/simd/proxy 配置 WASM 后端,多线程需 COOP/COEP 与 SharedArrayBuffer ✓ 正确答案
B ort.env.wasm 的 numThreads 与 simd 互不相干,可随意设置
C 启用多线程无需任何安全头配置
D proxy 配置与主线程阻塞无关
#

6. WebNN 的 MLTensor(实验性 API)替代 MLOperand 的现代 API 演进与跨版本适配

A MLTensor 与 MLOperand 完全等价,无任何区别
B 跨版本适配无需特性检测
C 实验性 API 一旦发布永不变更
D MLTensor 是实验性 API,通过管理实际张量数据演进,需用适配层与特性检测应对版本变化 ✓ 正确答案
#

7. 端侧模型加载的渐进式策略,分片 ONNX、量化(INT8/INT4)与首次推理冷启动优化

A 分片加载与量化可压缩端侧模型体积,配合预热与预编译优化首次推理冷启动 ✓ 正确答案
B 冷启动时间无法优化
C 量化总能无损提升精度
D 分片加载与量化互斥,不能同时使用
#

8. ORT Web 的 IO Binding 与 WebGPU 零拷贝推理在图像/视频模型中的性能收益

A 零拷贝推理与 WebGPU 无关
B IO Binding 与 WebGPU 零拷贝会显著增加推理开销
C IO Binding 配合 WebGPU 零拷贝可避免重复分配与 CPU-GPU 搬运,提升图像/视频推理吞吐 ✓ 正确答案
D 图像/视频推理无需优化数据搬运
#

9. WebNN 与 WebGPU Compute 在同模型推理任务下的功耗与热节流(thermal throttling)对比

A WebNN 面向推理可利用 NPU 等硬件加速,通常比 WebGPU Compute 更省电,需关注热节流影响 ✓ 正确答案
B WebNN 与 WebGPU Compute 的功耗完全一致
C 热节流会提升推理性能
D 端侧推理无需考虑功耗
#

10. WebNN 的硬件加速,NPU/GPU 的算子映射?

A WebNN 通过后端把算子映射到 NPU/GPU 执行,不支持的算子回退到 CPU/GPU 通用实现 ✓ 正确答案
B WebNN 只能在 CPU 上运行,不支持 NPU/GPU
C NPU 与 GPU 的算子映射完全相同
D 算子映射与硬件能力无关
#

11. 端侧模型完整性校验(hash 校验 model buffer)与防篡改的工程机制

A 端侧模型无需任何完整性校验
B 哈希校验一定能防止所有模型替换攻击
C 通过 hash 校验 model buffer 可发现下载损坏或篡改,拒绝加载不完整模型 ✓ 正确答案
D 校验失败后仍应正常加载模型
#

12. 端侧推理的模型格式,ONNX 与量化?

A 量化总是能提升模型精度
B 量化后模型体积必然变大
C 端侧只能用一种格式,不能转换
D ONNX 是通用端侧模型格式,量化(INT8/INT4)可减小体积与加速,但需权衡精度损失 ✓ 正确答案
#

13. WebNN vs WebGPU,推理与渲染的边界?

A WebGPU 只用于渲染,不能做推理
B WebGPU 是通用计算 API 可灵活实现推理,WebNN 面向推理并可利用 NPU,按设备与算子需求选择 ✓ 正确答案
C WebNN 与 WebGPU 功能完全相同,可互换
D WebNN 无法在浏览器中运行
#

14. 端侧推理的隐私与性能权衡?

A 端侧推理性能永远优于云端
B 端侧推理隐私强但能力受限,云端能力强但需上传数据,应按敏感度与质量要求权衡 ✓ 正确答案
C 云端推理数据不出设备,隐私更佳
D 隐私与性能是二选一,无法兼顾
#

15. WebNN 的算子支持与回退,WebGL 模拟?

A WebNN 支持所有设备的所有算子,无需回退
B WebGL 模拟性能与精度优于原生 WebNN
C 回退链只能包含 CPU 一种
D WebNN 算子支持因设备而异,可用 WebGL 模拟等回退路径保证兼容性 ✓ 正确答案
#

16. WebNN 与模型分片,大模型端侧部署?

A 模型分片可降低端侧内存占用,配合 WebNN 算子加速与量化实现大模型端侧部署 ✓ 正确答案
B 分片会增大模型总体积
C 大模型权重可整模型常驻端侧内存,无需分片
D 端侧无法运行任何大模型
#

17. WebNN 的批处理推理,batch 维度、固定 shape 与动态 shape 的算子支持,以及批大小对端侧吞吐的影响?

A WebNN 完全不支持动态 shape
B 增大 batch 必然降低吞吐
C 批大小影响吞吐与延迟,需在吞吐、延迟与内存间权衡,固定 shape 通常更利于优化 ✓ 正确答案
D batch 维度对推理性能无影响