推理服务化与加速

共 20 题
#

1. vLLM 的 PagedAttention 与连续批处理(continuous batching)原理与运维收益?

A PagedAttention 本质是每次推理前为整个请求预留连续大块显存
B 连续批处理在 token 粒度动态调度请求,减少了静态批处理带来的头部阻塞 ✓ 正确答案
C PagedAttention 只能提升显存利用率,无法提升吞吐
D 连续批处理要求所有请求必须使用相同上下文长度
#

2. 多模型多版本共存的推理网关(如路由/灰度的流量切分)?

A 灰度切分只能按请求权重进行,无法按用户维度
B 多版本共存必须为每个模型申请独立域名
C 网关负责把逻辑请求路由到对应模型版本后端,从而实现版本与流量解耦 ✓ 正确答案
D 网关无法记录模型版本信息用于 trace
#

3. 大模型推理的显存组成(权重/KV cache/激活)如何调优 batch 与并发?

A 权重显存随 batch 增大而线性增长
B 激活内存在整个推理生命周期内固定不变
C 增加 batch 只会增加吞吐,不会增加显存压力
D KV cache 随 batch 与上下文长度线性增长,是调优 batch 的关键约束 ✓ 正确答案
#

4. TGI 与 vLLM 在部署、吞吐、显存管理上的差异与选型?

A TGI 的 PagedAttention 显存复用优于 vLLM
B 两者都由 NVIDIA 官方维护
C vLLM 以 PagedAttention 为核心,在吞吐与显存利用率上通常更优 ✓ 正确答案
D TGI 不支持连续批处理
#

5. 大模型推理的上下文长度(context)上限导致的 OOM 如何防护?

A 只需在引擎内设置 max-model-len 即可完全防护
B 应结合网关侧 token 准入控制与引擎侧长度上限、并发控制多层防护 ✓ 正确答案
C 上下文超限只影响显存,不影响并发
D OOM 后引擎自动恢复即可,无需提前告警
#

6. 推理服务化的分层架构中模型服务、推理网关与请求队列的职责与瓶颈如何设计

A 请求队列引入后必然增加链路延迟,应一律避免
B 队列主要用于提升模型服务吞吐,与削峰无关
C 网关应承担模型推理计算以提升吞吐
D 网关、队列、模型服务职责分离,便于定位瓶颈与独立扩缩 ✓ 正确答案
#

7. 推理服务多副本下的 KV cache 一致性(会话亲和)如何保证?

A KV cache 天然跨副本共享,无需处理会话一致
B 会话亲和可保证同一会话请求固定路由到同一副本,从而命中 KV cache ✓ 正确答案
C 会话亲和会提升负载均衡的灵活性
D 外部化上下文会增加 KV cache 命中率
#

8. 推理服务如何做动态批处理以提升 GPU 利用率而不增加延迟?

A 动态批处理必须牺牲延迟才能提升吞吐
B 动态批处理与 GPU 利用率无关
C 静态批处理比动态批处理延迟更低
D 动态批处理在 token 粒度动态调度请求,避免静态批处理的头部阻塞 ✓ 正确答案
#

9. 推理服务的自动扩缩(基于队列长度/吞吐)与冷启动如何设计?

A 模型权重加载与图编译不构成冷启动延迟
B 应基于队列长度与 GPU 利用率扩容,而非单纯 CPU ✓ 正确答案
C 缩容应尽可能激进以节省成本
D 冷启动无法通过预热优化
#

10. 量化(INT8/FP8/AWQ)对推理质量与延迟的影响如何运维验证?

A 量化一定提升质量,无需评估
B AWQ 量化不会引入任何精度损失
C 量化只影响显存,不影响延迟
D 需用离线评测集对比量化前后质量,并压测验证延迟与吞吐收益 ✓ 正确答案
#

11. 前缀缓存(Prefix Caching)与提示词复用中如何缓存公共系统提示/文档前缀的 KV 以及命中率对成本与延迟的收益如何评估?

A 前缀缓存只减少 decode 阶段计算
B 前缀缓存复用公共前缀的 KV,可显著降低 prefill 计算与 TTFT ✓ 正确答案
C 前缀命中率与成本收益无关
D 前缀缓存需要为每个用户单独建缓存,无法共享
#

12. 推理服务的预热(warmup)与冷启动中模型权重加载与图编译(CUDA graph)对首请求延迟的影响及如何提前预热?

A 冷启动主要来自权重加载与 CUDA graph 编译,可通过预热请求规避 ✓ 正确答案
B 预热只影响吞吐,不影响首请求延迟
C 就绪探针通过即代表无冷启动
D 权重加载是瞬时完成,不构成冷启动
#

13. 多租户配额与并发隔离中不同业务线的 QPS 配额、优先级队列与降级如何在同一推理集群上实现?

A 降级意味着丢弃所有租户请求
B 只需设置 QPS 配额即可完全隔离,无需优先级
C 配额、优先级与降级三层结合,可防止坏邻居拖垮其他租户 ✓ 正确答案
D 多租户隔离与成本分摊无关
#

14. GPU 显存碎片与多模型共存中显存碎片化如何产生以及如何用按需加载、显存预留与模型调度降低碎片影响?

A 显存碎片只影响速度,不影响容量
B 多模型共存不需要考虑显存碎片
C 按需加载会降低显存碎片
D 显存碎片来自频繁的分配/释放,PagedAttention 与内存池可缓解 ✓ 正确答案
#

15. 推理加速手段对比中量化、动态批处理与投机解码(speculative decoding)的收益与代价

A 量化不会带来任何精度损失
B 投机解码必然降低延迟
C 三种手段互斥,不能组合使用
D 动态批处理解决 GPU 利用率瓶颈,投机解码解决单请求延迟瓶颈 ✓ 正确答案
#

16. 推理服务版本与灰度中模型版本、引擎版本与提示词版本的解耦发布如何实现

A 三者必须同时发布以保持一致
B 提示词版本无需管理
C 三者是独立发布单元,可分别灰度与回滚 ✓ 正确答案
D 引擎版本升级不影响模型行为
#

17. 推理服务的健康检查如何反应“能生成但不准确”的亚健康?

A 传统健康检查无法反映质量,需用质量探针与黄金样本集辅助 ✓ 正确答案
B 存活探针已能反映生成质量
C 质量探针零成本,可高频率全量运行
D 亚健康只能靠人工发现
#

18. 推理服务高可用中多副本负载均衡、GPU 故障检测与请求重试如何设计

A 重试应无限次进行以保证成功
B 单副本即可满足高可用
C GPU 故障无需检测,进程会自动恢复
D 多副本负载均衡、GPU 故障检测隔离与受限重试共同保障高可用 ✓ 正确答案
#

19. 推理监控指标中 TTFT、TPOT、吞吐、GPU 利用率与 token 计费的采集与告警

A TTFT/TPOT 反映延迟,GPU 利用率与 token 计费反映资源与成本 ✓ 正确答案
B GPU 利用率无法通过工具采集
C TTFT 反映的是生成全部 token 的时间
D token 计费与 GPU 利用率无关
#

20. 推理引擎的图优化与算子融合中 CUDA graph、连续批处理的算子融合对延迟与吞吐的影响及如何验证收益?

A CUDA graph 对长序列无任何收益
B 算子融合会增加延迟
C 动态 shape 与 CUDA graph 完全兼容
D CUDA graph 减少内核启动开销,算子融合减少内存往返,均提升吞吐与稳定性 ✓ 正确答案