# 1. vLLM 的 PagedAttention 与连续批处理(continuous batching)原理与运维收益? A PagedAttention 本质是每次推理前为整个请求预留连续大块显存 B 连续批处理在 token 粒度动态调度请求,减少了静态批处理带来的头部阻塞 ✓ 正确答案 C PagedAttention 只能提升显存利用率,无法提升吞吐 D 连续批处理要求所有请求必须使用相同上下文长度
# 2. 多模型多版本共存的推理网关(如路由/灰度的流量切分)? A 灰度切分只能按请求权重进行,无法按用户维度 B 多版本共存必须为每个模型申请独立域名 C 网关负责把逻辑请求路由到对应模型版本后端,从而实现版本与流量解耦 ✓ 正确答案 D 网关无法记录模型版本信息用于 trace
# 3. 大模型推理的显存组成(权重/KV cache/激活)如何调优 batch 与并发? A 权重显存随 batch 增大而线性增长 B 激活内存在整个推理生命周期内固定不变 C 增加 batch 只会增加吞吐,不会增加显存压力 D KV cache 随 batch 与上下文长度线性增长,是调优 batch 的关键约束 ✓ 正确答案
# 4. TGI 与 vLLM 在部署、吞吐、显存管理上的差异与选型? A TGI 的 PagedAttention 显存复用优于 vLLM B 两者都由 NVIDIA 官方维护 C vLLM 以 PagedAttention 为核心,在吞吐与显存利用率上通常更优 ✓ 正确答案 D TGI 不支持连续批处理
# 5. 大模型推理的上下文长度(context)上限导致的 OOM 如何防护? A 只需在引擎内设置 max-model-len 即可完全防护 B 应结合网关侧 token 准入控制与引擎侧长度上限、并发控制多层防护 ✓ 正确答案 C 上下文超限只影响显存,不影响并发 D OOM 后引擎自动恢复即可,无需提前告警
# 6. 推理服务化的分层架构中模型服务、推理网关与请求队列的职责与瓶颈如何设计 A 请求队列引入后必然增加链路延迟,应一律避免 B 队列主要用于提升模型服务吞吐,与削峰无关 C 网关应承担模型推理计算以提升吞吐 D 网关、队列、模型服务职责分离,便于定位瓶颈与独立扩缩 ✓ 正确答案
# 7. 推理服务多副本下的 KV cache 一致性(会话亲和)如何保证? A KV cache 天然跨副本共享,无需处理会话一致 B 会话亲和可保证同一会话请求固定路由到同一副本,从而命中 KV cache ✓ 正确答案 C 会话亲和会提升负载均衡的灵活性 D 外部化上下文会增加 KV cache 命中率
# 8. 推理服务如何做动态批处理以提升 GPU 利用率而不增加延迟? A 动态批处理必须牺牲延迟才能提升吞吐 B 动态批处理与 GPU 利用率无关 C 静态批处理比动态批处理延迟更低 D 动态批处理在 token 粒度动态调度请求,避免静态批处理的头部阻塞 ✓ 正确答案
# 9. 推理服务的自动扩缩(基于队列长度/吞吐)与冷启动如何设计? A 模型权重加载与图编译不构成冷启动延迟 B 应基于队列长度与 GPU 利用率扩容,而非单纯 CPU ✓ 正确答案 C 缩容应尽可能激进以节省成本 D 冷启动无法通过预热优化
# 10. 量化(INT8/FP8/AWQ)对推理质量与延迟的影响如何运维验证? A 量化一定提升质量,无需评估 B AWQ 量化不会引入任何精度损失 C 量化只影响显存,不影响延迟 D 需用离线评测集对比量化前后质量,并压测验证延迟与吞吐收益 ✓ 正确答案
# 11. 前缀缓存(Prefix Caching)与提示词复用中如何缓存公共系统提示/文档前缀的 KV 以及命中率对成本与延迟的收益如何评估? A 前缀缓存只减少 decode 阶段计算 B 前缀缓存复用公共前缀的 KV,可显著降低 prefill 计算与 TTFT ✓ 正确答案 C 前缀命中率与成本收益无关 D 前缀缓存需要为每个用户单独建缓存,无法共享
# 12. 推理服务的预热(warmup)与冷启动中模型权重加载与图编译(CUDA graph)对首请求延迟的影响及如何提前预热? A 冷启动主要来自权重加载与 CUDA graph 编译,可通过预热请求规避 ✓ 正确答案 B 预热只影响吞吐,不影响首请求延迟 C 就绪探针通过即代表无冷启动 D 权重加载是瞬时完成,不构成冷启动
# 13. 多租户配额与并发隔离中不同业务线的 QPS 配额、优先级队列与降级如何在同一推理集群上实现? A 降级意味着丢弃所有租户请求 B 只需设置 QPS 配额即可完全隔离,无需优先级 C 配额、优先级与降级三层结合,可防止坏邻居拖垮其他租户 ✓ 正确答案 D 多租户隔离与成本分摊无关
# 14. GPU 显存碎片与多模型共存中显存碎片化如何产生以及如何用按需加载、显存预留与模型调度降低碎片影响? A 显存碎片只影响速度,不影响容量 B 多模型共存不需要考虑显存碎片 C 按需加载会降低显存碎片 D 显存碎片来自频繁的分配/释放,PagedAttention 与内存池可缓解 ✓ 正确答案
# 15. 推理加速手段对比中量化、动态批处理与投机解码(speculative decoding)的收益与代价 A 量化不会带来任何精度损失 B 投机解码必然降低延迟 C 三种手段互斥,不能组合使用 D 动态批处理解决 GPU 利用率瓶颈,投机解码解决单请求延迟瓶颈 ✓ 正确答案
# 16. 推理服务版本与灰度中模型版本、引擎版本与提示词版本的解耦发布如何实现 A 三者必须同时发布以保持一致 B 提示词版本无需管理 C 三者是独立发布单元,可分别灰度与回滚 ✓ 正确答案 D 引擎版本升级不影响模型行为
# 17. 推理服务的健康检查如何反应“能生成但不准确”的亚健康? A 传统健康检查无法反映质量,需用质量探针与黄金样本集辅助 ✓ 正确答案 B 存活探针已能反映生成质量 C 质量探针零成本,可高频率全量运行 D 亚健康只能靠人工发现
# 18. 推理服务高可用中多副本负载均衡、GPU 故障检测与请求重试如何设计 A 重试应无限次进行以保证成功 B 单副本即可满足高可用 C GPU 故障无需检测,进程会自动恢复 D 多副本负载均衡、GPU 故障检测隔离与受限重试共同保障高可用 ✓ 正确答案
# 19. 推理监控指标中 TTFT、TPOT、吞吐、GPU 利用率与 token 计费的采集与告警 A TTFT/TPOT 反映延迟,GPU 利用率与 token 计费反映资源与成本 ✓ 正确答案 B GPU 利用率无法通过工具采集 C TTFT 反映的是生成全部 token 的时间 D token 计费与 GPU 利用率无关
# 20. 推理引擎的图优化与算子融合中 CUDA graph、连续批处理的算子融合对延迟与吞吐的影响及如何验证收益? A CUDA graph 对长序列无任何收益 B 算子融合会增加延迟 C 动态 shape 与 CUDA graph 完全兼容 D CUDA graph 减少内核启动开销,算子融合减少内存往返,均提升吞吐与稳定性 ✓ 正确答案