# 1. 模型服务的高可用设计中多副本、优雅停机、健康检查与流量摘除及其与业务服务部署的差异? A 就绪探针失败时应继续把流量路由到该副本,保证一致性 B 优雅停机无需等待在途请求,直接强杀进程即可 C 模型服务启动慢,就绪探针与冷启动预热比业务服务更关键 ✓ 正确答案 D GPU 显存无需释放,进程退出后自动回收
# 2. 模型版本管理与发布中模型仓库(MLflow/自建)、版本不可变性与可回滚性如何保证? A 已发布的模型版本可被直接覆盖更新,以节省存储 B 模型仓库不需要记录模型所用的训练数据与特征版本 C 回滚只需改代码,无需考虑模型版本与部署清单 D 版本不可变性是模型可回滚的前提,元数据与产物需一并固化 ✓ 正确答案
# 3. 模型蓝绿部署、金丝雀、影子流量(Shadow Traffic)三种发布策略的工程实现与效果验证? A 影子流量会把新版本结果返回给用户,用于直接对比 B 影子流量适合一次性全量切换 C 影子流量无需额外推理成本,比金丝雀更省 D 影子流量不把结果返回给用户,用于零风险验证新版本性能与效果 ✓ 正确答案
# 4. 模型 A/B 测试与金丝雀发布中流量分配、效果评估窗口与自动回滚条件如何设计? A A/B 测试无需保证样本一致性,随机即可 B 自动回滚条件应可量化,如新版本显著劣于旧版本或错误率超 SLO 即回滚 ✓ 正确答案 C 评估窗口越短越好,无需考虑统计显著性 D 金丝雀发布可一次性全量切换,无需分级放量
# 5. 模型 A/B 测试框架中流量分配、指标收集(业务 + 模型)与统计显著性检验的工程链路? A 只需收集模型指标,业务指标无关紧要 B 统计显著性检验可忽略多重比较与样本量,直接看均值即可 C 框架应统一采集业务指标与模型指标,并经统计显著性检验指导决策 ✓ 正确答案 D 流量分配无需保证组间一致性,可随机分
# 6. 模型推理的性能指标中首 token 延迟(TTFT)、吞吐(tokens/s)与批处理(continuous batching)如何权衡? A TTFT 指生成单个 token 的耗时,与吞吐无关 B 推理吞吐只取决于模型大小,与批处理无关 C 增大批大小必然降低 TTFT,两者无冲突 D continuous batching 通过动态增删批次请求提升 GPU 利用与吞吐 ✓ 正确答案
# 7. 模型的冷启动与预热中权重加载、CUDA 图、显存预留如何优化弹性扩缩容? A 冷启动耗时主要来自权重加载与 CUDA 初始化,可通过预热与 CUDA graph 优化 ✓ 正确答案 B 显存预留会显著增加冷启动耗时,应避免 C 预热只需加载权重,无需跑推理完成 kernel 编译 D 冷启动优化与弹性扩缩容无关
# 8. 模型线上效果监控中分布漂移、效果衰减(feedback loop)与业务指标联动如何告警? A feedback loop 使模型受影响,但不会造成指标失真,无需关注 B 应把分布漂移、效果衰减与业务指标联动监控,识别自我强化偏差 ✓ 正确答案 C 模型监控只需看损失值,无需关注业务指标 D 分布漂移与效果衰减是两件无关的事,应分开告警
# 9. 模型部署形态的选型中在线服务、批处理推理与边缘部署的延迟、成本与更新差异 A 在线服务适合延迟敏感场景但持续占用资源、成本高 ✓ 正确答案 B 批处理推理对延迟要求极高,适合交互式场景 C 边缘部署模型更新最方便,无需 OTA 分发 D 三种形态只能选一种,不能混合使用
# 10. 模型上线的验证中新旧版本指标对比、灰度期观察与自动回滚条件如何设计 A 离线回测通过即可直接全量上线,无需在线灰度 B 灰度期观察无需关注业务指标,只看模型指标即可 C 自动回滚条件应可量化,如新版本显著劣于旧版本或超 SLO 即回滚 ✓ 正确答案 D 回滚条件应模糊化,避免误触发
# 11. 模型发布策略的适用场景中蓝绿/金丝雀/影子流量分别适合哪些风险等级 A 金丝雀适合零风险、无需影响真实用户的全量上线 B 影子流量适合高风险首次上线前的零风险验证,但不把结果返回给用户 ✓ 正确答案 C 蓝绿部署最省资源,适合所有低风险场景 D 三种策略风险等级完全相同,可任意替换
# 12. 模型推理服务与业务服务的部署拓扑中同进程/独立服务/边缘部署如何选型? A 同进程部署支持 GPU 批处理,是最主流的生产拓扑 B 同进程部署模型与业务互相隔离,互不影响资源 C 边缘部署模型更新最方便,无需 OTA D 独立推理服务可独立扩缩容与更新,但需增加一次网络调用开销 ✓ 正确答案
# 13. 模型服务的健康检查与优雅停机中就绪探针、在途请求排空与显存释放如何实现 A 收到终止信号后应立即强杀进程以加快回收 B 优雅停机应先摘除流量、排空在途请求,再释放显存后退出 ✓ 正确答案 C 就绪探针只检查进程存活,无需关注模型加载状态 D 停机时无需显式释放 GPU 显存,进程退出自动归还
# 14. 模型服务的资源规划中显存占用、CPU/内存配比与并发上限如何估算 A 并发上限由显存与算力共同决定,应通过压测在延迟 SLO 下确定 ✓ 正确答案 B 显存估算只需考虑权重大小,无需考虑 KV cache 与并发 C 推理完全不需要 CPU 与内存,只需 GPU D 并发越高显存占用越低,可无限提升
# 15. 模型版本回滚(Rollback)的触发条件与秒级回滚的工程边界? A 秒级回滚通常依赖多版本同时在线的切换式发布,旧版本需保持可切换状态 ✓ 正确答案 B 回滚触发条件应模糊化,由人工凭经验随时判断 C 模型回滚后线上数据副作用会自动撤销,无需任何补偿 D 回滚成功即可终结,无需复盘根因与联动下游
# 16. 模型版本的回滚机制中模型仓库的版本不可变性与回滚到历史版本的操作流程 A 模型版本发布后可直接覆盖修改,便于回滚到最新内容 B 版本不可变性是可靠回滚的前提,回滚需按"选版本→切换→验证→审计"流程执行 ✓ 正确答案 C 回滚只需切换权重文件,无需考虑依赖环境与配套配置 D 回滚后无需监控验证,指标会自动恢复
# 17. 模型量化与精度验证中 INT8/FP8/4-bit 量化在部署前的离线评测与线上监控如何做? A INT8/FP8 量化几乎无损,无需离线评测即可直接上线 B 量化部署应先用代表性校准集做离线精度/性能评测,上线后灰度对比并持续监控输出分布 ✓ 正确答案 C 量化后只需关注吞吐提升,精度下降可以忽略 D 线上分布偏离校准集与量化模型无关,无需重校准