# 1. 大模型推理的核心指标(TTFT/TPOT/吞吐/token 成本)如何采集与告警? A token 成本与模型版本无关 B TTFT 等价于总生成时长 C 吞吐只需看请求数,无需关注 token 数 D TTFT 与 TPOT 需分别埋点,并配合 token 成本与 GPU 利用率分层告警 ✓ 正确答案
# 2. 推理成本(token/元)的实时计量与按业务分摊如何做? A 输入输出 token 的算力成本相同,无需区分 B 实时计量只需统计输出 token C 成本分摊无需标签治理 D 按 token 数×单价计量,并以业务线/模型版本标签做分摊 ✓ 正确答案
# 3. 推理服务的“幻觉率/质量”能否用线上指标衡量,如何埋点? A 可以精确实时测出幻觉率 B 质量与业务运营指标无关 C 结合用户反馈、抽样评审与统计异常信号共同近似衡量质量 ✓ 正确答案 D 只需统计输出 token 数即可衡量质量
# 4. 推理请求的 trace(含 token 流)如何做端到端追踪与排障? A 只需记录请求耗时,无需 span 分层 B 用统一 trace_id 贯穿各 span,并记录 token 流与模型版本属性,按采样保留 ✓ 正确答案 C trace 与日志指标相互独立,无需联动 D 流式 token 无需纳入 trace
# 5. 推理质量回归(新版本输出变差)如何被线上信号早期预警? A 灰度期新旧版对比质量信号,超基线即告警并可自动回滚 ✓ 正确答案 B 质量回归只能全量发布后人工发现 C 用户反馈无关紧要,只看延迟 D 新版本无需对比旧版本
# 6. 推理引擎内部状态观测中 continuous batching 队列、KV cache 利用率与显存压力的监控 A 引擎内部状态无法暴露指标 B 队列积压只反映网络问题 C KV cache 利用率与显存压力无关 D 通过队列深度、KV cache 利用率与显存水位监控引擎内部压力 ✓ 正确答案
# 7. 推理可观测指标的分层中请求级(TTFT/TPOT)、引擎级(吞吐/排队)与资源级(GPU 利用率)如何关联 A 三层指标相互独立,无需关联 B 资源级决定引擎级决定请求级,三层联动可定位瓶颈层 ✓ 正确答案 C GPU 利用率高但吞吐低说明算力充足 D 只需看请求级延迟即可定位一切
# 8. 推理异常(如重复生成/截断)如何用规则与采样检测? A 只需检测截断,无需关注重复生成 B 异常率与模型版本无需关联 C 异常检测只能人工完成 D 在线规则检测(重复率/截断)+ 离线采样深度分析结合 ✓ 正确答案
# 9. 推理队列积压与超时(用户等待)如何被实时发现并限流? A 限流应一刀切,不区分租户优先级 B 队列积压无法实时监控 C 监控队列深度与等待时间,超阈值时限流/降级/扩容 ✓ 正确答案 D 等待时间与队列积压无关
# 10. 提示词注入攻击在推理侧的异常流量模式如何监控? A 只需监控输出 token 数 B 注入攻击与安全无关 C 提示词注入无法被检测 D 输入侧检测注入模式 + 输出侧识别越权行为,双通道监控 ✓ 正确答案
# 11. 模型版本灰度期间,新旧版本输出差异如何做比对监控? A 只需对比文本长度 B 相同输入对比新旧输出,用语义与任务正确性度量并设阈值告警 ✓ 正确答案 C 新旧版本无差异,无需对比 D 对比监控只能离线进行
# 12. GPU 硬件健康监测中 ECC 错误、NVLink 状态、温度与降频对推理质量的影响 A ECC 错误只影响速度不影响正确性 B 温度降频只影响电费 C ECC 错误、NVLink 状态与温度降频都会影响推理质量,需通过 DCGM 监测 ✓ 正确答案 D NVLink 异常不影响多卡通信
# 13. 推理告警体系中延迟超时、显存 OOM、配额耗尽与错误率突增的告警规则如何设置 A 告警越多越好,无需抑制 B 告警阈值应固定不变以避免误报 C 各类告警基于基线阈值,并分级、抑制、附处置手册 ✓ 正确答案 D 错误率突增无需告警
# 14. 推理成本监控中每 token 成本、GPU 利用率与账单的关联分析如何建立 A GPU 利用率与成本无关 B 结合每 token 成本、GPU 利用率与 tokens/sec/GPU 关联识别资源浪费 ✓ 正确答案 C 账单无需与内部计量核对 D 每 token 成本只反映单价
# 15. 推理服务的 GPU 利用率与 token 效率(tokens/sec/GPU)大盘? A tokens/sec/GPU 反映单位算力有效产出,与利用率结合识别低效 ✓ 正确答案 B tokens/sec/GPU 与 batch 无关 C GPU 利用率高即代表效率高 D 大盘无法支撑容量规划
# 16. 推理请求日志的设计中输入输出采样、token 数、耗时与模型版本字段如何记录与检索 A 元数据全量记录、输入输出按比例采样,并用版本字段支撑检索 ✓ 正确答案 B 日志无需结构化,纯文本即可 C 采样后无法排障 D 输入输出应全量保存
# 17. 推理质量观测中离线评测集与线上质量指标的关联以及质量回归如何自动发现 A 离线评测集无需更新 B 离线评测做发布门禁,线上指标做持续护栏,基线偏差触发自动回滚 ✓ 正确答案 C 线上质量指标无法反映真实影响 D 质量回归只能人工发现
# 18. 推理链路追踪中从网关到引擎的 span 设计、模型版本属性与输入输出采样策略 A span 覆盖网关/队列/引擎各阶段,携带模型版本,元数据全量而内容采样 ✓ 正确答案 B span 只需记录单个请求总耗时 C 输入输出应全量采集 D 模型版本属性无观测价值
# 19. 流式输出体验指标中 token 间延迟抖动、输出中断率与端到端首帧时间的观测 A 只需看总耗时 B 观测首帧时间、token 间延迟抖动与中断率共同反映流式体验 ✓ 正确答案 C 中断率与体验无关 D token 间延迟抖动无需监控