# 1. 自动路由规则应如何建立离线评估与持续纠偏流水线(复杂度标注、误路由成本度量、规则回归),防止复杂任务被误分给小模型导致质量崩塌 A 路由规则设置一次即可,无需评估 B 误路由成本无法量化,只能忽略 C 用带复杂度标注的评估集度量误路由率与误路由成本,规则调整做回归,上线后持续回测纠偏,防止复杂任务误降级 ✓ 正确答案 D 路由只看价格,无需看质量
# 2. 级联模式(小模型优先、失败升级)中,升级条件应如何用置信信号(logprobs、自评、业务校验)定义,升级比例带来的额外延迟与成本如何度量 A 升级条件只能用小模型自评 B 用 logprobs、自评、业务校验综合定义升级条件,度量升级比例带来的延迟与成本,用评估集校准阈值,并设升级次数上限 ✓ 正确答案 C 升级比例越高越好 D 升级无需考虑延迟与成本
# 3. 引入自动路由器后,应如何用对照实验证明其优于单一中档模型通吃,而不是只展示成本下降 A 只要成本下降就证明路由有效 B A/B 随机分流量,控制变量,同时度量成本与质量并做显著性检验,证明成本下降且质量不降 ✓ 正确答案 C 路由实验无需对照组 D 质量下降一点没关系,只要省钱
# 4. Token 计费模型(Input、Output、Cached)下,一次典型问答的成本应如何拆解,缓存命中率变化对单请求成本的影响如何测算? A 缓存命中率不影响单请求成本 B 单请求成本 = 未命中部分输入×输入价 + 命中部分输入×缓存价 + 输出×输出价,命中率越高输入成本越低,可用曲线量化其影响 ✓ 正确答案 C 缓存价格与输入价格相同 D 输出 token 与输入 token 价格相同
# 5. 模型选择时应如何用自有任务集比较不同档位模型(如 GPT-4o、Claude Sonnet、Haiku、Llama 3.3)的成本与质量,而非照搬厂商基准? A 用自有业务真实任务集评估各模型的成本与质量(含重试成本),画成本—质量帕累托,选质量达标且成本最优的模型 ✓ 正确答案 B 直接照搬厂商基准排名选模型即可 C 厂商基准一定代表自有业务质量 D 选型只需看单价
# 6. Prompt 精简与压缩(指令重写、示例删减)能节省多少 token,节省与质量损失之间应如何用评估集权衡? A 用评估集度量精简后的 token 节省与质量变化,用边际权衡找"省得多且质量不掉"的精简点,且覆盖复杂任务 ✓ 正确答案 B Prompt 精简越多越好,无需考虑质量 C 精简不会影响质量 D Prompt 精简只影响输出不看输入
# 7. 级联路由中如何区分“小模型真的不会”与“被误判为不会”,避免把本可低成本回答的请求无谓升级? A logprobs 低就一定是真不会,应升级 B 业务校验通过也应按 logprobs 升级 C 升级无需考虑是否值得 D 用多信号共识 + 业务校验硬约束 + 阈值校准 + 升级收益回测,避免把本可低成本回答的请求无谓升级 ✓ 正确答案
# 8. AI 应用何时应选择自托管推理 vs 商用 API(数据合规、定制化、长尾成本拐点),以及决策树的关键判据 A 自托管一定比 API 便宜 B 用量大小不影响自托管决策 C API 一定比自托管更合规 D 按合规约束、成本拐点(用量与 GPU 利用率)、定制化与工程成本做决策树判断,算全成本(含闲置与人力) ✓ 正确答案
# 9. Cost Attribution(按用户、按功能)应如何用请求级 usage 与业务标签精确分摊,避免多租户账单争议? A 用粗粒度估算分摊即可,无需明细 B 请求级 usage 携带完整准确的业务标签(租户/用户/功能),归集按标签聚合,提供可下钻明细避免多租户争议 ✓ 正确答案 C 用户与功能标签不影响成本归属 D 缺标签的请求直接忽略
# 10. Budget Alert 与 Hard Limit 应如何分层(日/月/租户/功能)设置,触发后是自动降级还是熔断? A 只设一个全局月预算即可 B 所有层级触发都直接熔断 C 按日/月/租户/功能分层设软告警与硬限制,软告警触发自动降级、硬限制触发熔断,优先保护核心功能 ✓ 正确答案 D 硬限制触发后也只需降级
# 11. Cost-Aware Routing 的路由特征(输入长度、任务类型、缓存命中)应如何采集,路由决策本身的开销如何控制? A 每次路由都调用 LLM 分类器最准确 B 路由特征无法采集 C 用输入长度、任务类型、缓存命中等低成本特征内联采集,优先规则/嵌入/缓存做路由,控住路由自身的开销确保收益大于成本 ✓ 正确答案 D 路由开销不影响总成本
# 12. TTFT、TPOT、Total Latency 等指标应如何分解定位延迟瓶颈,并与成本、体验目标联动设限? A 只监控总延迟即可,无需分解 B 延迟与成本、质量无关 C 用 TTFT/TPOT/Total 分解定位瓶颈(排队/生成/输出),并与成本、体验目标联动设限,超限时降级 ✓ 正确答案 D 降低延迟只能靠加钱
# 13. 上线后的在线评测(Production Eval)如何为模型档位与路由策略提供反馈,避免只依赖离线评估集? A 离线评估集足够,无需在线评测 B 在线数据无法用于评估 C 采集线上真实输入、输出、用户反馈与业务结果形成线上评估集,监控各档位真实质量与路由误路由率,驱动持续调整 ✓ 正确答案 D 路由策略设置后无需看线上反馈
# 14. 输入分布漂移如何影响模型档位选择与路由规则,漂移告警后应如何触发重评估与策略更新? A 输入分布漂移不影响路由规则 B 路由规则无需随输入分布调整 C 监控输入分布特征用 PSI 等检测漂移,告警后触发重评估各档位质量与路由效果并更新策略,形成闭环 ✓ 正确答案 D 漂移只影响质量不影响成本
# 15. 小模型承接简单任务时,如何防止质量退化只出现在长尾场景,评估集应如何切片监控 A 只看总体平均质量即可 B 小模型在所有场景都足够 C 长尾场景不存在质量退化 D 评估集按任务类型/长度/领域等切片单独监控,重点看长尾切片,切片级告警并对长尾场景做升级兜底 ✓ 正确答案
# 16. Provider 价格结构变化(小模型涨价逼近大模型)时,路由策略应如何重估与降级,价格表是否应作为路由输入 A 价格变化不影响路由策略 B 价格变化直接全量切换模型即可 C 路由只看价格,谁便宜用谁 D 价格表作为路由输入,价格变化后用当前价格重算各模型单位成功成本并重估路由,结合质量复位而非机械切换 ✓ 正确答案
# 17. 多个候选模型能力接近时,如何把延迟、配额稳定性与合规驻留作为约束一起做选型决策,而非只看单价 A 选型只看单价,谁便宜选谁 B 先做硬约束过滤(合规、延迟 SLA、配额稳定性),再在可用候选里按单位成功成本选最优,成本仅是目标之一 ✓ 正确答案 C 合规与延迟不影响选型 D 配额不稳定但便宜就该选
# 18. 路由器自身的调用成本(额外一次分类调用)应如何计入核算,什么请求量级与价差下路由才划算 A 路由分类调用不产生成本,无需核算 B 价差再小也值得用路由 C 路由成本与请求量无关 D 把路由分类成本计入总核算,只有当省下的钱 > 路由开销(量级大、价差大)才划算,优先用规则/嵌入等零成本路由 ✓ 正确答案
# 19. 路由决策应如何在 trace 与账单中留痕,使事后审计能回答这笔请求为何走了昂贵模型 A 只需记录最终用了哪个模型 B 路由决策无需留痕 C 在 trace 与账单记录请求特征、路由规则版本、决策依据与升级标志,使审计能回答"为何走了昂贵模型"并判断是否合理 ✓ 正确答案 D 审计只需看成本金额
# 20. trace 中记录 Prompt、响应与工具事件应如何采样与脱敏,才能支撑成本归因与路由复盘又不造成日志存储爆炸? A 全量记录所有 Prompt 与响应 B 内容文本无需脱敏 C 采样无需考虑异常覆盖 D 成本元数据全量记录、内容按比例采样并脱敏,对异常/高成本/升级请求自适应提高采样率,避免存储爆炸且支撑复盘 ✓ 正确答案
# 21. OTel GenAI 语义约定如何统一记录模型、token 用量与成本属性,支撑跨 Provider 的成本对比报表? A 不同 Provider 用各自字段记录即可 B 用 gen_ai 命名空间的标准字段统一记录模型、token、缓存与成本,配合统一币种与价格口径,支撑跨 Provider 成本对比 ✓ 正确答案 C OTel 只记录耗时,不记录 token D 跨 Provider 报表无法用标准字段实现
# 22. 模型档位与路由策略的 A/B 测试应保持哪些变量不变(缓存、配额、用户分层),并用哪些指标判定胜出? A A/B 测试只需随机分流,无需控制变量 B 用户分层不影响 A/B 结果 C 只看成本下降即可判定胜出 D 控制缓存、配额、用户分层、Prompt 等变量一致,用成本与质量双指标(单位成功成本 + 质量不降)判定胜出并做显著性检验 ✓ 正确答案
# 23. LLM Observability 平台(Langfuse、LangSmith、Helicone 等)如何选型,与 OTel GenAI 语义约定的关系是什么? A 所有平台 schema 都相同,无需考虑 B 平台只能私有 schema,无法导出 C OTel 与观测平台完全无关 D 按功能、成本、合规、集成与开放性选型,优先支持 OTel GenAI 语义约定的平台,避免私有 schema 锁定 ✓ 正确答案
# 24. OpenInference、OpenLLMetry 如何把 token 用量与模型调用成本导出到通用监控,供成本报表复用? A 用 OpenLLMetry 生成标准 OTel span 记录 token 与模型,经 OTel Collector 导出到通用监控,成本报表按模型×token×价格复用 ✓ 正确答案 B LLM 调用只能由各 Provider 单独采集 C span 无法导出到通用监控 D 通用监控不支持 token 数据
# 25. CRM 助手选型时如何评估不同模型档位的成本与客户价值,避免为低频高级功能长期支付旗舰模型费用? A 按功能调用频率与客户价值匹配模型档位,用功能级路由让低频功能走小模型,避免为低频高级功能长期支付旗舰费用 ✓ 正确答案 B 所有功能统一用旗舰模型最省心 C 低频功能无所谓成本 D 旗舰模型只在低频功能用
# 26. 客服机器人按会话量计费时,模型档位路由与缓存策略如何控制单会话成本? A 会话内所有调用统一用旗舰模型 B 缓存只影响输出不影响成本 C 会话越长成本越低 D 用会话内按复杂度路由、缓存命中、语义缓存与会话轮次预算控制单会话成本,监控单会话成本分布 ✓ 正确答案
# 27. 营销文案生成这类高并发任务,如何用小模型优先与批处理生成降低单位成本? A 所有文案都用旗舰模型实时生成 B 文案生成必须实时,不能批量 C 用评估集验证后小模型优先承接模板文案、复杂创意走大模型,量大不敏感任务走 Batch API 批量生成,压单位成本 ✓ 正确答案 D 小模型无法生成营销文案
# 28. HR 场景(简历解析、员工问答)的模型成本应如何按功能归集,哪些功能可降级到小模型? A 所有 HR 功能统一用大模型 B 简历解析必须用旗舰模型 C 按功能标签归集成本,规则化/模板化功能(简历抽取、FAQ)用评估集验证后降级小模型+批量,高价值复杂功能留大模型 ✓ 正确答案 D FAQ 问答无法用缓存
# 29. ERP 助手的低价值问答与高价值操作(下单、审批)成本差异应如何通过路由与审批门槛控制? A 低价值问答路由到小模型/缓存省钱,高价值操作(下单/审批)用大模型并经审批门槛保质量与风控 ✓ 正确答案 B 所有 ERP 操作统一用便宜模型 C 高价值操作出错成本低,可随意 D 审批门槛会增加成本,应去掉
# 30. 语义路由(Semantic Router)用查询嵌入与路由模板的相似度做意图分类、把请求分派到 FAQ 直答、RAG、小模型或转人工等不同 pipeline 时,相似度阈值与 top-k 应如何基于误路由代价矩阵(错分到小模型的质量崩塌 vs 错分到大模型的成本浪费)校准,路由器自身的嵌入调用成本、误分回退到 LLM 分类器与基于线上日志的路由准确率回测应如何设计 A 语义路由阈值固定即可,无需校准 B 基于误路由代价矩阵校准阈值与 top-k,相似度不足回退到 LLM 分类器/转人工,控制嵌入成本,并用线上日志回测准确率 ✓ 正确答案 C 错分到小模型代价最低 D 语义路由无需回退机制
# 31. 成本—质量帕累托前沿应如何用自有评估集测绘,为什么厂商基准排名与单价都不能直接作为选型依据 A 用自有评估集测绘"成本—质量"帕累托前沿,选前沿上的模型,因厂商基准与单价都不能反映自有业务与单位成功成本 ✓ 正确答案 B 直接用厂商基准排名选模型 C 单价低就一定是好选择 D 厂商基准代表自有业务质量
# 32. BI 问答场景如何用缓存、小模型与语义缓存控制高频查询的 token 成本? A 用精确缓存 + 语义缓存命中高频相似查询,简单查询用小模型、复杂用大模型,并处理缓存失效 ✓ 正确答案 B 每次 BI 查询都重新生成,无缓存 C 语义缓存无法用于 BI 查询 D BI 查询都是复杂分析,必须一次性大模型
# 33. 销售场景的批量生成(邮件、摘要)如何用批处理 API 与模型降档摊薄 token 成本? A 批量任务走 Batch API 换取折扣、模板化邮件用小模型或模板直填,复杂客户用大模型,摊薄单位 token 成本 ✓ 正确答案 B 每封邮件都实时用旗舰模型生成 C 批量生成必须实时完成 D 降档会降低所有邮件质量,不可用
# 34. 法律文档处理的高质量要求与高成本应如何平衡,哪些环节必须用旗舰模型、哪些可降级? A 所有法律处理环节都用旗舰模型最安全 B 为省钱一律用便宜模型 C 高风险环节(条款分析、法律意见)用旗舰 + 人工复核,低风险环节(摘要、结构化)用小模型/规则,按风险分级控成本 ✓ 正确答案 D 低风险环节出错也无所谓,可全用小模型