模型选型的成本—质量帕累托与自动路由(含小模型优先)

共 34 题
#

1. 自动路由规则应如何建立离线评估与持续纠偏流水线(复杂度标注、误路由成本度量、规则回归),防止复杂任务被误分给小模型导致质量崩塌

A 路由规则设置一次即可,无需评估
B 误路由成本无法量化,只能忽略
C 用带复杂度标注的评估集度量误路由率与误路由成本,规则调整做回归,上线后持续回测纠偏,防止复杂任务误降级 ✓ 正确答案
D 路由只看价格,无需看质量
#

2. 级联模式(小模型优先、失败升级)中,升级条件应如何用置信信号(logprobs、自评、业务校验)定义,升级比例带来的额外延迟与成本如何度量

A 升级条件只能用小模型自评
B 用 logprobs、自评、业务校验综合定义升级条件,度量升级比例带来的延迟与成本,用评估集校准阈值,并设升级次数上限 ✓ 正确答案
C 升级比例越高越好
D 升级无需考虑延迟与成本
#

3. 引入自动路由器后,应如何用对照实验证明其优于单一中档模型通吃,而不是只展示成本下降

A 只要成本下降就证明路由有效
B A/B 随机分流量,控制变量,同时度量成本与质量并做显著性检验,证明成本下降且质量不降 ✓ 正确答案
C 路由实验无需对照组
D 质量下降一点没关系,只要省钱
#

4. Token 计费模型(Input、Output、Cached)下,一次典型问答的成本应如何拆解,缓存命中率变化对单请求成本的影响如何测算?

A 缓存命中率不影响单请求成本
B 单请求成本 = 未命中部分输入×输入价 + 命中部分输入×缓存价 + 输出×输出价,命中率越高输入成本越低,可用曲线量化其影响 ✓ 正确答案
C 缓存价格与输入价格相同
D 输出 token 与输入 token 价格相同
#

5. 模型选择时应如何用自有任务集比较不同档位模型(如 GPT-4o、Claude Sonnet、Haiku、Llama 3.3)的成本与质量,而非照搬厂商基准?

A 用自有业务真实任务集评估各模型的成本与质量(含重试成本),画成本—质量帕累托,选质量达标且成本最优的模型 ✓ 正确答案
B 直接照搬厂商基准排名选模型即可
C 厂商基准一定代表自有业务质量
D 选型只需看单价
#

6. Prompt 精简与压缩(指令重写、示例删减)能节省多少 token,节省与质量损失之间应如何用评估集权衡?

A 用评估集度量精简后的 token 节省与质量变化,用边际权衡找"省得多且质量不掉"的精简点,且覆盖复杂任务 ✓ 正确答案
B Prompt 精简越多越好,无需考虑质量
C 精简不会影响质量
D Prompt 精简只影响输出不看输入
#

7. 级联路由中如何区分“小模型真的不会”与“被误判为不会”,避免把本可低成本回答的请求无谓升级?

A logprobs 低就一定是真不会,应升级
B 业务校验通过也应按 logprobs 升级
C 升级无需考虑是否值得
D 用多信号共识 + 业务校验硬约束 + 阈值校准 + 升级收益回测,避免把本可低成本回答的请求无谓升级 ✓ 正确答案
#

8. AI 应用何时应选择自托管推理 vs 商用 API(数据合规、定制化、长尾成本拐点),以及决策树的关键判据

A 自托管一定比 API 便宜
B 用量大小不影响自托管决策
C API 一定比自托管更合规
D 按合规约束、成本拐点(用量与 GPU 利用率)、定制化与工程成本做决策树判断,算全成本(含闲置与人力) ✓ 正确答案
#

9. Cost Attribution(按用户、按功能)应如何用请求级 usage 与业务标签精确分摊,避免多租户账单争议?

A 用粗粒度估算分摊即可,无需明细
B 请求级 usage 携带完整准确的业务标签(租户/用户/功能),归集按标签聚合,提供可下钻明细避免多租户争议 ✓ 正确答案
C 用户与功能标签不影响成本归属
D 缺标签的请求直接忽略
#

10. Budget Alert 与 Hard Limit 应如何分层(日/月/租户/功能)设置,触发后是自动降级还是熔断?

A 只设一个全局月预算即可
B 所有层级触发都直接熔断
C 按日/月/租户/功能分层设软告警与硬限制,软告警触发自动降级、硬限制触发熔断,优先保护核心功能 ✓ 正确答案
D 硬限制触发后也只需降级
#

11. Cost-Aware Routing 的路由特征(输入长度、任务类型、缓存命中)应如何采集,路由决策本身的开销如何控制?

A 每次路由都调用 LLM 分类器最准确
B 路由特征无法采集
C 用输入长度、任务类型、缓存命中等低成本特征内联采集,优先规则/嵌入/缓存做路由,控住路由自身的开销确保收益大于成本 ✓ 正确答案
D 路由开销不影响总成本
#

12. TTFT、TPOT、Total Latency 等指标应如何分解定位延迟瓶颈,并与成本、体验目标联动设限?

A 只监控总延迟即可,无需分解
B 延迟与成本、质量无关
C 用 TTFT/TPOT/Total 分解定位瓶颈(排队/生成/输出),并与成本、体验目标联动设限,超限时降级 ✓ 正确答案
D 降低延迟只能靠加钱
#

13. 上线后的在线评测(Production Eval)如何为模型档位与路由策略提供反馈,避免只依赖离线评估集?

A 离线评估集足够,无需在线评测
B 在线数据无法用于评估
C 采集线上真实输入、输出、用户反馈与业务结果形成线上评估集,监控各档位真实质量与路由误路由率,驱动持续调整 ✓ 正确答案
D 路由策略设置后无需看线上反馈
#

14. 输入分布漂移如何影响模型档位选择与路由规则,漂移告警后应如何触发重评估与策略更新?

A 输入分布漂移不影响路由规则
B 路由规则无需随输入分布调整
C 监控输入分布特征用 PSI 等检测漂移,告警后触发重评估各档位质量与路由效果并更新策略,形成闭环 ✓ 正确答案
D 漂移只影响质量不影响成本
#

15. 小模型承接简单任务时,如何防止质量退化只出现在长尾场景,评估集应如何切片监控

A 只看总体平均质量即可
B 小模型在所有场景都足够
C 长尾场景不存在质量退化
D 评估集按任务类型/长度/领域等切片单独监控,重点看长尾切片,切片级告警并对长尾场景做升级兜底 ✓ 正确答案
#

16. Provider 价格结构变化(小模型涨价逼近大模型)时,路由策略应如何重估与降级,价格表是否应作为路由输入

A 价格变化不影响路由策略
B 价格变化直接全量切换模型即可
C 路由只看价格,谁便宜用谁
D 价格表作为路由输入,价格变化后用当前价格重算各模型单位成功成本并重估路由,结合质量复位而非机械切换 ✓ 正确答案
#

17. 多个候选模型能力接近时,如何把延迟、配额稳定性与合规驻留作为约束一起做选型决策,而非只看单价

A 选型只看单价,谁便宜选谁
B 先做硬约束过滤(合规、延迟 SLA、配额稳定性),再在可用候选里按单位成功成本选最优,成本仅是目标之一 ✓ 正确答案
C 合规与延迟不影响选型
D 配额不稳定但便宜就该选
#

18. 路由器自身的调用成本(额外一次分类调用)应如何计入核算,什么请求量级与价差下路由才划算

A 路由分类调用不产生成本,无需核算
B 价差再小也值得用路由
C 路由成本与请求量无关
D 把路由分类成本计入总核算,只有当省下的钱 > 路由开销(量级大、价差大)才划算,优先用规则/嵌入等零成本路由 ✓ 正确答案
#

19. 路由决策应如何在 trace 与账单中留痕,使事后审计能回答这笔请求为何走了昂贵模型

A 只需记录最终用了哪个模型
B 路由决策无需留痕
C 在 trace 与账单记录请求特征、路由规则版本、决策依据与升级标志,使审计能回答"为何走了昂贵模型"并判断是否合理 ✓ 正确答案
D 审计只需看成本金额
#

20. trace 中记录 Prompt、响应与工具事件应如何采样与脱敏,才能支撑成本归因与路由复盘又不造成日志存储爆炸?

A 全量记录所有 Prompt 与响应
B 内容文本无需脱敏
C 采样无需考虑异常覆盖
D 成本元数据全量记录、内容按比例采样并脱敏,对异常/高成本/升级请求自适应提高采样率,避免存储爆炸且支撑复盘 ✓ 正确答案
#

21. OTel GenAI 语义约定如何统一记录模型、token 用量与成本属性,支撑跨 Provider 的成本对比报表?

A 不同 Provider 用各自字段记录即可
B 用 gen_ai 命名空间的标准字段统一记录模型、token、缓存与成本,配合统一币种与价格口径,支撑跨 Provider 成本对比 ✓ 正确答案
C OTel 只记录耗时,不记录 token
D 跨 Provider 报表无法用标准字段实现
#

22. 模型档位与路由策略的 A/B 测试应保持哪些变量不变(缓存、配额、用户分层),并用哪些指标判定胜出?

A A/B 测试只需随机分流,无需控制变量
B 用户分层不影响 A/B 结果
C 只看成本下降即可判定胜出
D 控制缓存、配额、用户分层、Prompt 等变量一致,用成本与质量双指标(单位成功成本 + 质量不降)判定胜出并做显著性检验 ✓ 正确答案
#

23. LLM Observability 平台(Langfuse、LangSmith、Helicone 等)如何选型,与 OTel GenAI 语义约定的关系是什么?

A 所有平台 schema 都相同,无需考虑
B 平台只能私有 schema,无法导出
C OTel 与观测平台完全无关
D 按功能、成本、合规、集成与开放性选型,优先支持 OTel GenAI 语义约定的平台,避免私有 schema 锁定 ✓ 正确答案
#

24. OpenInference、OpenLLMetry 如何把 token 用量与模型调用成本导出到通用监控,供成本报表复用?

A 用 OpenLLMetry 生成标准 OTel span 记录 token 与模型,经 OTel Collector 导出到通用监控,成本报表按模型×token×价格复用 ✓ 正确答案
B LLM 调用只能由各 Provider 单独采集
C span 无法导出到通用监控
D 通用监控不支持 token 数据
#

25. CRM 助手选型时如何评估不同模型档位的成本与客户价值,避免为低频高级功能长期支付旗舰模型费用?

A 按功能调用频率与客户价值匹配模型档位,用功能级路由让低频功能走小模型,避免为低频高级功能长期支付旗舰费用 ✓ 正确答案
B 所有功能统一用旗舰模型最省心
C 低频功能无所谓成本
D 旗舰模型只在低频功能用
#

26. 客服机器人按会话量计费时,模型档位路由与缓存策略如何控制单会话成本?

A 会话内所有调用统一用旗舰模型
B 缓存只影响输出不影响成本
C 会话越长成本越低
D 用会话内按复杂度路由、缓存命中、语义缓存与会话轮次预算控制单会话成本,监控单会话成本分布 ✓ 正确答案
#

27. 营销文案生成这类高并发任务,如何用小模型优先与批处理生成降低单位成本?

A 所有文案都用旗舰模型实时生成
B 文案生成必须实时,不能批量
C 用评估集验证后小模型优先承接模板文案、复杂创意走大模型,量大不敏感任务走 Batch API 批量生成,压单位成本 ✓ 正确答案
D 小模型无法生成营销文案
#

28. HR 场景(简历解析、员工问答)的模型成本应如何按功能归集,哪些功能可降级到小模型?

A 所有 HR 功能统一用大模型
B 简历解析必须用旗舰模型
C 按功能标签归集成本,规则化/模板化功能(简历抽取、FAQ)用评估集验证后降级小模型+批量,高价值复杂功能留大模型 ✓ 正确答案
D FAQ 问答无法用缓存
#

29. ERP 助手的低价值问答与高价值操作(下单、审批)成本差异应如何通过路由与审批门槛控制?

A 低价值问答路由到小模型/缓存省钱,高价值操作(下单/审批)用大模型并经审批门槛保质量与风控 ✓ 正确答案
B 所有 ERP 操作统一用便宜模型
C 高价值操作出错成本低,可随意
D 审批门槛会增加成本,应去掉
#

30. 语义路由(Semantic Router)用查询嵌入与路由模板的相似度做意图分类、把请求分派到 FAQ 直答、RAG、小模型或转人工等不同 pipeline 时,相似度阈值与 top-k 应如何基于误路由代价矩阵(错分到小模型的质量崩塌 vs 错分到大模型的成本浪费)校准,路由器自身的嵌入调用成本、误分回退到 LLM 分类器与基于线上日志的路由准确率回测应如何设计

A 语义路由阈值固定即可,无需校准
B 基于误路由代价矩阵校准阈值与 top-k,相似度不足回退到 LLM 分类器/转人工,控制嵌入成本,并用线上日志回测准确率 ✓ 正确答案
C 错分到小模型代价最低
D 语义路由无需回退机制
#

31. 成本—质量帕累托前沿应如何用自有评估集测绘,为什么厂商基准排名与单价都不能直接作为选型依据

A 用自有评估集测绘"成本—质量"帕累托前沿,选前沿上的模型,因厂商基准与单价都不能反映自有业务与单位成功成本 ✓ 正确答案
B 直接用厂商基准排名选模型
C 单价低就一定是好选择
D 厂商基准代表自有业务质量
#

32. BI 问答场景如何用缓存、小模型与语义缓存控制高频查询的 token 成本?

A 用精确缓存 + 语义缓存命中高频相似查询,简单查询用小模型、复杂用大模型,并处理缓存失效 ✓ 正确答案
B 每次 BI 查询都重新生成,无缓存
C 语义缓存无法用于 BI 查询
D BI 查询都是复杂分析,必须一次性大模型
#

33. 销售场景的批量生成(邮件、摘要)如何用批处理 API 与模型降档摊薄 token 成本?

A 批量任务走 Batch API 换取折扣、模板化邮件用小模型或模板直填,复杂客户用大模型,摊薄单位 token 成本 ✓ 正确答案
B 每封邮件都实时用旗舰模型生成
C 批量生成必须实时完成
D 降档会降低所有邮件质量,不可用
#

34. 法律文档处理的高质量要求与高成本应如何平衡,哪些环节必须用旗舰模型、哪些可降级?

A 所有法律处理环节都用旗舰模型最安全
B 为省钱一律用便宜模型
C 高风险环节(条款分析、法律意见)用旗舰 + 人工复核,低风险环节(摘要、结构化)用小模型/规则,按风险分级控成本 ✓ 正确答案
D 低风险环节出错也无所谓,可全用小模型