模型路由与级联与推理成本与缓存

共 26 题
#

1. 强模型与弱模型的级联(Cascade)的真实工程实现

A 级联先走弱模型、不确定时升级强模型,靠可靠触发条件控成本保质量 ✓ 正确答案
B 级联让所有请求都走强模型
C 级联无法降低成本
D 级联不需评估
#

2. 模型路由(Model Routing)的真实业务价值

A 模型路由让所有请求走同一模型
B 路由只会增加成本
C 路由不需评测
D 模型路由按请求特征分发到最合适模型,实现成本-质量-延迟最优 ✓ 正确答案
#

3. A/B 测试在路由中的真实实施

A 路由 A/B 要随机分流、看成本-质量-延迟多指标并统计检验 ✓ 正确答案
B 路由 A/B 只看成本
C 路由 A/B 无需样本量
D 路由 A/B 只看质量
#

4. 不同供应商路由(Vendor Routing)的真实工程实现

A 供应商路由用统一抽象层接入多供应商,做故障转移与成本质量优化 ✓ 正确答案
B 单一供应商足够
C 供应商路由无需监控
D 供应商路由不处理故障
#

5. 降级(Fallback)策略的工程边界

A 降级链越深越好
B 降级无需监控
C 降级不影响质量
D 降级链从主模型到备选、小模型、缓存、人工,保障可用性但需监控兜底 ✓ 正确答案
#

6. LLM 推理成本(Token Cost)的真实结构,Prompt Caching、语义缓存与模型路由等长期节省手段如何组合落地?

A 推理成本在输入输出 token,靠前缀缓存、语义缓存、路由与精简上下文组合降本 ✓ 正确答案
B 推理成本只看出力 token
C 缓存与路由无关
D 上下文越长越省
#

7. OpenRouter/LiteLLM 的统一接入如何简化多供应商调用,成本、限流与故障转移策略如何配置?

A 统一接入层无法简化
B OpenRouter/LiteLLM 用统一 API 接入多供应商,集中配置成本、限流与故障转移 ✓ 正确答案
C 统一接入层不处理限流
D 统一接入层锁死供应商
#

8. Prompt 压缩如何降低成本与延迟,压缩损失如何用任务评测与业务指标权衡?

A 压缩越大越好
B 压缩无损
C Prompt 压缩降本降延迟,但需用任务评测与业务指标权衡损失 ✓ 正确答案
D 压缩不需评测
#

9. 批处理(Batching)对推理成本的真实影响

A 批处理提升 GPU 利用率与吞吐降成本,但增加延迟,离线批处理划算 ✓ 正确答案
B 批处理永远降低延迟
C 批处理无权衡
D batch 越大越好
#

10. 自托管 vs API 的真实成本对比与 GPU 利用率优化

A 自托管永远比 API 便宜
B API 利用率无关
C 自托管 vs API 看 TCO 与利用率,利用率高自托管划算,需优化 GPU 利用率 ✓ 正确答案
D 自托管无需运维
#

11. 输出长度控制(Max Tokens)的工程优化

A max_tokens 越大越好
B 输出长度无需控制
C max_tokens 越小越好
D Max Tokens 按任务设定控制成本延迟,配合流式与格式约束优化 ✓ 正确答案
#

12. AI 成本监控的真实工程实施

A AI 成本不可监控
B 成本无需拆分
C 成本监控无需告警
D AI 成本监控靠统一网关记录、按维度聚合、预算告警与优化治理 ✓ 正确答案
#

13. Edge LLM 部署的真实可行场景

A Edge LLM 可跑所有任务
B 边缘算力无限
C Edge LLM 适合简单任务+小模型+隐私场景,复杂任务靠云端 ✓ 正确答案
D Edge LLM 无需量化
#

14. GPU 利用率的度量(SM 占用/显存/批大小)与优化手段(连续批处理/量化)在推理成本上的实际收益?

A GPU 利用率无需优化
B 量化不一定有效
C 利用率与成本无关
D GPU 利用率靠连续批处理与量化提升吞吐摊薄成本,需用每 token 成本度量 ✓ 正确答案
#

15. Spot GPU 的真实工程可用性

A Spot GPU 适合在线服务
B Spot GPU 不会中断
C Spot GPU 便宜但会中断,适合可恢复的批处理/训练,需容错设计 ✓ 正确答案
D Spot GPU 无需检查点
#

16. 推理预算(Inference Budget)的工程管理

A 推理预算无需设定
B 推理预算按任务/用户定成本上限,超限降级告警,配监控闭环 ✓ 正确答案
C 预算超限无需处理
D 推理预算降低质量
#

17. AI FinOps 的真实长期工程价值

A FinOps 一次性省钱即可
B FinOps 无需成本报告
C AI FinOps 把成本管理工程化,持续优化、可预期、支撑规模扩展 ✓ 正确答案
D FinOps 不涉及优化
#

18. 冷启动预热(Warm Pool)的工程实现

A 冷启动无影响
B 预热无需成本
C 预热(Warm Pool)预加载模型实例降低首延迟,但需权衡资源成本 ✓ 正确答案
D 预热只用于训练
#

19. 意图分类(Intent Classification)在路由中的真实角色

A 意图分类识别请求意图用于路由分发,分类准确率决定路由质量 ✓ 正确答案
B 意图分类与路由无关
C 意图分类需用大模型
D 意图分类无需更新
#

20. 成本感知路由(Cost-Aware Routing)的真实节省

A 成本感知路由在质量底线内选便宜模型,可显著降本且不损质量 ✓ 正确答案
B 成本感知路由以牺牲质量换成本
C 成本感知路由无节省
D 成本感知路由不需质量底线
#

21. 置信度阈值(Confidence Threshold)的工程调优

A 阈值越高越好
B 阈值越低越好
C 置信度阈值在误判漏判间平衡,用评测曲线与 A/B 调优 ✓ 正确答案
D 阈值无需调优
#

22. vLLM / TGI / TensorRT-LLM 在自托管的真实性能

A 三个框架性能一致
B TensorRT-LLM 配置最简单
C vLLM 易用高吞吐、TensorRT-LLM 极致性能复杂、TGI 兼容好,按需压测选型 ✓ 正确答案
D 框架无需压测
#

23. 小模型替代大模型(Distillation)的真实边界

A 蒸馏小模型可完全替代大模型
B 蒸馏无边界
C 蒸馏创造新能力
D 蒸馏小模型适合简单任务,复杂推理仍弱,需用评测确认损失边界 ✓ 正确答案
#

24. 量化(Quantization, INT8/INT4)的真实质量损失

A 量化完全无损
B INT4 无损
C 量化只影响显存
D INT8 损失小、INT4 损失明显,复杂任务下降,需用评测权衡 ✓ 正确答案
#

25. Batch API 在离线任务的真实成本节省

A Batch API 适合实时任务
B Batch API 批量离线处理更便宜但延迟高,适合非实时批量任务 ✓ 正确答案
C Batch API 无折扣
D Batch API 与同步等价
#

26. Token 计费模型(Input vs Output Cost)的真实差异

A 输入输出同样计费
B 输出 token 通常更贵,优化靠输入缓存精简、输出限长与路由 ✓ 正确答案
C 优化只需减少输入
D 输出成本无关