# 1. 强模型与弱模型的级联(Cascade)的真实工程实现 A 级联先走弱模型、不确定时升级强模型,靠可靠触发条件控成本保质量 ✓ 正确答案 B 级联让所有请求都走强模型 C 级联无法降低成本 D 级联不需评估
# 2. 模型路由(Model Routing)的真实业务价值 A 模型路由让所有请求走同一模型 B 路由只会增加成本 C 路由不需评测 D 模型路由按请求特征分发到最合适模型,实现成本-质量-延迟最优 ✓ 正确答案
# 3. A/B 测试在路由中的真实实施 A 路由 A/B 要随机分流、看成本-质量-延迟多指标并统计检验 ✓ 正确答案 B 路由 A/B 只看成本 C 路由 A/B 无需样本量 D 路由 A/B 只看质量
# 4. 不同供应商路由(Vendor Routing)的真实工程实现 A 供应商路由用统一抽象层接入多供应商,做故障转移与成本质量优化 ✓ 正确答案 B 单一供应商足够 C 供应商路由无需监控 D 供应商路由不处理故障
# 6. LLM 推理成本(Token Cost)的真实结构,Prompt Caching、语义缓存与模型路由等长期节省手段如何组合落地? A 推理成本在输入输出 token,靠前缀缓存、语义缓存、路由与精简上下文组合降本 ✓ 正确答案 B 推理成本只看出力 token C 缓存与路由无关 D 上下文越长越省
# 7. OpenRouter/LiteLLM 的统一接入如何简化多供应商调用,成本、限流与故障转移策略如何配置? A 统一接入层无法简化 B OpenRouter/LiteLLM 用统一 API 接入多供应商,集中配置成本、限流与故障转移 ✓ 正确答案 C 统一接入层不处理限流 D 统一接入层锁死供应商
# 8. Prompt 压缩如何降低成本与延迟,压缩损失如何用任务评测与业务指标权衡? A 压缩越大越好 B 压缩无损 C Prompt 压缩降本降延迟,但需用任务评测与业务指标权衡损失 ✓ 正确答案 D 压缩不需评测
# 9. 批处理(Batching)对推理成本的真实影响 A 批处理提升 GPU 利用率与吞吐降成本,但增加延迟,离线批处理划算 ✓ 正确答案 B 批处理永远降低延迟 C 批处理无权衡 D batch 越大越好
# 10. 自托管 vs API 的真实成本对比与 GPU 利用率优化 A 自托管永远比 API 便宜 B API 利用率无关 C 自托管 vs API 看 TCO 与利用率,利用率高自托管划算,需优化 GPU 利用率 ✓ 正确答案 D 自托管无需运维
# 11. 输出长度控制(Max Tokens)的工程优化 A max_tokens 越大越好 B 输出长度无需控制 C max_tokens 越小越好 D Max Tokens 按任务设定控制成本延迟,配合流式与格式约束优化 ✓ 正确答案
# 13. Edge LLM 部署的真实可行场景 A Edge LLM 可跑所有任务 B 边缘算力无限 C Edge LLM 适合简单任务+小模型+隐私场景,复杂任务靠云端 ✓ 正确答案 D Edge LLM 无需量化
# 14. GPU 利用率的度量(SM 占用/显存/批大小)与优化手段(连续批处理/量化)在推理成本上的实际收益? A GPU 利用率无需优化 B 量化不一定有效 C 利用率与成本无关 D GPU 利用率靠连续批处理与量化提升吞吐摊薄成本,需用每 token 成本度量 ✓ 正确答案
# 15. Spot GPU 的真实工程可用性 A Spot GPU 适合在线服务 B Spot GPU 不会中断 C Spot GPU 便宜但会中断,适合可恢复的批处理/训练,需容错设计 ✓ 正确答案 D Spot GPU 无需检查点
# 16. 推理预算(Inference Budget)的工程管理 A 推理预算无需设定 B 推理预算按任务/用户定成本上限,超限降级告警,配监控闭环 ✓ 正确答案 C 预算超限无需处理 D 推理预算降低质量
# 17. AI FinOps 的真实长期工程价值 A FinOps 一次性省钱即可 B FinOps 无需成本报告 C AI FinOps 把成本管理工程化,持续优化、可预期、支撑规模扩展 ✓ 正确答案 D FinOps 不涉及优化
# 19. 意图分类(Intent Classification)在路由中的真实角色 A 意图分类识别请求意图用于路由分发,分类准确率决定路由质量 ✓ 正确答案 B 意图分类与路由无关 C 意图分类需用大模型 D 意图分类无需更新
# 20. 成本感知路由(Cost-Aware Routing)的真实节省 A 成本感知路由在质量底线内选便宜模型,可显著降本且不损质量 ✓ 正确答案 B 成本感知路由以牺牲质量换成本 C 成本感知路由无节省 D 成本感知路由不需质量底线
# 21. 置信度阈值(Confidence Threshold)的工程调优 A 阈值越高越好 B 阈值越低越好 C 置信度阈值在误判漏判间平衡,用评测曲线与 A/B 调优 ✓ 正确答案 D 阈值无需调优
# 22. vLLM / TGI / TensorRT-LLM 在自托管的真实性能 A 三个框架性能一致 B TensorRT-LLM 配置最简单 C vLLM 易用高吞吐、TensorRT-LLM 极致性能复杂、TGI 兼容好,按需压测选型 ✓ 正确答案 D 框架无需压测
# 23. 小模型替代大模型(Distillation)的真实边界 A 蒸馏小模型可完全替代大模型 B 蒸馏无边界 C 蒸馏创造新能力 D 蒸馏小模型适合简单任务,复杂推理仍弱,需用评测确认损失边界 ✓ 正确答案
# 24. 量化(Quantization, INT8/INT4)的真实质量损失 A 量化完全无损 B INT4 无损 C 量化只影响显存 D INT8 损失小、INT4 损失明显,复杂任务下降,需用评测权衡 ✓ 正确答案
# 25. Batch API 在离线任务的真实成本节省 A Batch API 适合实时任务 B Batch API 批量离线处理更便宜但延迟高,适合非实时批量任务 ✓ 正确答案 C Batch API 无折扣 D Batch API 与同步等价
# 26. Token 计费模型(Input vs Output Cost)的真实差异 A 输入输出同样计费 B 输出 token 通常更贵,优化靠输入缓存精简、输出限长与路由 ✓ 正确答案 C 优化只需减少输入 D 输出成本无关