# 1. KV Cache 与上下文成本的关系,为什么更长的上下文会显著增加延迟与费用?应用层有哪些控制手段(截断、Prompt Caching、上下文压缩)? A 上下文越长,KV Cache 越大,延迟与费用越高 B 长上下文增加 KV Cache、延迟与费用,应用层用截断、Prompt Caching、上下文压缩控制上下文长度 ✓ 正确答案 C 上下文长度不影响显存 D 缓存无法降低处理成本
# 2. 首 token 延迟(TTFT)与生成速率(TPOT)为什么是两个独立的优化目标?应用层分别如何优化(流式输出、连接预热、并发与批处理)? A TTFT 与 TPOT 由同一阶段决定 B TTFT 由 prefill/排队决定,TPOT 由 decode 决定,两者独立;分别用流式预热和批处理并发优化 ✓ 正确答案 C 优化 TTFT 会自动优化 TPOT D TPOT 与批大小无关
# 3. 推理模型(reasoning)的思考 token 单独计费、缓存复用与超长思维链对预算的冲击,应用如何用思考档位与上限管控成本? A 思考 token 与普通输出同价,且长度可控 B 思考 token 单独计费且思维链可能超长,应用用思考档位、思考上限、路由与监控管控成本 ✓ 正确答案 C 思考 token 不参与计费 D 思考链长度无法控制
# 4. 可复现性的采样参数杠杆,seed、top_p 与频率惩罚在供应商间的实现差异,业务应如何组合使用并验证? A seed、top_p、频率惩罚在供应商间实现有差异,业务应组合固定参数并实测验证可复现性 ✓ 正确答案 B seed 在所有 Provider 都支持且语义相同 C 频率惩罚不影响可复现性 D 同一参数跨 Provider 结果必然一致
# 5. LLM 为什么会产生幻觉?纯应用层可做与不可做的缓解手段分别有哪些(RAG、约束解码、二次校验、拒答阈值)? A 应用层可根治幻觉 B 幻觉源于生成式求似然,应用层可降概率(RAG/约束解码/二次校验/拒答)但无法根治,需校验与人工兜底 ✓ 正确答案 C RAG 能消灭所有幻觉 D 幻觉只与采样随机性有关
# 6. temperature 与模型确定性,业务对"可复现输出"有要求时,除调参外还有哪些兜底(缓存/规则后处理)? A 可复现要求需用缓存、规则后处理、确定性路径兜底,调参只提高概率不能保证 ✓ 正确答案 B 模型输出可绝对复现 C 调低 temperature 即保证完全可复现 D 规则后处理与确定性无关
# 7. 上下文窗口超限的截断行为(头/中/尾裁剪)如何影响质量,应用层如何主动管理? A 硬截断位置不影响质量 B 等待硬截断即可 C 裁剪头部最安全 D 被动硬截断位置不可控,应用层应在超限前按优先级主动压缩(保指令与最近,先抛历史冗余) ✓ 正确答案
# 8. LLM 的计费模型,input/output token 定价差异、缓存(prompt caching)与批处理折扣如何影响成本结构? A input 与 output 同价 B output 通常比 input 贵,缓存命中便宜、批处理有折扣,成本由输入/输出/缓存/批处理共同决定 ✓ 正确答案 C 缓存命中与普通输入同价 D 批处理无折扣
# 9. 上下文窗口的经济性,长 prompt 的 token 成本与检索策略(只传必要上下文)如何权衡? A 长 prompt 无需控制成本 B 检索一定比长 prompt 便宜且无损失 C 上下文长度与成本无关 D 长 prompt 增加 token 成本,检索只传必要上下文可省成本,但需权衡检索开销与漏检风险 ✓ 正确答案
# 10. logprobs 与输出概率在不确定性检测、路由决策与质检中的应用边界,以及 Provider 支持差异? A logprobs 高即代表答案正确 B 所有 Provider 都完整支持 logprobs C logprobs 反映采样概率而非事实正确性,作置信信号与校验结合,且 Provider 支持差异大 ✓ 正确答案 D logprobs 无法用于不确定性检测
# 11. 多模型路由的成本控制,简单任务用轻模型、复杂任务用强模型? A 所有任务都用最强模型最保险 B 轻模型处理复杂任务质量无损 C 按任务复杂度分级路由,轻模型管简单任务、强模型管复杂任务,级联升级控制成本与质量 ✓ 正确答案 D 路由与成本无关
# 12. 输出截断检测,max_tokens 上限导致内容被硬截断时,如何自动续写、重试或提示用户? A 截断无法检测 B 续写无需回填上下文 C 输出超长可直接丢弃 D 用 finish_reason=length 检测截断,用续写(回填上下文)、重试或提示用户处理,续写设轮次上限 ✓ 正确答案
# 13. 无状态行为,模型不记忆跨请求上下文,应用如何显式管理会话状态与上下文重建? A 会话状态由模型维护 B 模型自动记忆跨请求上下文 C 模型无状态,应用需存储会话状态并每次请求重建上下文,按预算裁剪历史 ✓ 正确答案 D 无需管理会话历史
# 14. Tokenizer(BPE)对中文、代码、数字的切分特点及其对 Prompt 设计与按 Token 计费的影响? A 中文/数字 token 密度高,Prompt 设计要精简并考虑各类内容切分的 token 成本,用 tokenizer 估算 ✓ 正确答案 B 所有语言 token 密度相同 C 一个汉字总是一个 token D 数字切分不影响计费
# 15. 模型版本行为漂移(同 Prompt 不同版本输出变化)如何监控与应对? A 同 Prompt 不同版本输出必然一致 B 模型会自动保持版本一致 C 版本漂移无需监控 D 版本漂移是常态,用固定评估集+影子流量监控,版本锁定+灰度+契约测试+回滚应对 ✓ 正确答案
# 16. 同一参数下模型输出仍会漂移,温度、采样与后端升级对业务稳定性的影响应如何量化与缓解? A 后端升级不影响输出 B 同参数下输出必然稳定 C 采样随机与后端升级都致漂移,用重复一致性+跨版本评估量化,用固定参数、缓存、规则、灰度、监控缓解 ✓ 正确答案 D 漂移无法量化
# 17. 按输入、输出与缓存命中分别计价的场景下,缓存复用与批处理如何实际降低单次请求成本? A 缓存复用让 input 走低价 cache read、批处理拿折扣,共同降低单次请求成本 ✓ 正确答案 B 缓存命中与普通输入同价,无降本作用 C 批处理无法降本 D 输出无需计费
# 18. 结构化输出(JSON Mode/Function Calling)的一致性保证应如何评估,Schema 通过率、字段缺失率与重试成本如何度量 A 结构化输出只需看能否解析 B 字段缺失不影响一致性 C 重试成本无需度量 D 用 Schema 通过率、字段缺失率、重试成本度量结构化输出的一致性,约束解码可提升格式通过率 ✓ 正确答案
# 19. 模型输出的指纹与去重,相似输出识别在成本控制、日志审计与结果缓存中的应用? A 输出指纹只能用于展示 B 用输入/输出指纹做结果缓存、日志去重、相似输出识别,控制成本与存储,但需避免误伤合法差异 ✓ 正确答案 C 去重会删除所有重复 D 指纹与成本无关
# 20. 长上下文“迷失在中间”,模型对中段信息的利用弱于头尾,关键指令与证据应如何排布? A 模型对中段信息利用与头尾相同 B 位置不影响模型利用 C 关键信息应放中段 D 模型对中段信息利用弱于头尾,关键指令与证据应前置、次要信息放中段,避免核心被埋没 ✓ 正确答案