LLM 行为特性与计费认知(应用视角)

共 20 题
#

1. KV Cache 与上下文成本的关系,为什么更长的上下文会显著增加延迟与费用?应用层有哪些控制手段(截断、Prompt Caching、上下文压缩)?

A 上下文越长,KV Cache 越大,延迟与费用越高
B 长上下文增加 KV Cache、延迟与费用,应用层用截断、Prompt Caching、上下文压缩控制上下文长度 ✓ 正确答案
C 上下文长度不影响显存
D 缓存无法降低处理成本
#

2. 首 token 延迟(TTFT)与生成速率(TPOT)为什么是两个独立的优化目标?应用层分别如何优化(流式输出、连接预热、并发与批处理)?

A TTFT 与 TPOT 由同一阶段决定
B TTFT 由 prefill/排队决定,TPOT 由 decode 决定,两者独立;分别用流式预热和批处理并发优化 ✓ 正确答案
C 优化 TTFT 会自动优化 TPOT
D TPOT 与批大小无关
#

3. 推理模型(reasoning)的思考 token 单独计费、缓存复用与超长思维链对预算的冲击,应用如何用思考档位与上限管控成本?

A 思考 token 与普通输出同价,且长度可控
B 思考 token 单独计费且思维链可能超长,应用用思考档位、思考上限、路由与监控管控成本 ✓ 正确答案
C 思考 token 不参与计费
D 思考链长度无法控制
#

4. 可复现性的采样参数杠杆,seed、top_p 与频率惩罚在供应商间的实现差异,业务应如何组合使用并验证?

A seed、top_p、频率惩罚在供应商间实现有差异,业务应组合固定参数并实测验证可复现性 ✓ 正确答案
B seed 在所有 Provider 都支持且语义相同
C 频率惩罚不影响可复现性
D 同一参数跨 Provider 结果必然一致
#

5. LLM 为什么会产生幻觉?纯应用层可做与不可做的缓解手段分别有哪些(RAG、约束解码、二次校验、拒答阈值)?

A 应用层可根治幻觉
B 幻觉源于生成式求似然,应用层可降概率(RAG/约束解码/二次校验/拒答)但无法根治,需校验与人工兜底 ✓ 正确答案
C RAG 能消灭所有幻觉
D 幻觉只与采样随机性有关
#

6. temperature 与模型确定性,业务对"可复现输出"有要求时,除调参外还有哪些兜底(缓存/规则后处理)?

A 可复现要求需用缓存、规则后处理、确定性路径兜底,调参只提高概率不能保证 ✓ 正确答案
B 模型输出可绝对复现
C 调低 temperature 即保证完全可复现
D 规则后处理与确定性无关
#

7. 上下文窗口超限的截断行为(头/中/尾裁剪)如何影响质量,应用层如何主动管理?

A 硬截断位置不影响质量
B 等待硬截断即可
C 裁剪头部最安全
D 被动硬截断位置不可控,应用层应在超限前按优先级主动压缩(保指令与最近,先抛历史冗余) ✓ 正确答案
#

8. LLM 的计费模型,input/output token 定价差异、缓存(prompt caching)与批处理折扣如何影响成本结构?

A input 与 output 同价
B output 通常比 input 贵,缓存命中便宜、批处理有折扣,成本由输入/输出/缓存/批处理共同决定 ✓ 正确答案
C 缓存命中与普通输入同价
D 批处理无折扣
#

9. 上下文窗口的经济性,长 prompt 的 token 成本与检索策略(只传必要上下文)如何权衡?

A 长 prompt 无需控制成本
B 检索一定比长 prompt 便宜且无损失
C 上下文长度与成本无关
D 长 prompt 增加 token 成本,检索只传必要上下文可省成本,但需权衡检索开销与漏检风险 ✓ 正确答案
#

10. logprobs 与输出概率在不确定性检测、路由决策与质检中的应用边界,以及 Provider 支持差异?

A logprobs 高即代表答案正确
B 所有 Provider 都完整支持 logprobs
C logprobs 反映采样概率而非事实正确性,作置信信号与校验结合,且 Provider 支持差异大 ✓ 正确答案
D logprobs 无法用于不确定性检测
#

11. 多模型路由的成本控制,简单任务用轻模型、复杂任务用强模型?

A 所有任务都用最强模型最保险
B 轻模型处理复杂任务质量无损
C 按任务复杂度分级路由,轻模型管简单任务、强模型管复杂任务,级联升级控制成本与质量 ✓ 正确答案
D 路由与成本无关
#

12. 输出截断检测,max_tokens 上限导致内容被硬截断时,如何自动续写、重试或提示用户?

A 截断无法检测
B 续写无需回填上下文
C 输出超长可直接丢弃
D 用 finish_reason=length 检测截断,用续写(回填上下文)、重试或提示用户处理,续写设轮次上限 ✓ 正确答案
#

13. 无状态行为,模型不记忆跨请求上下文,应用如何显式管理会话状态与上下文重建?

A 会话状态由模型维护
B 模型自动记忆跨请求上下文
C 模型无状态,应用需存储会话状态并每次请求重建上下文,按预算裁剪历史 ✓ 正确答案
D 无需管理会话历史
#

14. Tokenizer(BPE)对中文、代码、数字的切分特点及其对 Prompt 设计与按 Token 计费的影响?

A 中文/数字 token 密度高,Prompt 设计要精简并考虑各类内容切分的 token 成本,用 tokenizer 估算 ✓ 正确答案
B 所有语言 token 密度相同
C 一个汉字总是一个 token
D 数字切分不影响计费
#

15. 模型版本行为漂移(同 Prompt 不同版本输出变化)如何监控与应对?

A 同 Prompt 不同版本输出必然一致
B 模型会自动保持版本一致
C 版本漂移无需监控
D 版本漂移是常态,用固定评估集+影子流量监控,版本锁定+灰度+契约测试+回滚应对 ✓ 正确答案
#

16. 同一参数下模型输出仍会漂移,温度、采样与后端升级对业务稳定性的影响应如何量化与缓解?

A 后端升级不影响输出
B 同参数下输出必然稳定
C 采样随机与后端升级都致漂移,用重复一致性+跨版本评估量化,用固定参数、缓存、规则、灰度、监控缓解 ✓ 正确答案
D 漂移无法量化
#

17. 按输入、输出与缓存命中分别计价的场景下,缓存复用与批处理如何实际降低单次请求成本?

A 缓存复用让 input 走低价 cache read、批处理拿折扣,共同降低单次请求成本 ✓ 正确答案
B 缓存命中与普通输入同价,无降本作用
C 批处理无法降本
D 输出无需计费
#

18. 结构化输出(JSON Mode/Function Calling)的一致性保证应如何评估,Schema 通过率、字段缺失率与重试成本如何度量

A 结构化输出只需看能否解析
B 字段缺失不影响一致性
C 重试成本无需度量
D 用 Schema 通过率、字段缺失率、重试成本度量结构化输出的一致性,约束解码可提升格式通过率 ✓ 正确答案
#

19. 模型输出的指纹与去重,相似输出识别在成本控制、日志审计与结果缓存中的应用?

A 输出指纹只能用于展示
B 用输入/输出指纹做结果缓存、日志去重、相似输出识别,控制成本与存储,但需避免误伤合法差异 ✓ 正确答案
C 去重会删除所有重复
D 指纹与成本无关
#

20. 长上下文“迷失在中间”,模型对中段信息的利用弱于头尾,关键指令与证据应如何排布?

A 模型对中段信息利用与头尾相同
B 位置不影响模型利用
C 关键信息应放中段
D 模型对中段信息利用弱于头尾,关键指令与证据应前置、次要信息放中段,避免核心被埋没 ✓ 正确答案