Token、上下文预算与 Prompt Caching

共 21 题
#

1. 输入、输出、缓存读写及 reasoning/thinking tokens 的计量差异会怎样影响账单核对和租户计费

A 输入/输出/缓存读写/thinking 计价不同,对账与租户计费须按类型细分并透明披露,避免混算偏差 ✓ 正确答案
B 缓存命中价格与普通输入一致
C thinking token 无需单独计量
D 所有 token 类型计价相同,无需区分
#

2. 推理模型(如 o3、DeepSeek-R1)的 reasoning tokens 在 Anthropic/OpenAI 中如何计费与展示,前端为何不应回显原始 token 数

A reasoning token 与普通输出 token 完全等价,无需区分
B reasoning token 单独计费,思考链内容敏感,前端不应回显原始 token 数,只给聚合简化口径 ✓ 正确答案
C 前端应完整回显思考链
D reasoning token 不计费
#

3. Anthropic 5 分钟 TTL 缓存与 OpenAI 长保留缓存的失效条件分别是什么,应用层如何同时利用两种缓存

A 两种缓存都无需前缀稳定,任意位置都能命中
B 缓存命中与消息顺序无关
C Anthropic 5 分钟 TTL 需显式缓存点,OpenAI 自动前缀缓存;两者都要求前缀稳定,应用层应稳定前置变动后置来同时利用 ✓ 正确答案
D Anthropic 缓存可无限期保留
#

4. 截断、滚动窗口、摘要和按需检索各会丢失什么信息,如何用任务评估选择策略

A 四种策略各有信息丢失特征,应通过任务评估量化质量并结合延迟成本选择策略 ✓ 正确答案
B 摘要可无损保留所有细节
C 截断、滚动窗口、摘要、检索都保留全部信息
D 按需检索永不丢失信息
#

5. 如何识别上下文污染、事实冲突和 Lost-in-the-Middle,并通过来源优先级与信息布局缓解

A 三种问题无法通过上下文组织缓解
B 上下文顺序不影响模型质量
C 冲突时模型总能自动选对
D 用来源优先级(显式声明可信度)、关键信息前置/后置布局、多来源冲突校验来缓解污染、冲突与 Lost-in-the-Middle ✓ 正确答案
#

6. 前缀缓存(Prefix Cache)对工具 Schema、动态时间戳、用户名等高变动字段如何后置以最大化命中

A 高变动字段应放最前,保证缓存命中
B 工具 Schema 永远无法命中缓存
C 缓存命中与字段位置无关
D 前缀缓存要求前缀稳定,应把工具 Schema、静态指令前置、时间戳/用户名等变动字段后置以最大化命中 ✓ 正确答案
#

7. Token 限速(TPM/RPM)与并发限制(Concurrency)应如何协同建模,才能既保护 Provider 配额又不误伤突发流量?

A TPM 与并发是同一概念,只需一种
B TPM/RPM 与并发是独立约束,应令牌桶吸收突发 + 并发排队替代拒绝,先查并发再查速率协同建模 ✓ 正确答案
C 限流越严格越不误伤
D 突发流量必须全部拒绝
#

8. 上下文压缩(摘要、抽取、剪枝)如何避免破坏工具调用的结构、引用与函数名对齐

A 工具调用消息可随意摘要压缩
B 压缩工具结果不影响后续调用
C 工具调用是结构化约束,应原样保留,压缩只作用于纯文本,并校验函数名与 id 配对不变量 ✓ 正确答案
D 函数名可在压缩后随意改名
#

9. 服务端计费 usage 与客户端成本预估不一致时,如何把 usage 字段写回可观测性链路用于成本归因

A usage 字段无需记录,账单为准即可
B 成本归因无需 usage 数据
C 客户端预估总是精确
D 把 usage 结构化写入可观测性链路并与请求/租户/任务关联,按此做成本归因与对账,校准客户端估算 ✓ 正确答案
#

10. 为何不能把某个模型的固定上下文窗口长度写入业务规则,能力变化时如何安全迁移

A 上下文窗口是固定常量,可写死
B 上下文窗口是动态能力,应作为能力元数据读取,动态预留并灰度迁移,避免写死导致升级后失效 ✓ 正确答案
C tokenizer 变化不影响窗口使用
D 窗口写死不影响业务
#

11. 如何采集估算 Token 与 Provider 实际 usage 的偏差,并对异常用量、缓存失效和账单漂移告警

A 采集估算与实际 usage 偏差率,对异常用量、缓存命中率骤降、账单漂移设基线告警 ✓ 正确答案
B 估算与实际的偏差无需监控
C 缓存失效不影响成本
D 账单漂移无法检测
#

12. 长会话的累积 usage 与单次请求 usage 之差如何被工程团队误解,应在哪些报表中区分

A 累计 usage 与单次 usage 完全一致
B 会话越长累计与单次越接近
C 长会话逐次请求重复携带历史导致累计 usage 远大于单次,报表应区分请求级/会话级/内容级口径 ✓ 正确答案
D 累计 usage 就是真实内容量
#

13. 为什么离线评估应记录精确 token 计数而非估算,否则难以复现“同样的 Prompt 得到不同质量”的现象

A 离线评估应记录精确 usage 与模型/参数/tokenizer 版本,否则 token 估算误差导致无法复现或归因质量差异 ✓ 正确答案
B 估算 token 足够用于评估复现
C token 估算总是精确
D 评估不用记录模型版本
#

14. Prompt Caching 的前缀命中依赖哪些字节级稳定条件,系统提示、工具定义和动态用户消息应如何分层

A 缓存命中只看语义,字节变化不影响
B 消息顺序不影响缓存
C 动态消息放最前可提高命中
D 缓存命中要求字节级稳定,系统提示/固定工具前置、动态用户消息后置,并保持序列化格式确定 ✓ 正确答案
#

15. 为什么仍要用摘要、检索和上下文压缩控制延迟

A 有 Prompt Caching 就无需控制上下文长度
B 缓存只优化重复前缀,摘要/检索/压缩才能减少送入模型的上下文长度,从而降低 TTFT 与总延迟 ✓ 正确答案
C 上下文长度不影响延迟
D 缓存命中时无需处理上下文
#

16. 如何通过 tokenizer 估算中文、代码和 JSON 的 Token 密度,并把估算误差纳入请求截断策略

A 所有内容类型 token 密度相同
B 估算误差可忽略,无需余量
C 中文/代码/JSON token 密度不同,应分类型估算并保留误差余量,截断前用精确 tokenizer 校验 ✓ 正确答案
D 截断只看字符数
#

17. 缓存读取与缓存写入价格不同的 Provider 环境中,怎样用命中率和复用长度计算真实成本收益

A 缓存一定省钱,命中即可
B 缓存读写价格相同
C 缓存写入价格更高,需按命中率 × 复用长度 × 读写价差计算净收益,决定哪些前缀值得缓存 ✓ 正确答案
D 复用长度不影响缓存收益
#

18. 如何把系统指令、会话历史、RAG 证据、工具结果和输出预留纳入统一 Token 预算,并在超限前降级

A 各部分独立使用窗口,无需预算协调
B 应统一 Token 预算并给各部分分层配额,超限时按优先级降级(先历史/证据),同时保留输出预留 ✓ 正确答案
C 系统指令可被降级丢弃
D 输出无需预留,用完即可
#

19. 多模态请求中图像、音频 token 计费规则不一致时,如何向客户透明展示与对账

A 图像/音频计费规则不同,账单应按模态拆分并注明计价规则,对账也按模态进行归因 ✓ 正确答案
B 所有模态统一一个 token 单价
C 多模态计费无需透明
D 模态对账无法进行
#

20. 如何按输入、输出和缓存命中分别编制 Token 预算

A 输入输出缓存是同一预算
B 输入预算控制上下文、输出预算设 max_tokens 防截断、缓存命中预算评估成本优化,三者分列编制 ✓ 正确答案
C 缓存命中不占窗口也不影响成本
D 输出无需预算
#

21. GPT-5 系列或其他模型更换 tokenizer 后,历史 Token 计费、窗口上限和缓存键兼容性应如何治理

A 旧缓存键可继续命中新 tokenizer
B tokenizer 变更不影响计费与缓存
C tokenizer 变更会改变计费、窗口与缓存键,应把 tokenizer 版本入缓存键、区分计费口径、动态校准窗口并灰度迁移 ✓ 正确答案
D 历史计费无需维护