1. KV Cache 与上下文成本的关系,为什么更长的上下文会显著增加延迟与费用?应用层有哪些控制手段(截断、Prompt Caching、上下文压缩)?
说明 KV Cache 与上下文成本的关系:为什么更长的上下文会显著增加延迟与费用,应用层有哪些控制手段(截断、Prompt Caching、上下文压缩)?
- 理解 KV Cache 与上下文成本
- 理解长上下文的高效/延迟/费用
- 能设计控制手段
关系:模型在生成时需缓存每个 token 的键值(KV Cache),上下文越长,KV Cache 越大、显存占用越多;预填充(prefill)阶段处理长上下文耗时更长(TTFT 高),且长上下文使 KV Cache 更大,显存可能溢出、批处理变慢。费用:更长的输入 token 直接增加 input 计费,且 KV Cache 占用导致并发能力下降。延迟 + 费用 + 显存都随上下文长度增长。应用层控制手段:截断——限制上下文长度,剪掉超长部分;Prompt Caching——缓存重复前缀,降低重复处理成本与延迟;上下文压缩——用摘要/抽取/检索减少送入模型的上下文。三者权衡质量与成本。核心是"长上下文增加 KV Cache/延迟/费用,用截断、缓存、压缩控制上下文长度"。
KV Cache 是"上下文决定显存/延迟/成本"的根源。控制手段本质是"减少送入模型的上下文长度",缓存复用重复部分,压缩/截断去除冗余。