长上下文布局与评估

共 22 题
#

1. Lost-in-the-Middle 为什么使窗口“放得下”不等于模型“用得到”,信息布局如何缓解

A 窗口能放下就一定能用到
B 位置完全不影响模型表现
C 只与窗口大小有关
D 中间信息容易被忽略,物理容量不等于有效利用率,应把关键信息置于高利用率位置并做强调/重组 ✓ 正确答案
#

2. Needle-in-a-Haystack 单针测试有什么局限,如何设计多位置、多干扰和多证据评估

A 只测单个事实回收
B 多位置、多干扰、多证据(多跳拼接)及无针负面用例,并做细粒度切片报告 ✓ 正确答案
C 只加干扰不加位置
D 只报告平均分
#

3. 直接扩展上下文与 RAG 在召回、Token、延迟和新鲜度方面如何比较

A 直接扩展永远优于 RAG
B 两者在新鲜度上无差别
C RAG 永远更准
D 直接扩展 Token 高、召回受位置影响、无检索延迟;RAG Token 省、可实时检索但依赖检索质量,常结合使用 ✓ 正确答案
#

4. 长上下文中“位置偏差”如何用前缀、强调标记、检索式证据重组来缓解,而不是简单改模型

A 重新训练模型
B 用前缀注入、强调标记与检索式证据重组引导注意力,而不改模型 ✓ 正确答案
C 只能改模型,无法工程缓解
D 增加更多噪声
#

5. 稳定前缀、动态会话和工具结果怎样布局以兼顾注意力效果与 KV/Prompt Cache 命中

A 稳定前缀置于最前且保持字节一致以命中 Cache,动态会话与工具结果放其后 ✓ 正确答案
B 动态内容放最前、稳定内容放后
C 动态内容随时插入前缀中间
D 缓存与布局无关
#

6. 长对话摘要如何保留承诺、实体、未完成任务和来源,同时允许回溯原文

A 只保留摘要文本
B 摘要越短越好,无需指针
C 保留承诺、实体、待办与来源,并为每条摘要附原文指针,支持按需回查 ✓ 正确答案
D 丢弃所有原文
#

7. Prompt Cache 命中率的可观测性(Provider 返回的缓存读写 token)如何与计费、延迟的实际影响测量绑定,缓存未达预期命中如何归因

A 前缀字节发生变化(如动态内容插入稳定前缀),导致缓存 key 不一致 ✓ 正确答案
B 缓存随机失效
C 与模型无关
D 命中率无法观测
#

8. 上下文冲突时怎样使用来源、时间和权威级别,而不是依赖消息位置偶然决定

A 依据来源、时间与权威级别等显式属性综合排序,并显式说明采用理由 ✓ 正确答案
B 依据消息位置先后
C 随机选一条
D 只按时间,最新即正确
#

9. 多证据冲突时,模型为什么倾向权威而非时间或相关性,业务规则如何强制重排

A 用业务规则显式定义优先级(如实时优先、最近确认优先),在代码层重排证据并加标记 ✓ 正确答案
B 完全信任模型默认的权威优先
C 永远以最新为准,忽略权威
D 让模型自行任意选择
#

10. 长上下文摘要应保留哪些最小事实元素(实体、承诺、未完成任务、来源)

A 实体
B 承诺与未完成任务
C 来源
D 无关的闲聊细节 ✓ 正确答案
#

11. 如何衡量长上下文窗口的真实利用率(被引用证据位置、被忽略段落、错误归因)

A 只看窗口是否装满
B 只看 Token 总数
C 被引用证据的位置分布、被忽略段落占比、错误归因率 ✓ 正确答案
D 只看回答长度
#

12. 直接扩展上下文与 RAG 在成本、延迟、隐私和新鲜度上如何组合使用而非二选一

A 必须二选一
B 组合使用:稳定内容走扩展/缓存,海量实时敏感内容走 RAG 受控注入,兼顾成本、延迟、隐私与新鲜度 ✓ 正确答案
C 扩展永远替代 RAG
D RAG 永远替代扩展
#

13. 如何防止长上下文中混入的旧指令覆盖新系统 Prompt,建立指令优先级机制

A 把所有内容按时间顺序原样混排
B 让新指令决定一切
C 建立指令层级,系统 Prompt 置顶且稳定,外部内容标记为数据而非指令,并做注入防护 ✓ 正确答案
D 忽略系统 Prompt
#

14. 公开长上下文最佳实践变化时,为什么要按 一手资料核查并用自有数据复验

A 追一手资料核查来源与适用性,再用自有数据复验其在你场景下是否有效 ✓ 正确答案
B 直接照搬二手教程
C 只信博客转载
D 通用结论适用于所有场景
#

15. 长上下文场景如何设计离线评测集,覆盖多位置、多证据、跨段落和带噪声干扰

A 只测单位置单证据
B 多位置、多证据、跨段落、带噪声干扰,及无答案负面用例,并分维度评分 ✓ 正确答案
C 只测带噪声
D 只测长文本长度
#

16. “Lost in the Middle”在不同模型与注意力实现下表现是否一致,应用应如何复测

A 不同模型与注意力实现下位置偏差不同,应在目标模型上重测位置-召回曲线并据此定制布局 ✓ 正确答案
B 所有模型完全一致
C 位置偏差只与输入长度有关
D 无需复测,结论通用
#

17. 长上下文窗口扩大时,工程上如何权衡推理成本、显存和 KV Cache 复用的实际收益

A 无条件扩大窗口
B 用边际收益衡量"质量增益 vs 推理成本+显存+缓存管理成本",并用前缀缓存控制成本 ✓ 正确答案
C 只考虑显存
D 窗口扩大免费
#

18. 长上下文与传统多轮 Session 的边界如何划分,长文档一次性送入与会话分段总结如何取舍

A 按文档长度、跨段关联需求、成本与延迟权衡,常以"分段总结+关键段按需全量"组合 ✓ 正确答案
B 一律一次性送入
C 一律分段总结
D 两者效果相同
#

19. 长时间运行或超长上下文的 Agent 中,早期系统约束被后续内容稀释的 context rot 应如何测量(关键约束复现率随上下文距离的衰减曲线、指令服从率监控),缓解手段(约束固定位置周期性重注入、约束外置为规则/工具层、定期刷新摘要)应如何验证有效

A 用关键约束复现率衰减曲线与指令服从率监控,对比缓解手段施加前后的指标 ✓ 正确答案
B 凭主观判断
C 只看会话长度
D 无需测量
#

20. 长上下文评估报告如何按证据位置、干扰段落数量做切片视图,定位窗口利用率的真实瓶颈

A 按证据位置、干扰数量、跳数等维度做切片视图,定位最差切片与成因 ✓ 正确答案
B 只报告平均分
C 只看最高分
D 无需维度分析
#

21. RULER、LongBench 等公开基准对应用选型的参考价值与局限是什么,为什么必须用自有任务复验

A 基准分高即可直接选型
B 基准无需参考
C 公开基准用于初筛与横向对比,但必须用自有任务复验才能定稿 ✓ 正确答案
D 自有任务与基准等价
#

22. 多轮长会话状态追踪评估(LongMemEval 类)如何应用于 Agent 场景,衡量 N 轮后关键事实是否仍可召回

A 只测窗口内召回
B 在多轮任务早期注入关键事实,测 N 轮后经记忆机制是否仍可召回,并按记忆类型与距离切片 ✓ 正确答案
C 不测多轮
D 只测单轮