# 1. Lost-in-the-Middle 为什么使窗口“放得下”不等于模型“用得到”,信息布局如何缓解 A 窗口能放下就一定能用到 B 位置完全不影响模型表现 C 只与窗口大小有关 D 中间信息容易被忽略,物理容量不等于有效利用率,应把关键信息置于高利用率位置并做强调/重组 ✓ 正确答案
# 2. Needle-in-a-Haystack 单针测试有什么局限,如何设计多位置、多干扰和多证据评估 A 只测单个事实回收 B 多位置、多干扰、多证据(多跳拼接)及无针负面用例,并做细粒度切片报告 ✓ 正确答案 C 只加干扰不加位置 D 只报告平均分
# 3. 直接扩展上下文与 RAG 在召回、Token、延迟和新鲜度方面如何比较 A 直接扩展永远优于 RAG B 两者在新鲜度上无差别 C RAG 永远更准 D 直接扩展 Token 高、召回受位置影响、无检索延迟;RAG Token 省、可实时检索但依赖检索质量,常结合使用 ✓ 正确答案
# 4. 长上下文中“位置偏差”如何用前缀、强调标记、检索式证据重组来缓解,而不是简单改模型 A 重新训练模型 B 用前缀注入、强调标记与检索式证据重组引导注意力,而不改模型 ✓ 正确答案 C 只能改模型,无法工程缓解 D 增加更多噪声
# 5. 稳定前缀、动态会话和工具结果怎样布局以兼顾注意力效果与 KV/Prompt Cache 命中 A 稳定前缀置于最前且保持字节一致以命中 Cache,动态会话与工具结果放其后 ✓ 正确答案 B 动态内容放最前、稳定内容放后 C 动态内容随时插入前缀中间 D 缓存与布局无关
# 6. 长对话摘要如何保留承诺、实体、未完成任务和来源,同时允许回溯原文 A 只保留摘要文本 B 摘要越短越好,无需指针 C 保留承诺、实体、待办与来源,并为每条摘要附原文指针,支持按需回查 ✓ 正确答案 D 丢弃所有原文
# 7. Prompt Cache 命中率的可观测性(Provider 返回的缓存读写 token)如何与计费、延迟的实际影响测量绑定,缓存未达预期命中如何归因 A 前缀字节发生变化(如动态内容插入稳定前缀),导致缓存 key 不一致 ✓ 正确答案 B 缓存随机失效 C 与模型无关 D 命中率无法观测
# 8. 上下文冲突时怎样使用来源、时间和权威级别,而不是依赖消息位置偶然决定 A 依据来源、时间与权威级别等显式属性综合排序,并显式说明采用理由 ✓ 正确答案 B 依据消息位置先后 C 随机选一条 D 只按时间,最新即正确
# 9. 多证据冲突时,模型为什么倾向权威而非时间或相关性,业务规则如何强制重排 A 用业务规则显式定义优先级(如实时优先、最近确认优先),在代码层重排证据并加标记 ✓ 正确答案 B 完全信任模型默认的权威优先 C 永远以最新为准,忽略权威 D 让模型自行任意选择
# 11. 如何衡量长上下文窗口的真实利用率(被引用证据位置、被忽略段落、错误归因) A 只看窗口是否装满 B 只看 Token 总数 C 被引用证据的位置分布、被忽略段落占比、错误归因率 ✓ 正确答案 D 只看回答长度
# 12. 直接扩展上下文与 RAG 在成本、延迟、隐私和新鲜度上如何组合使用而非二选一 A 必须二选一 B 组合使用:稳定内容走扩展/缓存,海量实时敏感内容走 RAG 受控注入,兼顾成本、延迟、隐私与新鲜度 ✓ 正确答案 C 扩展永远替代 RAG D RAG 永远替代扩展
# 13. 如何防止长上下文中混入的旧指令覆盖新系统 Prompt,建立指令优先级机制 A 把所有内容按时间顺序原样混排 B 让新指令决定一切 C 建立指令层级,系统 Prompt 置顶且稳定,外部内容标记为数据而非指令,并做注入防护 ✓ 正确答案 D 忽略系统 Prompt
# 14. 公开长上下文最佳实践变化时,为什么要按 一手资料核查并用自有数据复验 A 追一手资料核查来源与适用性,再用自有数据复验其在你场景下是否有效 ✓ 正确答案 B 直接照搬二手教程 C 只信博客转载 D 通用结论适用于所有场景
# 15. 长上下文场景如何设计离线评测集,覆盖多位置、多证据、跨段落和带噪声干扰 A 只测单位置单证据 B 多位置、多证据、跨段落、带噪声干扰,及无答案负面用例,并分维度评分 ✓ 正确答案 C 只测带噪声 D 只测长文本长度
# 16. “Lost in the Middle”在不同模型与注意力实现下表现是否一致,应用应如何复测 A 不同模型与注意力实现下位置偏差不同,应在目标模型上重测位置-召回曲线并据此定制布局 ✓ 正确答案 B 所有模型完全一致 C 位置偏差只与输入长度有关 D 无需复测,结论通用
# 17. 长上下文窗口扩大时,工程上如何权衡推理成本、显存和 KV Cache 复用的实际收益 A 无条件扩大窗口 B 用边际收益衡量"质量增益 vs 推理成本+显存+缓存管理成本",并用前缀缓存控制成本 ✓ 正确答案 C 只考虑显存 D 窗口扩大免费
# 18. 长上下文与传统多轮 Session 的边界如何划分,长文档一次性送入与会话分段总结如何取舍 A 按文档长度、跨段关联需求、成本与延迟权衡,常以"分段总结+关键段按需全量"组合 ✓ 正确答案 B 一律一次性送入 C 一律分段总结 D 两者效果相同
# 19. 长时间运行或超长上下文的 Agent 中,早期系统约束被后续内容稀释的 context rot 应如何测量(关键约束复现率随上下文距离的衰减曲线、指令服从率监控),缓解手段(约束固定位置周期性重注入、约束外置为规则/工具层、定期刷新摘要)应如何验证有效 A 用关键约束复现率衰减曲线与指令服从率监控,对比缓解手段施加前后的指标 ✓ 正确答案 B 凭主观判断 C 只看会话长度 D 无需测量
# 20. 长上下文评估报告如何按证据位置、干扰段落数量做切片视图,定位窗口利用率的真实瓶颈 A 按证据位置、干扰数量、跳数等维度做切片视图,定位最差切片与成因 ✓ 正确答案 B 只报告平均分 C 只看最高分 D 无需维度分析
# 21. RULER、LongBench 等公开基准对应用选型的参考价值与局限是什么,为什么必须用自有任务复验 A 基准分高即可直接选型 B 基准无需参考 C 公开基准用于初筛与横向对比,但必须用自有任务复验才能定稿 ✓ 正确答案 D 自有任务与基准等价
# 22. 多轮长会话状态追踪评估(LongMemEval 类)如何应用于 Agent 场景,衡量 N 轮后关键事实是否仍可召回 A 只测窗口内召回 B 在多轮任务早期注入关键事实,测 N 轮后经记忆机制是否仍可召回,并按记忆类型与距离切片 ✓ 正确答案 C 不测多轮 D 只测单轮