# 1. 一次错误回答如何被拆解为查询理解、召回、重排、上下文组装或生成阶段故障 A 错误回答只能靠人工重跑排查 B 应通过每阶段的输入输出轨迹与环节指标定位故障层,用消融实验确认根因,并把归因标签纳入评估体系 ✓ 正确答案 C 查询理解错误与召回错误无法区分 D 证据齐全时答案错误一定是检索问题
# 2. 如何从生产查询分层采样并构造相关性标注,避免评估集只包含容易问题 A 人工构造的查询足以代表线上分布 B 失败样本不适合进评估集 C 应从生产日志按频次、难度、失败样本与类型分层采样,并验证评估集分布与生产一致,避免只含容易问题 ✓ 正确答案 D 长尾查询无需纳入评估集
# 3. Recall@K、MRR 与 NDCG 分别衡量什么,哪些指标更关注首个相关结果或整体排序 A MRR 关注所有相关结果的整体排序 B NDCG 只需要二元相关度 C Recall@K 对排序位置敏感 D Recall@K 衡量覆盖率、MRR 关注首个相关结果位置、NDCG 衡量整体排序质量,RAG 召回看 Recall、重排看 NDCG 并组合观察 ✓ 正确答案
# 4. RAG 评估的“金标准集”应如何构建,从生产 query 抽样 vs 人工构造 vs 公开数据集,各自偏差与成本如何 A 公开数据集是最佳金标准,因为它有公认基线 B 人工构造的查询与真实用户分布完全一致 C 金标准集应以生产抽样为主、人工构造覆盖边界、公开集做横向基线,分别报告指标并版本化管理 ✓ 正确答案 D 生产抽样不受现有系统影响
# 5. RAG 失败案例归因(检索失败、重排失败、生成失败)应如何建立标准化日志格式与排查流程 A 失败样本无需进入评估集 B 失败归因靠经验即可,无需日志 C 归因标签只需要一级分类 D 应建立覆盖各阶段的标准化归因日志与分类体系,自动归因聚类后人工复核,修复动作绑定标签并更新失败模式库 ✓ 正确答案
# 6. 答案忠实度、相关性、完整性和引用正确性应如何定义 rubric 并与检索指标关联 A 答案质量维度无法定义可执行标准 B 忠实度、相关性、完整性与引用正确性应定义带锚点的 rubric,并通过归因矩阵把答案指标与检索指标关联定位瓶颈 ✓ 正确答案 C 忠实度与检索质量无关 D 引用正确性不需要纳入评估
# 7. 线上应如何监控零结果率、低分结果、错误引用、索引新鲜度、P95 延迟和权限拒绝 A 应分层监控零结果率、低分结果、错误引用、索引新鲜度、P95 延迟与权限拒绝,按阈值分级告警并自动降级处置 ✓ 正确答案 B 错误引用无法在线监控 C 只需监控延迟即可保证 RAG 质量 D 权限类指标可以低优先级
# 8. 如何通过检索结果可视化、分数分布和过滤条件回放定位召回突然下降 A 召回下降只能等用户反馈才发现 B 分数分布不会变化 C 过滤条件回放无法定位权限变更问题 D 应通过检索结果可视化对比、分数分布分析与过滤条件回放定位根因,前提是日志保留完整检索参数与版本信息 ✓ 正确答案
# 9. Embedding 模型评估(双塔相似度)能否预测 RAG 端到端效果,二者相关性如何 A 双塔指标可用于快速筛选模型,但当瓶颈转移到重排或生成时二者脱钩,需用传导分析与端到端门禁做最终裁决 ✓ 正确答案 B 双塔相似度分数直接决定 RAG 端到端质量 C 检索指标与端到端指标永远强相关 D 提升 Embedding 一定能提升答案质量
# 10. RAG 索引重建(reindex)应如何灰度进行,避免新索引与旧索引结果差异引发线上问题 A 索引重建可以直接全量切换 B 重建期间无需处理增量更新 C 重建应经影子对比量化新旧差异、小流量阶梯灰度、预设回退条件并保留旧索引,灰度期间监控质量与业务指标 ✓ 正确答案 D 新旧索引结果差异无需关注
# 11. LLM-as-Judge 评估 RAG 答案时,如何避免 Judge 偏好“看似合理”的长答案而非真正正确的答案 A Judge 存在长度、风格与位置偏好,应用强 rubric、对照评分与因素解耦缓解,并要求输出证据化核对与人工一致性校准 ✓ 正确答案 B Judge 分数无需与人工标注对齐 C 长答案天然更值得高分 D LLM-as-Judge 的评分是客观公正的
# 12. 索引损坏或回填失败时,如何校验文档数、版本、水位和删除墓碑并安全重建 A 检测到索引异常直接全量重建即可 B 回填失败无需检测,重跑一遍即可 C 应先校验文档数、版本、水位与墓碑定位损坏范围,隔离重建后跑校验与基线对比,再灰度切换并追平增量 ✓ 正确答案 D 重建期间无需考虑线上增量
# 13. 怎样比较 RAG 与直接塞入长上下文的质量、延迟、Token 成本和维护复杂度 A 应从质量、延迟、Token 成本与维护复杂度四维对比,结论取决于文档规模与查询类型,小语料低频可直塞、大语料高频 RAG 占优、可混合 ✓ 正确答案 B RAG 与长上下文是互斥方案 C 全文塞入没有延迟代价 D 长上下文方案在所有场景都优于 RAG
# 14. RAG 评估集是否应包含“答案不确定”样本,如何定义与标注 A 不确定样本无法标注 B 评估集只需包含有确定答案的样本 C 系统拒答越多说明质量越高 D 评估集应包含无答案、证据不足与冲突型样本,标注预期行为并分组报告拒答正确率与硬答率,防止"全拒答得高分"的失真 ✓ 正确答案
# 15. RAG 系统的红队测试(注入错误文档、矛盾文档)应包含哪些典型对抗样本 A RAG 红队只需测提示注入一种攻击 B 矛盾文档不是对抗样本 C 红队样本应混入主评估集统一评分 D 红队样本应覆盖错误文档、矛盾文档、提示注入、越权与边界刁钻查询,按预期防御行为自动判定并纳入回归 ✓ 正确答案
# 16. 为何 RAG 系统的“端到端延迟”P99 应单独监控,不能只看平均延迟 A 平均延迟足以反映 RAG 用户体验 B 缓存命中率不影响延迟分布 C P99 恶化时平均值一定同时恶化 D RAG 延迟右偏严重,平均延迟会掩盖长尾劣化,应分层监控端到端 P99 与分段 P99 并针对性优化长尾来源 ✓ 正确答案
# 17. RAG 答案幻觉应如何通过引用支持率、句级 NLI 对齐自动定位,而不是只看人工抽样 A 幻觉只能靠人工抽检发现 B 应用引用支持率、句级 NLI 对齐与事实抽取自动检测幻觉,低支持率触发降级或重生成,并区分无据率与错误率 ✓ 正确答案 C NLI 对所有句子都能准确判断 D 幻觉检测结果无需进入评估指标
# 18. 长文档 RAG(PDF、技术手册)评估如何避免段落命中但答案错误,需要哪些切片级指标 A 检索命中关键段落即说明答案正确 B 长文档评估需用断言级支持、证据完整性与定位率等切片级指标,区分单块与跨块支持,避免段落命中掩盖答案错误 ✓ 正确答案 C 跨段信息依赖不影响答案质量 D 父子分块扩展无法提升长文档答案质量
# 19. 检索器版本升级后未触发告警但 Recall@10 下降 3%,如何用影子流量和回放快速诊断根因 A 应通过影子流量对比新旧检索器结果、按查询特征聚类下钻、回放参数定位根因,修复后回归验证并加分桶监控 ✓ 正确答案 B 指标下降 3% 无需处理 C 静默退化无法定位 D 升级无需保留版本信息
# 20. RAG 引用归因应在答案生成阶段做哪些硬约束,软提示为什么不足以保证可追溯 A 提示词里要求"引用来源"即可保证可追溯 B 软提示会被模型忽略且易产生编号幻觉,需用编号白名单、结构化输出与句级绑定等硬约束并后置校验 ✓ 正确答案 C 模型不会编造引用编号 D 硬约束必然降低答案质量
# 21. 用户反馈答案正确但回答过时时,应如何在评估指标中分离新鲜度与相关性 A 应定义时效敏感问题、单独标注与计算新鲜度指标(过期引用率、当前有效值率),并归因到数据/检索/生成侧修复 ✓ 正确答案 B 过时与错误是同一类问题 C 答案内容正确就无需关注是否过时 D 新鲜度无法评估
# 22. RAG 评估集应如何按业务季节性更新,避免去年评估分数仍高但实际已退化 A 评估集建好后可以长期使用 B 评估集应按业务季节滚动重采样、保留旧集做回归与双轨报告,用分布漂移检测与在线轻量集防止分数虚高 ✓ 正确答案 C 季节性样本不需要单独覆盖 D 跨版本指标可以直接比较
# 23. RAG 离线指标提升但线上用户反馈变差时,应如何识别是 query 分布漂移还是评测集偏差 A 反馈变差只能从生成侧找原因 B 离线指标提升必然带来线上反馈变好 C 评测集偏差不影响离线指标 D 应通过线上分布与评估集分布对比、分层验证与差反馈查询归因,区分分布漂移与评测集偏差,先重建评估集再优化系统 ✓ 正确答案
# 24. RAG 评估流水线如何在 CI 中跑通并对 PR 自动打分,应设置哪些硬性门禁 A RAG 质量无法在 CI 中自动验证 B 门禁应只测延迟指标 C CI 评估应用固定评估子集对 PR 自动打分,与基线对比设置回归与安全零容忍门禁,并用固定种子保证可复现 ✓ 正确答案 D CI 评估集不需要更新
# 25. RAG 评估报告中不可评估样本(拒答、无引用)应如何分类与归因以避免污染指标 A 拒答样本应从评估中剔除且不影响结论 B 拒答、无引用等不可评估样本应按类型细分并归因,分层报告误拒率、无引用率等,防止静默排除污染指标 ✓ 正确答案 C 无引用答案无需扣分 D 解析失败样本直接丢弃即可
# 26. RAG 评估结果按用户角色分层后为何常常掩盖小群体问题,应如何补充切片视图 A 整体指标达标说明所有用户群都满意 B 小群体问题会被占比稀释与抽样不足掩盖,应按业务影响设计多维切片、展示最差切片清单并设置独立 SLO 与长尾告警 ✓ 正确答案 C 角色分层已经足够细 D 小群体不需要单独关注
# 27. RAG 评估指标看板为何应同时展示绝对值与相对基线差值,单一指标容易误导 A 看板只需展示指标绝对值 B 看板应同时展示绝对值与相对基线差值,标注评估集版本分割线,按切片展示差值并关联变更归因,防止单一指标误导 ✓ 正确答案 C 差值不受基线质量影响 D 指标绝对值跨版本可比
# 28. A/B 测试中检索参数(k、阈值、rerank 开关)应如何最小化实验单元并控制假阳性 A 检索参数实验可用查询级单元与正交设计提升效率,用多重比较校正与预注册假设控制假阳性,离线先筛线上少验 ✓ 正确答案 B 多组对比无需显著性校正 C 检索参数实验必须用用户级实验单元 D 实验后挑显著的指标汇报即可
# 29. RAG 系统 A/B 实验需要多少流量才能稳定测出 1-2% 的指标差异,实验周期如何规划 A 任何 A/B 实验跑一周就一定有效 B 实验时长只取决于流量大小 C 样本量由 MDE、方差与显著性决定,需覆盖完整业务周期、预留缓冲并预设提前终止规则,用置信区间报告效果 ✓ 正确答案 D 看到显著即可随时终止实验
# 30. 多语言 RAG(中文+英文)评估如何避免翻译带来的偏差 A 把答案翻译成统一语言评估即可 B 语言样本比例不影响评估结论 C 翻译不会改变答案内容 D 多语言评估应保持评估语言与答案语言一致、基于原文标注与评分,用术语表约束与母语评审,并按语言分层报告 ✓ 正确答案
# 31. 多模态(图、文、表)RAG 评估应如何构造图文交错相关性标注与归因,避免视觉主导偏差 A 图文交错样本无需标注 B 图看起来相关就应标注为相关证据 C 应构造图文交错的证据单元样本、分离视觉与数值核对、做模态级归因与分层指标,防止视觉主导评估偏差 ✓ 正确答案 D 视觉显著性不影响标注
# 32. RAG 评估日志应如何支持按时间窗重放,构建短期 A/B 与长期趋势双视图 A 评估日志只需记录查询与答案 B 评估日志应记录完整参数与版本快照,支持按时间窗回放构建短期 A/B 与长期趋势双视图,并校验重放一致性 ✓ 正确答案 C 重放结果不需要与原始日志一致 D 版本快照对回放没有意义
# 33. Ragas、ARES、TRACIE、LangSmith 评估 RAG 时各侧重哪些维度,企业自建评估应如何取舍 A 评估集构建由框架自动完成 B 所有评估框架的功能完全相同 C 自建评估只需调用开源框架 D Ragas 重指标、ARES 重评估器可信度、TRACIE 重轨迹归因、LangSmith 重工程集成,应按评估对象与资源组合选型,自建核心是评估集 ✓ 正确答案