RAG 评估工具

共 52 题
#

1. 同一指标在不同工具间定义不一致时,怎样建立内部统一语义和黄金样本

A 指标名相同语义必然相同
B 建立内部指标字典与黄金样本,校准各工具实现,保证跨工具可比 ✓ 正确答案
C 直接比较各工具分数即可
D 黄金样本只用于训练
#

2. LLM-as-Judge 评估 RAG 时如何防止 Judge 受“检索结果不全”影响而误判(应区分检索失败与生成失败)

A 答案不好就是生成失败
B 分阶段评估检索与生成,让 Judge 同时见上下文与答案,区分检索失败与生成失败 ✓ 正确答案
C 检索失败无法判断
D Judge 无需知道上下文
#

3. Agentic RAG(多步检索、查询改写循环)如何做轨迹级评估,中间检索步失败时如何归因到改写错误、召回缺失还是证据弃用

A 只看最终答案
B 检索失败无法归因
C 记录并评估每步,区分改写错误、召回缺失与证据弃用三类失败 ✓ 正确答案
D 只需评估检索质量
#

4. 评估集数据污染与泄露如何检测(线上日志回流样本与评测集重复、评测题混入知识库),评估集与生产数据的隔离流程应如何建立

A 数据污染不影响评估
B 污染无法检测
C 评测集可以与知识库混用
D 用相似度扫描检测污染,并建立评测集与训练/知识库隔离和回流去重流程 ✓ 正确答案
#

5. RAG 评估应如何同时检查“引用准确性”(每条断言都有出处)

A 只需确认答案有引用即可
B 引用只是装饰
C 拆解断言并验证每条断言被引用来源支持,同时检查无引用断言占比 ✓ 正确答案
D 无法验证引用真实性
#

6. 线上 RAG 的指标监控(引用支持率、零结果率、低分率)与离线评估指标应如何对比对齐

A 线上与离线指标完全无关
B 离线评估无用
C 只监控线上即可
D 建立同构映射、用同批样本验证一致性、badcase 回流,让线上发现与离线定位互补 ✓ 正确答案
#

7. RAG 评估集应包含多少“故意为难”的样本(拼写错误、模糊问题、跨语言)

A 困难样本应占 100%
B 拼写错误无需测试
C 困难样本只用于训练
D 困难样本占一定比例并单独分层报告,按风险类别覆盖,与正常样本平衡 ✓ 正确答案
#

8. 为何必须按官方文档核查评估工具版本和能力,而不能依赖旧教程

A 旧教程足够可靠
B 工具版本差异不影响评估
C 以官方文档核查当前版本的能力与指标定义,并记录工具版本保证可复现 ✓ 正确答案
D 无需关注 changelog
#

9. 如何把评估失败样本自动归档、聚类并转化为可审查的回归用例

A 自动归档、聚类、去重后转化为回归用例,并生成失败报告供审查 ✓ 正确答案
B 失败样本应丢弃
C 聚类无用
D 失败样本无需打标
#

10. 为什么不能完全依赖评估工具的“分数”,必须配合人工抽样与业务指标

A 完全信任工具分数
B 人工抽样是多余的
C 工具分数是代理指标,必须配合人工抽样与业务指标多信号验证 ✓ 正确答案
D 业务指标无法用于验证
#

11. 评估失败样本的聚类(按主题、长度、来源)应如何自动提示优化方向(改 Prompt、改检索、改模型)

A 所有失败都改 Prompt
B 检索失败改检索、忠实度失败改生成/模型、格式失败改 Prompt,按聚类归因 ✓ 正确答案
C 失败无法归因
D 聚类只用于报告
#

12. RAG 评估的可视化(指标雷达图、错误分布)应如何在团队周会与发布评审中使用

A 可视化只是装饰
B 发布评审不需要看评估
C 可视化不能驱动决策
D 雷达图看整体、错误分布看焦点、趋势图看漂移,支持周会排期与发布评审门禁 ✓ 正确答案
#

13. 发现评估集已被污染后,历史评估结论的可信度应如何重估,基线如何重建

A 历史结论直接作废即可
B 无需重建基线
C 污染不影响历史结论
D 定位污染范围、量化影响、用干净集重算并重建基线,同时建立防污染机制 ✓ 正确答案
#

14. RAG 评估的 Faithfulness、Answer Relevance、Context Precision 与 Citation Correctness 是相关但不同的信号——当 Faithfulness 上升而 Context Precision 下降时,常见的故障模式有哪些(如检索改写导致上下文更短、模型更“自信”但遗漏细节)

A 生成质量全面变好
B 指标互相矛盾无意义
C 检索完全正常
D 检索上下文变短/覆盖下降,模型更忠实但遗漏相关细节 ✓ 正确答案
#

15. Online-to-offline 反馈回归,生产中用户 thumbs-down 上升但离线评估集分数未变时,应如何从 trace 采样、流量切片和 evaluator 时效性三个维度定位根因——是 prompt drift、流量结构变化,还是 judge 模型本身过期

A 离线分数不变说明没问题
B thumbs-down 上升是噪声无需处理
C 只看整体指标即可
D 从 trace 采样、流量切片与 evaluator 时效性三个维度定位,并回填 badcase 更新离线集 ✓ 正确答案
#

16. 为什么每套 RAG eval suite 必须有版本化的 golden dataset 绑定到具体 commit,且当底层 embedding 模型升级时数据集应如何迁移(re-embed 后对齐、人工 spot-check 重标、并保留旧版本作为可比基线)

A golden dataset 无需版本化
B 版本化绑定 commit 保证可复现,embedding 升级时 re-embed、重标并保留旧基线对比 ✓ 正确答案
C embedding 升级无需处理
D 旧基线应删除
#

17. 影子流量如何保证输入可比且不产生副作用,怎样评估候选版本质量与延迟

A 影子请求会返回给用户
B 影子可执行写操作
C 影子接收真实输入但只读不产生副作用,平行对比候选与线上的质量与延迟 ✓ 正确答案
D 影子流量是随机输入
#

18. 哪些安全、格式、任务成功和延迟指标应成为阻断发布的硬门槛

A 所有指标都应作硬门槛
B 安全指标可放宽
C 延迟不构成门槛
D 安全、格式、任务成功、延迟四类硬性指标作阻断门槛,软指标持续优化 ✓ 正确答案
#

19. 关键业务为何仍需人工抽检,怎样设计风险分层采样而不是均匀随机

A 均匀随机采样最优
B 人工抽检无需设计
C 按风险分层采样,高风险全量或高比例抽检,低风险低比例,聚焦高风险 ✓ 正确答案
D 低风险样本应优先抽检
#

20. 灰度期间流量结构不一致(新旧用户差异)如何用协变量调整(CUPED)

A 用实验前协变量做回归校正,剥离流量结构差异,降低方差提高对比公平性 ✓ 正确答案
B 直接对比即可,无需调整
C CUPED 无法处理流量差异
D 协变量调整会使结果失真
#

21. 上线门禁(release gate)应包含哪些硬指标,任务成功率、P95 延迟、引用支持率、安全分类通过率

A 门禁只包含延迟
B 门禁只是参考
C 安全指标不列入门禁
D 门禁含任务成功率、P95 延迟、引用支持率、安全通过率,任一不达标即阻断发布 ✓ 正确答案
#

22. 用户反馈(点赞、点踩、编辑)应如何降噪并与评估指标对齐,避免“多数人偏好不等于正确”

A 用户反馈就是正确性真相
B 降噪并与评估对齐,区分偏好与正确性,用权威标注判断正确性 ✓ 正确答案
C 无需降噪
D 多数人偏好必然正确
#

23. 灰度期间用户群和流量结构不一致时,如何校正质量与成本比较

A 直接对比即可
B 分层对比、协变量调整、标准化加权,剥离流量结构差异,保证质量与成本可比 ✓ 正确答案
C 流量结构不影响对比
D 成本无需校正
#

24. 上线后怎样将投诉、编辑和人工接管样本回流,而不把噪声直接当作正确标签

A 投诉/编辑/接管样本经过滤、去重、聚类、人工复核后才作为标签回流 ✓ 正确答案
B 所有反馈直接作为标签
C 噪声无需过滤
D 人工接管是弱信号
#

25. 为什么“看上去变好”不一定是真变好,如何设置反向指标(用户主动取消、客服投诉)

A 只需看正向指标
B 设置用户取消、投诉、编辑等反向指标作护栏,与正向指标联合判断防误判 ✓ 正确答案
C 反向指标无意义
D 正向指标提升必然真实改善
#

26. 影子流量的结果对比应使用哪些指标(任务成功率、引用准确率、用户满意度)

A 用任务成功率、引用准确率、满意度代理(Judge/人工)等对比候选与线上 ✓ 正确答案
B 影子流量无法评估质量
C 只需看延迟
D 满意度需真实用户反馈
#

27. 灰度发布中的“流量切换”是按用户、按请求还是按租户,各适合什么场景

A 所有情况都按请求
B 对话类按用户保一致、无状态批量按请求、多租户隔离按租户,按场景选择 ✓ 正确答案
C 按租户适用于所有场景
D 流量粒度无关紧要
#

28. Agent 长任务(如编码、深度调研)的灰度验证为何比短对话更困难,应如何设计对照实验

A 与短对话验证相同
B 只需看最终答案
C 长任务无法验证
D 用影子/沙箱防副作用、任务级指标评估、先验组件再端到端,长周期对照 ✓ 正确答案
#

29. 上线后监控的“用户接管率”应如何归因(是工具不够好、Prompt 不清晰、还是 UI 问题)

A 接管率上升就是 AI 能力不足
B 结合会话内容、工具能力、Prompt 质量与 UI 路径分层归因 ✓ 正确答案
C 接管率与 UI 无关
D 无法归因
#

30. Prompt 变更的 CI 评估门禁(eval gate)应如何设定分数下降阻断阈值,flaky 评估如何用重跑策略与统计阈值防止阻塞合法合并

A 单次失败即阻断
B 重跑会掩盖真实问题
C 无需阈值
D 设相对基线容差与绝对下限,用重跑策略与统计显著性过滤 flaky,不放过大回归也不阻塞合法 PR ✓ 正确答案
#

31. 多模型并存分流场景下,如何保证同一用户跨会话的模型版本一致性(粘性路由、版本快照),版本过渡期命中旧版本的用户如何处理

A 用户每次请求随机路由即可
B 版本一致性无关紧要
C 用粘性路由与版本快照保证同一用户跨会话一致,过渡期平滑迁移并监控反馈 ✓ 正确答案
D 旧版本用户应强制切换
#

32. 紧急回滚触发后,已经执行的有副作用工具调用如何补偿和撤销

A 副作用可自动撤销
B 副作用无法补偿
C 回滚无需处理副作用
D 用幂等键定位副作用、补偿队列执行反向补偿、人工介入不可逆操作 ✓ 正确答案
#

33. 用户粘性路由规则本身的灰度切换与效果隔离如何做,防止同一用户被频繁切换模型导致体验断裂

A 粘性绑定、切换阈值、冷却期、会话内一致,规则变更灰度化并效果隔离 ✓ 正确答案
B 频繁切换以追求最优
C 同会话可任意切换
D 无需冷却期
#

34. Ragas 的 Faithfulness、Answer Relevancy、Context Precision 和 Context Recall 分别定位哪类问题

A 四个指标都测生成质量
B 单一指标即可
C Context Recall 测生成幻觉
D Faithfulness 测幻觉、Answer Relevancy 测相关性、Context Precision 测噪声、Context Recall 测遗漏 ✓ 正确答案
#

35. TruLens groundedness、context relevance 与 OpenTelemetry trace 如何关联一次 RAG 运行

A 两者无法关联
B trace 只记录延迟
C 评估无需关联 trace
D 用 trace ID 绑定评估结果,在 trace 上附加评估 span,实现一次运行的可观测与质量评估 ✓ 正确答案
#

36. DeepEval 的 Pytest 集成、G-Eval/DAG/QAG 指标怎样进入 CI,如何控制 Judge 波动

A G-Eval 分数完全确定
B 单次评分即可 gate
C 用 pytest 集成进 CI,固定温度、阈值容差、重跑与统计阈值控制 Judge 波动 ✓ 正确答案
D 无需 guardrail 兜底
#

37. Ragas 的 Context Precision、Context Recall、Faithfulness、Answer Relevancy 在生产中应如何联合解读,单一指标为何不可信

A 联合解读检索-生成链条,识别噪声、遗漏、幻觉、相关性,单一指标会掩盖其他环节退化 ✓ 正确答案
B 单一指标即可判断
C 指标无需联合
D Faithfulness 高即代表整体好
#

38. DeepEval 的 G-Eval、DAG、QAG 指标适合哪类任务,与人工评分的相关性如何验证

A 所有指标适用所有任务
B 无需验证相关性
C G-Eval 适主观评分、DAG 适判定、QAG 适问答,用与人工评分相关性验证有效性 ✓ 正确答案
D 相关性低也可信
#

39. Phoenix Evals 与 OpenInference 的关系是什么,何时适合在 notebook 中探索 bad case

A OpenInference 是 GenAI 可观测性标准,Phoenix 消费它做评估与 bad case 探索 ✓ 正确答案
B OpenInference 是开源的许可证
C notebook 适合生产自动化
D 两者无关
#

40. Phoenix / Arize Phoenix 在 Embedding 可视化、聚类分析与 bad case 探索上相比纯 Ragas 有何优势

A Ragas 也擅长可视化
B Phoenix 不能算指标
C 两者能力完全相同
D Phoenix 强在 Embedding 可视化、聚类与 bad case 探索,Ragas 强在指标计算 ✓ 正确答案
#

41. 评估工具版本升级时(如 Ragas 0.1 → 0.2)指标数值可能漂移,应如何保持历史可比

A 新旧版本分数直接比较
B 升级后历史作废
C 双轨运行量化差异、版本标注、golden 锚定校准,用相对比较保持历史可比 ✓ 正确答案
D 无需校准
#

42. 评估工具的“运行成本”(Judge 调用、向量检索)应如何计入 CI 流水线预算

A 评估成本无需管理
B 预估成本、分级预算、缓存复用、快慢模型分层、成本监控,纳入 CI 预算 ✓ 正确答案
C 全量评估每次必跑
D 成本不影响 CI
#

43. 评估工具的“指标解释文档”(如 Ragas Faithfulness 定义)

A 指标名即可,无需解释
B 明确每个指标的定义、计算、量纲、解读与局限,形成团队共识 ✓ 正确答案
C 文档无必要性
D 指标解释由工具决定
#

44. DeepEval 的 G-Eval 指标在底层 LLM-as-Judge 上有非确定性评分,CI 中应如何设计 gate(re-run-on-fail、统计阈值、guardrail metric 兜底)才能既不放过真实回归又不因 flakiness 阻塞合法 PR

A 单次 G-Eval 分数直接阻断
B 所有指标都用 G-Eval
C G-Eval 无法用于 gate
D 固定温度、重跑过滤、统计阈值、guardrail 确定性指标兜底,兼顾防漏检与防阻塞 ✓ 正确答案
#

45. 模型或 Prompt 变更如何经过离线门禁、Canary、A/B、逐步放量与自动回滚

A 直接全量发布
B 离线门禁→Canary→A/B→逐步放量→自动回滚,每步监控并设护栏 ✓ 正确答案
C 无需回滚
D Canary 是最后一步
#

46. 影子流量(shadow traffic)如何保证不影响线上结果且可对比输出质量差异

A 影子响应返回给用户
B 影子可执行写操作
C 影子只读不产生副作用、不返回给用户,平行对比线上与候选的质量差异 ✓ 正确答案
D 影子流量影响线上
#

47. Canary 发布中如何选定“金丝雀用户群”(随机、按地域、按租户)

A 随机永远最优
B 只能选一种
C 随机偏代表性、地域偏隔离合规、租户偏隔离,按场景组合并保证代表真实分布 ✓ 正确答案
D Canary 用户群无需代表性
#

48. A/B 测试中的“护栏指标”(guardrail metrics)

A 护栏指标监控主指标提升是否以成本/延迟/流失等为代价,联合判断防误判 ✓ 正确答案
B 只需看主指标
C 护栏指标是多余的
D 护栏指标只看成本
#

49. 线上 A/B 显著性检验应使用哪些方法(t-test、bootstrap、BH 校正)

A 正态指标用 t-test、偏态用 bootstrap、多指标用 BH 校正,组合避免假阳性 ✓ 正确答案
B 只用 t-test 即可
C bootstrap 无需假设
D BH 校正用于单指标
#

50. Patronus、Galileo 等平台的幻觉或 RAG 指标应如何与自有人工标注做校准

A 用自有人工 golden 样本对比平台指标,校准阈值与定义,确认与业务一致 ✓ 正确答案
B 平台指标无需校准
C 平台指标与业务定义天然一致
D 校准一次即可
#

51. 不同评估工具(DeepEval、Ragas、TruLens、Patronus、Galileo)在指标定义、Judge 模型与可导出性上的差异如何影响选型

A 只看工具名气
B 所有工具等价
C 评估指标定义、Judge 可控性、可导出性三方面,匹配业务语义与数据主权 ✓ 正确答案
D 可导出性不重要
#

52. Braintrust、LangSmith 与 DeepEval 在 CI 集成模型上差异显著,Braintrust 以 Eval() 为中心、LangSmith 强绑 dataset + experiment、DeepEval 走 pytest 路径——如何设计一个 evaluator agreement suite 在某平台静默升级默认 judge 模型时及时检测分数漂移

A 用固定黄金样本与多平台一致性监控分数漂移,及时检测平台静默升级 judge ✓ 正确答案
B judge 升级无需监控
C 平台从不升级 judge
D agreement suite 只测应用质量