# 1. 同一指标在不同工具间定义不一致时,怎样建立内部统一语义和黄金样本 A 指标名相同语义必然相同 B 建立内部指标字典与黄金样本,校准各工具实现,保证跨工具可比 ✓ 正确答案 C 直接比较各工具分数即可 D 黄金样本只用于训练
# 2. LLM-as-Judge 评估 RAG 时如何防止 Judge 受“检索结果不全”影响而误判(应区分检索失败与生成失败) A 答案不好就是生成失败 B 分阶段评估检索与生成,让 Judge 同时见上下文与答案,区分检索失败与生成失败 ✓ 正确答案 C 检索失败无法判断 D Judge 无需知道上下文
# 3. Agentic RAG(多步检索、查询改写循环)如何做轨迹级评估,中间检索步失败时如何归因到改写错误、召回缺失还是证据弃用 A 只看最终答案 B 检索失败无法归因 C 记录并评估每步,区分改写错误、召回缺失与证据弃用三类失败 ✓ 正确答案 D 只需评估检索质量
# 4. 评估集数据污染与泄露如何检测(线上日志回流样本与评测集重复、评测题混入知识库),评估集与生产数据的隔离流程应如何建立 A 数据污染不影响评估 B 污染无法检测 C 评测集可以与知识库混用 D 用相似度扫描检测污染,并建立评测集与训练/知识库隔离和回流去重流程 ✓ 正确答案
# 5. RAG 评估应如何同时检查“引用准确性”(每条断言都有出处) A 只需确认答案有引用即可 B 引用只是装饰 C 拆解断言并验证每条断言被引用来源支持,同时检查无引用断言占比 ✓ 正确答案 D 无法验证引用真实性
# 6. 线上 RAG 的指标监控(引用支持率、零结果率、低分率)与离线评估指标应如何对比对齐 A 线上与离线指标完全无关 B 离线评估无用 C 只监控线上即可 D 建立同构映射、用同批样本验证一致性、badcase 回流,让线上发现与离线定位互补 ✓ 正确答案
# 7. RAG 评估集应包含多少“故意为难”的样本(拼写错误、模糊问题、跨语言) A 困难样本应占 100% B 拼写错误无需测试 C 困难样本只用于训练 D 困难样本占一定比例并单独分层报告,按风险类别覆盖,与正常样本平衡 ✓ 正确答案
# 8. 为何必须按官方文档核查评估工具版本和能力,而不能依赖旧教程 A 旧教程足够可靠 B 工具版本差异不影响评估 C 以官方文档核查当前版本的能力与指标定义,并记录工具版本保证可复现 ✓ 正确答案 D 无需关注 changelog
# 10. 为什么不能完全依赖评估工具的“分数”,必须配合人工抽样与业务指标 A 完全信任工具分数 B 人工抽样是多余的 C 工具分数是代理指标,必须配合人工抽样与业务指标多信号验证 ✓ 正确答案 D 业务指标无法用于验证
# 11. 评估失败样本的聚类(按主题、长度、来源)应如何自动提示优化方向(改 Prompt、改检索、改模型) A 所有失败都改 Prompt B 检索失败改检索、忠实度失败改生成/模型、格式失败改 Prompt,按聚类归因 ✓ 正确答案 C 失败无法归因 D 聚类只用于报告
# 12. RAG 评估的可视化(指标雷达图、错误分布)应如何在团队周会与发布评审中使用 A 可视化只是装饰 B 发布评审不需要看评估 C 可视化不能驱动决策 D 雷达图看整体、错误分布看焦点、趋势图看漂移,支持周会排期与发布评审门禁 ✓ 正确答案
# 13. 发现评估集已被污染后,历史评估结论的可信度应如何重估,基线如何重建 A 历史结论直接作废即可 B 无需重建基线 C 污染不影响历史结论 D 定位污染范围、量化影响、用干净集重算并重建基线,同时建立防污染机制 ✓ 正确答案
# 14. RAG 评估的 Faithfulness、Answer Relevance、Context Precision 与 Citation Correctness 是相关但不同的信号——当 Faithfulness 上升而 Context Precision 下降时,常见的故障模式有哪些(如检索改写导致上下文更短、模型更“自信”但遗漏细节) A 生成质量全面变好 B 指标互相矛盾无意义 C 检索完全正常 D 检索上下文变短/覆盖下降,模型更忠实但遗漏相关细节 ✓ 正确答案
# 15. Online-to-offline 反馈回归,生产中用户 thumbs-down 上升但离线评估集分数未变时,应如何从 trace 采样、流量切片和 evaluator 时效性三个维度定位根因——是 prompt drift、流量结构变化,还是 judge 模型本身过期 A 离线分数不变说明没问题 B thumbs-down 上升是噪声无需处理 C 只看整体指标即可 D 从 trace 采样、流量切片与 evaluator 时效性三个维度定位,并回填 badcase 更新离线集 ✓ 正确答案
# 16. 为什么每套 RAG eval suite 必须有版本化的 golden dataset 绑定到具体 commit,且当底层 embedding 模型升级时数据集应如何迁移(re-embed 后对齐、人工 spot-check 重标、并保留旧版本作为可比基线) A golden dataset 无需版本化 B 版本化绑定 commit 保证可复现,embedding 升级时 re-embed、重标并保留旧基线对比 ✓ 正确答案 C embedding 升级无需处理 D 旧基线应删除
# 17. 影子流量如何保证输入可比且不产生副作用,怎样评估候选版本质量与延迟 A 影子请求会返回给用户 B 影子可执行写操作 C 影子接收真实输入但只读不产生副作用,平行对比候选与线上的质量与延迟 ✓ 正确答案 D 影子流量是随机输入
# 18. 哪些安全、格式、任务成功和延迟指标应成为阻断发布的硬门槛 A 所有指标都应作硬门槛 B 安全指标可放宽 C 延迟不构成门槛 D 安全、格式、任务成功、延迟四类硬性指标作阻断门槛,软指标持续优化 ✓ 正确答案
# 19. 关键业务为何仍需人工抽检,怎样设计风险分层采样而不是均匀随机 A 均匀随机采样最优 B 人工抽检无需设计 C 按风险分层采样,高风险全量或高比例抽检,低风险低比例,聚焦高风险 ✓ 正确答案 D 低风险样本应优先抽检
# 20. 灰度期间流量结构不一致(新旧用户差异)如何用协变量调整(CUPED) A 用实验前协变量做回归校正,剥离流量结构差异,降低方差提高对比公平性 ✓ 正确答案 B 直接对比即可,无需调整 C CUPED 无法处理流量差异 D 协变量调整会使结果失真
# 21. 上线门禁(release gate)应包含哪些硬指标,任务成功率、P95 延迟、引用支持率、安全分类通过率 A 门禁只包含延迟 B 门禁只是参考 C 安全指标不列入门禁 D 门禁含任务成功率、P95 延迟、引用支持率、安全通过率,任一不达标即阻断发布 ✓ 正确答案
# 22. 用户反馈(点赞、点踩、编辑)应如何降噪并与评估指标对齐,避免“多数人偏好不等于正确” A 用户反馈就是正确性真相 B 降噪并与评估对齐,区分偏好与正确性,用权威标注判断正确性 ✓ 正确答案 C 无需降噪 D 多数人偏好必然正确
# 23. 灰度期间用户群和流量结构不一致时,如何校正质量与成本比较 A 直接对比即可 B 分层对比、协变量调整、标准化加权,剥离流量结构差异,保证质量与成本可比 ✓ 正确答案 C 流量结构不影响对比 D 成本无需校正
# 24. 上线后怎样将投诉、编辑和人工接管样本回流,而不把噪声直接当作正确标签 A 投诉/编辑/接管样本经过滤、去重、聚类、人工复核后才作为标签回流 ✓ 正确答案 B 所有反馈直接作为标签 C 噪声无需过滤 D 人工接管是弱信号
# 25. 为什么“看上去变好”不一定是真变好,如何设置反向指标(用户主动取消、客服投诉) A 只需看正向指标 B 设置用户取消、投诉、编辑等反向指标作护栏,与正向指标联合判断防误判 ✓ 正确答案 C 反向指标无意义 D 正向指标提升必然真实改善
# 26. 影子流量的结果对比应使用哪些指标(任务成功率、引用准确率、用户满意度) A 用任务成功率、引用准确率、满意度代理(Judge/人工)等对比候选与线上 ✓ 正确答案 B 影子流量无法评估质量 C 只需看延迟 D 满意度需真实用户反馈
# 27. 灰度发布中的“流量切换”是按用户、按请求还是按租户,各适合什么场景 A 所有情况都按请求 B 对话类按用户保一致、无状态批量按请求、多租户隔离按租户,按场景选择 ✓ 正确答案 C 按租户适用于所有场景 D 流量粒度无关紧要
# 28. Agent 长任务(如编码、深度调研)的灰度验证为何比短对话更困难,应如何设计对照实验 A 与短对话验证相同 B 只需看最终答案 C 长任务无法验证 D 用影子/沙箱防副作用、任务级指标评估、先验组件再端到端,长周期对照 ✓ 正确答案
# 29. 上线后监控的“用户接管率”应如何归因(是工具不够好、Prompt 不清晰、还是 UI 问题) A 接管率上升就是 AI 能力不足 B 结合会话内容、工具能力、Prompt 质量与 UI 路径分层归因 ✓ 正确答案 C 接管率与 UI 无关 D 无法归因
# 30. Prompt 变更的 CI 评估门禁(eval gate)应如何设定分数下降阻断阈值,flaky 评估如何用重跑策略与统计阈值防止阻塞合法合并 A 单次失败即阻断 B 重跑会掩盖真实问题 C 无需阈值 D 设相对基线容差与绝对下限,用重跑策略与统计显著性过滤 flaky,不放过大回归也不阻塞合法 PR ✓ 正确答案
# 31. 多模型并存分流场景下,如何保证同一用户跨会话的模型版本一致性(粘性路由、版本快照),版本过渡期命中旧版本的用户如何处理 A 用户每次请求随机路由即可 B 版本一致性无关紧要 C 用粘性路由与版本快照保证同一用户跨会话一致,过渡期平滑迁移并监控反馈 ✓ 正确答案 D 旧版本用户应强制切换
# 32. 紧急回滚触发后,已经执行的有副作用工具调用如何补偿和撤销 A 副作用可自动撤销 B 副作用无法补偿 C 回滚无需处理副作用 D 用幂等键定位副作用、补偿队列执行反向补偿、人工介入不可逆操作 ✓ 正确答案
# 33. 用户粘性路由规则本身的灰度切换与效果隔离如何做,防止同一用户被频繁切换模型导致体验断裂 A 粘性绑定、切换阈值、冷却期、会话内一致,规则变更灰度化并效果隔离 ✓ 正确答案 B 频繁切换以追求最优 C 同会话可任意切换 D 无需冷却期
# 34. Ragas 的 Faithfulness、Answer Relevancy、Context Precision 和 Context Recall 分别定位哪类问题 A 四个指标都测生成质量 B 单一指标即可 C Context Recall 测生成幻觉 D Faithfulness 测幻觉、Answer Relevancy 测相关性、Context Precision 测噪声、Context Recall 测遗漏 ✓ 正确答案
# 35. TruLens groundedness、context relevance 与 OpenTelemetry trace 如何关联一次 RAG 运行 A 两者无法关联 B trace 只记录延迟 C 评估无需关联 trace D 用 trace ID 绑定评估结果,在 trace 上附加评估 span,实现一次运行的可观测与质量评估 ✓ 正确答案
# 36. DeepEval 的 Pytest 集成、G-Eval/DAG/QAG 指标怎样进入 CI,如何控制 Judge 波动 A G-Eval 分数完全确定 B 单次评分即可 gate C 用 pytest 集成进 CI,固定温度、阈值容差、重跑与统计阈值控制 Judge 波动 ✓ 正确答案 D 无需 guardrail 兜底
# 37. Ragas 的 Context Precision、Context Recall、Faithfulness、Answer Relevancy 在生产中应如何联合解读,单一指标为何不可信 A 联合解读检索-生成链条,识别噪声、遗漏、幻觉、相关性,单一指标会掩盖其他环节退化 ✓ 正确答案 B 单一指标即可判断 C 指标无需联合 D Faithfulness 高即代表整体好
# 38. DeepEval 的 G-Eval、DAG、QAG 指标适合哪类任务,与人工评分的相关性如何验证 A 所有指标适用所有任务 B 无需验证相关性 C G-Eval 适主观评分、DAG 适判定、QAG 适问答,用与人工评分相关性验证有效性 ✓ 正确答案 D 相关性低也可信
# 39. Phoenix Evals 与 OpenInference 的关系是什么,何时适合在 notebook 中探索 bad case A OpenInference 是 GenAI 可观测性标准,Phoenix 消费它做评估与 bad case 探索 ✓ 正确答案 B OpenInference 是开源的许可证 C notebook 适合生产自动化 D 两者无关
# 40. Phoenix / Arize Phoenix 在 Embedding 可视化、聚类分析与 bad case 探索上相比纯 Ragas 有何优势 A Ragas 也擅长可视化 B Phoenix 不能算指标 C 两者能力完全相同 D Phoenix 强在 Embedding 可视化、聚类与 bad case 探索,Ragas 强在指标计算 ✓ 正确答案
# 41. 评估工具版本升级时(如 Ragas 0.1 → 0.2)指标数值可能漂移,应如何保持历史可比 A 新旧版本分数直接比较 B 升级后历史作废 C 双轨运行量化差异、版本标注、golden 锚定校准,用相对比较保持历史可比 ✓ 正确答案 D 无需校准
# 42. 评估工具的“运行成本”(Judge 调用、向量检索)应如何计入 CI 流水线预算 A 评估成本无需管理 B 预估成本、分级预算、缓存复用、快慢模型分层、成本监控,纳入 CI 预算 ✓ 正确答案 C 全量评估每次必跑 D 成本不影响 CI
# 43. 评估工具的“指标解释文档”(如 Ragas Faithfulness 定义) A 指标名即可,无需解释 B 明确每个指标的定义、计算、量纲、解读与局限,形成团队共识 ✓ 正确答案 C 文档无必要性 D 指标解释由工具决定
# 44. DeepEval 的 G-Eval 指标在底层 LLM-as-Judge 上有非确定性评分,CI 中应如何设计 gate(re-run-on-fail、统计阈值、guardrail metric 兜底)才能既不放过真实回归又不因 flakiness 阻塞合法 PR A 单次 G-Eval 分数直接阻断 B 所有指标都用 G-Eval C G-Eval 无法用于 gate D 固定温度、重跑过滤、统计阈值、guardrail 确定性指标兜底,兼顾防漏检与防阻塞 ✓ 正确答案
# 45. 模型或 Prompt 变更如何经过离线门禁、Canary、A/B、逐步放量与自动回滚 A 直接全量发布 B 离线门禁→Canary→A/B→逐步放量→自动回滚,每步监控并设护栏 ✓ 正确答案 C 无需回滚 D Canary 是最后一步
# 46. 影子流量(shadow traffic)如何保证不影响线上结果且可对比输出质量差异 A 影子响应返回给用户 B 影子可执行写操作 C 影子只读不产生副作用、不返回给用户,平行对比线上与候选的质量差异 ✓ 正确答案 D 影子流量影响线上
# 47. Canary 发布中如何选定“金丝雀用户群”(随机、按地域、按租户) A 随机永远最优 B 只能选一种 C 随机偏代表性、地域偏隔离合规、租户偏隔离,按场景组合并保证代表真实分布 ✓ 正确答案 D Canary 用户群无需代表性
# 48. A/B 测试中的“护栏指标”(guardrail metrics) A 护栏指标监控主指标提升是否以成本/延迟/流失等为代价,联合判断防误判 ✓ 正确答案 B 只需看主指标 C 护栏指标是多余的 D 护栏指标只看成本
# 49. 线上 A/B 显著性检验应使用哪些方法(t-test、bootstrap、BH 校正) A 正态指标用 t-test、偏态用 bootstrap、多指标用 BH 校正,组合避免假阳性 ✓ 正确答案 B 只用 t-test 即可 C bootstrap 无需假设 D BH 校正用于单指标
# 50. Patronus、Galileo 等平台的幻觉或 RAG 指标应如何与自有人工标注做校准 A 用自有人工 golden 样本对比平台指标,校准阈值与定义,确认与业务一致 ✓ 正确答案 B 平台指标无需校准 C 平台指标与业务定义天然一致 D 校准一次即可
# 51. 不同评估工具(DeepEval、Ragas、TruLens、Patronus、Galileo)在指标定义、Judge 模型与可导出性上的差异如何影响选型 A 只看工具名气 B 所有工具等价 C 评估指标定义、Judge 可控性、可导出性三方面,匹配业务语义与数据主权 ✓ 正确答案 D 可导出性不重要
# 52. Braintrust、LangSmith 与 DeepEval 在 CI 集成模型上差异显著,Braintrust 以 Eval() 为中心、LangSmith 强绑 dataset + experiment、DeepEval 走 pytest 路径——如何设计一个 evaluator agreement suite 在某平台静默升级默认 judge 模型时及时检测分数漂移 A 用固定黄金样本与多平台一致性监控分数漂移,及时检测平台静默升级 judge ✓ 正确答案 B judge 升级无需监控 C 平台从不升级 judge D agreement suite 只测应用质量