多维评估体系

共 42 题
#

1. 如何同时定义任务成功、正确性、忠实度、相关性、格式、安全、延迟和成本指标

A 指标越多越好,把所有指标同等对待即可
B 硬指标决定能否上线,软指标决定体验,延迟成本是约束门槛 ✓ 正确答案
C 延迟和成本应该与质量同等权重参与评分
D 只有任务成功率一个指标就够了
#

2. 离线集、专家人工评审、LLM-as-Judge 和线上用户反馈各有什么偏差,如何互补

A LLM-as-Judge 可以完全替代人工评审
B 线上用户反馈是唯一可信的评估手段
C 离线评估集可以完全覆盖线上流量分布
D 离线集做快速回归、Judge 做大规模评分、人工做校准、线上做最终验证,形成互补闭环 ✓ 正确答案
#

3. 位置、长度、自我偏好、锚定和格式偏差会怎样影响 Judge,如何用换序和多 Judge 缓解

A 自褒偏差只影响开源模型
B 长度偏差无法通过任何手段缓解
C 多 Judge 总能消除所有偏差且无成本
D 换序是把 A/B 顺序对调各评一次,两次都赢才算赢,可消除位置偏差 ✓ 正确答案
#

4. 如何让 Judge 模型与真实业务指标(人工评分、用户行为数据)对齐校准,防止离线高分线上翻车

A 离线分数就是最终真相,无需对齐
B 用人工 golden 样本计算 Judge 与业务指标的一致性,不一致时用业务反馈更新 rubric 并做统计校准 ✓ 正确答案
C 对齐一次即可永久生效
D 用户行为数据过于主观,不能用于校准
#

5. 多 Judge 集成(多模型投票、人工 + AI 混合)应在哪些业务场景下启用,成本与可信度如何权衡

A 所有请求都应使用多 Judge 以保证正确
B 多 Judge 为零成本方案
C 高风险、高价值场景用多 Judge 或人工混合,低风险用单 Judge 粗筛,成本花在关键处 ✓ 正确答案
D 人工评审应只用于低风险样本
#

6. Pairwise 与 Likert 评分在稳定性、成本和可解释性上如何取舍,何时使用 Bradley-Terry/ELO

A Pairwise 更便宜但解释性差
B Likert 更稳定但成本高
C 需要大量两两比较聚合为全局排序时用 Bradley-Terry/ELO,产品内部用 Likert 更可解释 ✓ 正确答案
D ELO 只能用于围棋
#

7. 怎样设计清晰 rubric、盲评、标注培训和争议仲裁,并测量标注者一致性

A Kappa 低于 0.7 说明一致性可接受
B 仲裁只会增加成本,应尽量避免
C 标注者主观性无法控制,无需培训
D 盲评、清晰 rubric、培训、仲裁和 Kappa 一致性测量是保证人工评估可靠的关键 ✓ 正确答案
#

8. 基准集如何按业务、难度、语言和风险分层,并维护 hard cases 与回归集

A 基准集样本越多越好,无需分层
B 回归集会拖慢评估,应删除
C hard cases 是可有可无的加分项
D 按业务、难度、语言、风险分层,并维护 hard cases 与回归集以保持区分度与覆盖 ✓ 正确答案
#

9. 评估指标体系应包含“硬指标”(任务成功、格式合法)与“软指标”(语气、品牌、详略)

A 软指标对错明确,可自动判定
B 硬指标决定能否上线,软指标决定体验好坏,两者都纳入评估体系但用途不同 ✓ 正确答案
C 硬指标是主观体验导向的
D 只需要硬指标即可保证产品质量
#

10. 不同业务(客服、编程、创作、医疗)应使用同一套评估模板还是分别定制

A 所有业务应使用同一套模板
B 采用通用框架加业务定制,框架共享公共维度,业务专属指标单独设计 ✓ 正确答案
C 每个业务完全独立,无任何共性
D 医疗与客服的评估可以完全一样
#

11. 离线评估集应包含多少“对抗样本”(诱导错误)才能覆盖主要风险

A 对抗样本越多越好
B 对抗样本占评估集 5%-20%,按风险类别覆盖并独立统计,与常规样本平衡 ✓ 正确答案
C 对抗样本只适合安全团队,与应用无关
D 对抗样本不需要从线上更新
#

12. 评估集中“答案不唯一”的题目(如创作)应如何用 reference set 与 pairwise 比较替代绝对分

A 绝对分更可靠,应坚持使用
B pairwise 只适用于二选一
C 创作类题目无法评估
D 用 reference set 与 pairwise 相对比较替代绝对分,稳定性更高 ✓ 正确答案
#

13. 如何防止团队通过优化 Judge 措辞提高分数,却没有改善真实任务成功率

A 分数越高越好,Judge 措辞优化合理
B 只要离线分数高,线上一定好
C 将 Judge 分数与真实业务指标绑定校验、多 Judge 轮换、盲评与人工抽检,防止指标被优化而业务没变好 ✓ 正确答案
D 无需人工抽检
#

14. Judge 模型升级时(如 GPT-4 → GPT-5),评分标准应如何校准避免突然“容易”或“严格”

A 升级后分数变化就是真实质量变化
B 新旧 Judge 分数可直接比较
C 升级后无需调整门槛
D 用 golden 样本桥接、双轨并行、版本标注历史分数,避免版本切换造成虚假涨跌 ✓ 正确答案
#

15. “人机一致性”(human-AI agreement)应如何度量,低于多少不可信

A 用随机校正的 Kappa 度量,并与人-人一致性对比,显著低于人-人基准时 Judge 不可信 ✓ 正确答案
B Kappa 越高越不可信
C 人机一致性无法度量
D 只要 Kappa 大于 0 就可信
#

16. 如何评估 Judge 自身的“判断一致性”,同一答案多次评分是否稳定

A 通过重复评分一致性、边界稳定性评估,波动大时用多 Judge 或多轮投票兜底 ✓ 正确答案
B Judge 输出完全确定,无需评估
C 温度越高评分越稳定
D 单次评分即可代表 Judge 能力
#

17. 为什么“专家标注”本身可能带偏差,应如何让多人标注 + 仲裁提升可靠性

A 专家标注必然无偏
B 单个专家比多人更可靠
C 专家可能有个人偏好与盲区,用多人标注、一致性度量与仲裁提升可靠性 ✓ 正确答案
D 仲裁会引入偏差
#

18. 评估指标应多长时间复审一次,防止“指标漂移”与业务目标脱钩

A 指标定好就无需复审
B 指标漂移只发生在离线评估
C 按业务节奏定期复审,并持续与业务真值对齐校验,防止指标漂移 ✓ 正确答案
D 复审周期越长越好
#

19. LLM 应用评估的"离线评测集+在线指标+人工抽检"三层体系如何搭建?

A 离线快速回归、在线监控真实行为、人工抽检校准,三层互补形成闭环 ✓ 正确答案
B 只需离线评测集即可
C 在线指标完全可靠,无需人工
D 人工抽检应全量覆盖
#

20. 多维评估体系与 LLM-as-Judge 在实际落地中应通过哪些源码级关键路径实现自动评分、偏差校准与可复现

A 通过固定随机种子、锁定模型与应用版本、绑定数据集 commit 实现可复现 ✓ 正确答案
B 评估脚本无需版本控制
C Judge 只能内置一种,不可切换
D 校准层可有可无
#

21. Prompt、模型、参数、工具 Schema、检索索引和工作流版本如何组成可测试发布单元

A 把 Prompt、模型、参数、工具 Schema、索引、工作流版本绑定为一个快照,作为整体测试与回滚 ✓ 正确答案
B 每个要素独立版本即可,无需绑定
C 发布单元只包含 Prompt
D 版本绑定会阻碍快速迭代
#

22. 确定性代码应如何做单元和集成测试,概率性输出应如何使用属性、不变量与容差

A 用属性、不变量与容差断言替代精确内容断言 ✓ 正确答案
B 应断言精确输出内容
C 概率输出无法测试,只能跳过
D 属性和不变量只适用于确定性代码
#

23. Mock Provider、VCR 回放、本地模型容器与真实 Provider 测试分别能发现什么问题

A 单元用 Mock、集成用 VCR/本地容器、上线前用真实 Provider 冒烟,分层组合 ✓ 正确答案
B 全部用真实 Provider 测试
C VCR 回放能发现模型行为变化
D Mock 能验证真实模型质量
#

24. 录制回放(recording & replay)在 AI 测试中应如何处理时间敏感性与 Provider 行为漂移

A 录制数据永远有效
B 回放能反映真实模型当前行为
C 时间敏感字段做归一化或冻结,回放数据设 TTL 并定期重录以应对漂移 ✓ 正确答案
D 无需处理时间问题
#

25. 如何为流式响应编写“异步断言”(首个 token 时间、P50 token 间隔、完整事件序列)

A 只能等流结束后一次性断言
B 流式响应无法测试
C 采集事件流,断言首 token 时间、token 间隔与事件序列,用异步测试框架实现 ✓ 正确答案
D 只需断言首 token 时间
#

26. 如何对流式乱序、半包、限流、超时、工具失败和取消传播做故障注入测试

A 只需测试正常路径
B 取消传播无法测试
C 故障注入会破坏系统,应避免
D 通过代理/包装在关键链路注入乱序、半包、限流、超时、工具失败与取消,验证系统容错与恢复 ✓ 正确答案
#

27. 录制回放如何脱敏、设过期时间,并处理动态知识和 Provider 行为已变化的问题

A 回放数据无需脱敏
B 行为漂移无需关注
C 回放数据永远可用
D 对回放数据做脱敏、设 TTL、标记动态知识样本并检测行为漂移 ✓ 正确答案
#

28. 对概率性输出,单元测试应断言哪些属性(结构合法、不含敏感词)

A 只能断言精确内容
B 概率输出无法做单元测试
C 断言结构合法、不含敏感词、忠实性等属性,而非精确内容 ✓ 正确答案
D 只需要断言结构
#

29. AI 测试中的“快照”(golden snapshot)应如何选样,避免模型小升级就导致大量失败

A 快照应逐字精确匹配
B 选稳定样本、用语义级断言与容差、分层抽样,避免模型小升级导致大量失败 ✓ 正确答案
C 快照越多越脆弱
D 模型升级无需处理快照
#

30. 回归集应包含哪些类型(happy、边界、对抗、慢路径),比例如何设计

A 包含 happy、边界、对抗、慢路径四类,按业务风险与流量分布设计比例 ✓ 正确答案
B 只包含 happy path
C 对抗样本越多越好
D 慢路径不需要纳入回归
#

31. 测试运行时应固定哪些随机种子,模型快照、Provider 后端、Prompt 版本、Embedding 模型

A 固定模型快照、Provider、Prompt 版本、Embedding、参数并写入 manifest,保证可复现 ✓ 正确答案
B 只需固定随机种子
C Provider 后端无需固定
D 可复现性不重要
#

32. AI 测试金字塔为何比传统系统增加了评估集、真实模型抽样和线上监控层

A 与传统测试金字塔完全一致
B 新增评估集、真实模型抽样与线上监控层,以覆盖概率性输出与真实行为 ✓ 正确答案
C 只需确定性测试
D 线上监控层可有可无
#

33. 测试用例本身应版本化与代码化(Git 管理),避免“测试集依赖某次人工运行”丢失

A 测试用例可仅存在于临时运行中
B 测试集应随个人记忆保留
C 测试用例无需版本控制
D 测试用例代码化并纳入 Git 管理,与运行结果版本绑定,保证可追溯不丢失 ✓ 正确答案
#

34. 工具调用测试应断言哪些内容,参数合法性、调用顺序、错误处理、副作用幂等

A 只需断言调用成功
B 调用顺序不重要
C 副作用无需幂等
D 断言参数合法性、调用顺序、错误处理与副作用幂等 ✓ 正确答案
#

35. 如何用 LLM-as-Judge 评估回答质量,偏差(顺序/长度/自褒)如何缓解?

A 偏差无法缓解
B 用换序、多 Judge、隐藏来源、规范 rubric 缓解顺序/长度/自褒偏差 ✓ 正确答案
C 只需提高温度即可
D 顺序偏差只影响人工评估
#

36. Agent 任务的评估如何设计(步骤成功率/工具调用正确率/终态达成率)?

A 用终态达成率做主指标,结合步骤成功率、工具调用正确率与轨迹级归因 ✓ 正确答案
B 只看最终答案质量
C Agent 无法评估
D 过程指标不重要
#

37. 为什么需要“模型升级专项测试集”,Prompt 与模型是耦合的,模型升级常导致 Prompt 失效

A 模型升级无需测试
B Prompt 与模型耦合,升级可能导致 Prompt 失效,需专项测试集验证兼容性 ✓ 正确答案
C 模型升级后 Prompt 自动兼容
D 专项测试集只测性能
#

38. 评估指标应包含哪些与延迟、成本、安全相关的“非质量”维度

A 纳入延迟、成本、安全、可用性等非质量维度,并设门槛 ✓ 正确答案
B 只需评估回答质量
C 成本与安全不属于评估范围
D 延迟只影响体验不影响上线
#

39. MT-Bench、Chatbot Arena 等公开偏好基准为何不能直接替代企业任务评估

A 公开基准可直接替代企业评估
B 企业评估无用
C 公开基准覆盖所有业务
D 公开基准通用能力与业务任务分布不同,只能做初筛,企业需自建业务评估 ✓ 正确答案
#

40. 契约测试(Provider 与客户端 Schema)对齐应包含哪些字段,能力、参数、错误码、流事件、usage

A 只需对齐请求参数
B 错误码无需对齐
C 用 Schema 校验能力、参数、错误码、流事件、usage 等契约字段,防止接口漂移 ✓ 正确答案
D 契约测试只适用于 REST
#

41. A/B 测试的样本量、显著性、护栏指标和停止规则如何避免“看起来变好”的误判

A 样本越多越容易误判
B 只需看主指标
C 随时看结果即可停止
D 预计算样本量、显著性多重校正、护栏指标监控、固定停止规则,避免假象 ✓ 正确答案
#

42. 评测集如何持续从线上 badcase 回流并防止过拟合?

A 回流越多越好
B 回流样本无需去重
C 线上 badcase 脱敏标注后回流,同时测试集与调优集分离、去重并控制比例防过拟合 ✓ 正确答案
D 可以在测试集上调参