# 1. 如何同时定义任务成功、正确性、忠实度、相关性、格式、安全、延迟和成本指标 A 指标越多越好,把所有指标同等对待即可 B 硬指标决定能否上线,软指标决定体验,延迟成本是约束门槛 ✓ 正确答案 C 延迟和成本应该与质量同等权重参与评分 D 只有任务成功率一个指标就够了
# 2. 离线集、专家人工评审、LLM-as-Judge 和线上用户反馈各有什么偏差,如何互补 A LLM-as-Judge 可以完全替代人工评审 B 线上用户反馈是唯一可信的评估手段 C 离线评估集可以完全覆盖线上流量分布 D 离线集做快速回归、Judge 做大规模评分、人工做校准、线上做最终验证,形成互补闭环 ✓ 正确答案
# 3. 位置、长度、自我偏好、锚定和格式偏差会怎样影响 Judge,如何用换序和多 Judge 缓解 A 自褒偏差只影响开源模型 B 长度偏差无法通过任何手段缓解 C 多 Judge 总能消除所有偏差且无成本 D 换序是把 A/B 顺序对调各评一次,两次都赢才算赢,可消除位置偏差 ✓ 正确答案
# 4. 如何让 Judge 模型与真实业务指标(人工评分、用户行为数据)对齐校准,防止离线高分线上翻车 A 离线分数就是最终真相,无需对齐 B 用人工 golden 样本计算 Judge 与业务指标的一致性,不一致时用业务反馈更新 rubric 并做统计校准 ✓ 正确答案 C 对齐一次即可永久生效 D 用户行为数据过于主观,不能用于校准
# 5. 多 Judge 集成(多模型投票、人工 + AI 混合)应在哪些业务场景下启用,成本与可信度如何权衡 A 所有请求都应使用多 Judge 以保证正确 B 多 Judge 为零成本方案 C 高风险、高价值场景用多 Judge 或人工混合,低风险用单 Judge 粗筛,成本花在关键处 ✓ 正确答案 D 人工评审应只用于低风险样本
# 6. Pairwise 与 Likert 评分在稳定性、成本和可解释性上如何取舍,何时使用 Bradley-Terry/ELO A Pairwise 更便宜但解释性差 B Likert 更稳定但成本高 C 需要大量两两比较聚合为全局排序时用 Bradley-Terry/ELO,产品内部用 Likert 更可解释 ✓ 正确答案 D ELO 只能用于围棋
# 7. 怎样设计清晰 rubric、盲评、标注培训和争议仲裁,并测量标注者一致性 A Kappa 低于 0.7 说明一致性可接受 B 仲裁只会增加成本,应尽量避免 C 标注者主观性无法控制,无需培训 D 盲评、清晰 rubric、培训、仲裁和 Kappa 一致性测量是保证人工评估可靠的关键 ✓ 正确答案
# 8. 基准集如何按业务、难度、语言和风险分层,并维护 hard cases 与回归集 A 基准集样本越多越好,无需分层 B 回归集会拖慢评估,应删除 C hard cases 是可有可无的加分项 D 按业务、难度、语言、风险分层,并维护 hard cases 与回归集以保持区分度与覆盖 ✓ 正确答案
# 9. 评估指标体系应包含“硬指标”(任务成功、格式合法)与“软指标”(语气、品牌、详略) A 软指标对错明确,可自动判定 B 硬指标决定能否上线,软指标决定体验好坏,两者都纳入评估体系但用途不同 ✓ 正确答案 C 硬指标是主观体验导向的 D 只需要硬指标即可保证产品质量
# 10. 不同业务(客服、编程、创作、医疗)应使用同一套评估模板还是分别定制 A 所有业务应使用同一套模板 B 采用通用框架加业务定制,框架共享公共维度,业务专属指标单独设计 ✓ 正确答案 C 每个业务完全独立,无任何共性 D 医疗与客服的评估可以完全一样
# 11. 离线评估集应包含多少“对抗样本”(诱导错误)才能覆盖主要风险 A 对抗样本越多越好 B 对抗样本占评估集 5%-20%,按风险类别覆盖并独立统计,与常规样本平衡 ✓ 正确答案 C 对抗样本只适合安全团队,与应用无关 D 对抗样本不需要从线上更新
# 12. 评估集中“答案不唯一”的题目(如创作)应如何用 reference set 与 pairwise 比较替代绝对分 A 绝对分更可靠,应坚持使用 B pairwise 只适用于二选一 C 创作类题目无法评估 D 用 reference set 与 pairwise 相对比较替代绝对分,稳定性更高 ✓ 正确答案
# 13. 如何防止团队通过优化 Judge 措辞提高分数,却没有改善真实任务成功率 A 分数越高越好,Judge 措辞优化合理 B 只要离线分数高,线上一定好 C 将 Judge 分数与真实业务指标绑定校验、多 Judge 轮换、盲评与人工抽检,防止指标被优化而业务没变好 ✓ 正确答案 D 无需人工抽检
# 14. Judge 模型升级时(如 GPT-4 → GPT-5),评分标准应如何校准避免突然“容易”或“严格” A 升级后分数变化就是真实质量变化 B 新旧 Judge 分数可直接比较 C 升级后无需调整门槛 D 用 golden 样本桥接、双轨并行、版本标注历史分数,避免版本切换造成虚假涨跌 ✓ 正确答案
# 15. “人机一致性”(human-AI agreement)应如何度量,低于多少不可信 A 用随机校正的 Kappa 度量,并与人-人一致性对比,显著低于人-人基准时 Judge 不可信 ✓ 正确答案 B Kappa 越高越不可信 C 人机一致性无法度量 D 只要 Kappa 大于 0 就可信
# 16. 如何评估 Judge 自身的“判断一致性”,同一答案多次评分是否稳定 A 通过重复评分一致性、边界稳定性评估,波动大时用多 Judge 或多轮投票兜底 ✓ 正确答案 B Judge 输出完全确定,无需评估 C 温度越高评分越稳定 D 单次评分即可代表 Judge 能力
# 17. 为什么“专家标注”本身可能带偏差,应如何让多人标注 + 仲裁提升可靠性 A 专家标注必然无偏 B 单个专家比多人更可靠 C 专家可能有个人偏好与盲区,用多人标注、一致性度量与仲裁提升可靠性 ✓ 正确答案 D 仲裁会引入偏差
# 18. 评估指标应多长时间复审一次,防止“指标漂移”与业务目标脱钩 A 指标定好就无需复审 B 指标漂移只发生在离线评估 C 按业务节奏定期复审,并持续与业务真值对齐校验,防止指标漂移 ✓ 正确答案 D 复审周期越长越好
# 19. LLM 应用评估的"离线评测集+在线指标+人工抽检"三层体系如何搭建? A 离线快速回归、在线监控真实行为、人工抽检校准,三层互补形成闭环 ✓ 正确答案 B 只需离线评测集即可 C 在线指标完全可靠,无需人工 D 人工抽检应全量覆盖
# 20. 多维评估体系与 LLM-as-Judge 在实际落地中应通过哪些源码级关键路径实现自动评分、偏差校准与可复现 A 通过固定随机种子、锁定模型与应用版本、绑定数据集 commit 实现可复现 ✓ 正确答案 B 评估脚本无需版本控制 C Judge 只能内置一种,不可切换 D 校准层可有可无
# 21. Prompt、模型、参数、工具 Schema、检索索引和工作流版本如何组成可测试发布单元 A 把 Prompt、模型、参数、工具 Schema、索引、工作流版本绑定为一个快照,作为整体测试与回滚 ✓ 正确答案 B 每个要素独立版本即可,无需绑定 C 发布单元只包含 Prompt D 版本绑定会阻碍快速迭代
# 22. 确定性代码应如何做单元和集成测试,概率性输出应如何使用属性、不变量与容差 A 用属性、不变量与容差断言替代精确内容断言 ✓ 正确答案 B 应断言精确输出内容 C 概率输出无法测试,只能跳过 D 属性和不变量只适用于确定性代码
# 23. Mock Provider、VCR 回放、本地模型容器与真实 Provider 测试分别能发现什么问题 A 单元用 Mock、集成用 VCR/本地容器、上线前用真实 Provider 冒烟,分层组合 ✓ 正确答案 B 全部用真实 Provider 测试 C VCR 回放能发现模型行为变化 D Mock 能验证真实模型质量
# 24. 录制回放(recording & replay)在 AI 测试中应如何处理时间敏感性与 Provider 行为漂移 A 录制数据永远有效 B 回放能反映真实模型当前行为 C 时间敏感字段做归一化或冻结,回放数据设 TTL 并定期重录以应对漂移 ✓ 正确答案 D 无需处理时间问题
# 25. 如何为流式响应编写“异步断言”(首个 token 时间、P50 token 间隔、完整事件序列) A 只能等流结束后一次性断言 B 流式响应无法测试 C 采集事件流,断言首 token 时间、token 间隔与事件序列,用异步测试框架实现 ✓ 正确答案 D 只需断言首 token 时间
# 26. 如何对流式乱序、半包、限流、超时、工具失败和取消传播做故障注入测试 A 只需测试正常路径 B 取消传播无法测试 C 故障注入会破坏系统,应避免 D 通过代理/包装在关键链路注入乱序、半包、限流、超时、工具失败与取消,验证系统容错与恢复 ✓ 正确答案
# 27. 录制回放如何脱敏、设过期时间,并处理动态知识和 Provider 行为已变化的问题 A 回放数据无需脱敏 B 行为漂移无需关注 C 回放数据永远可用 D 对回放数据做脱敏、设 TTL、标记动态知识样本并检测行为漂移 ✓ 正确答案
# 28. 对概率性输出,单元测试应断言哪些属性(结构合法、不含敏感词) A 只能断言精确内容 B 概率输出无法做单元测试 C 断言结构合法、不含敏感词、忠实性等属性,而非精确内容 ✓ 正确答案 D 只需要断言结构
# 29. AI 测试中的“快照”(golden snapshot)应如何选样,避免模型小升级就导致大量失败 A 快照应逐字精确匹配 B 选稳定样本、用语义级断言与容差、分层抽样,避免模型小升级导致大量失败 ✓ 正确答案 C 快照越多越脆弱 D 模型升级无需处理快照
# 30. 回归集应包含哪些类型(happy、边界、对抗、慢路径),比例如何设计 A 包含 happy、边界、对抗、慢路径四类,按业务风险与流量分布设计比例 ✓ 正确答案 B 只包含 happy path C 对抗样本越多越好 D 慢路径不需要纳入回归
# 31. 测试运行时应固定哪些随机种子,模型快照、Provider 后端、Prompt 版本、Embedding 模型 A 固定模型快照、Provider、Prompt 版本、Embedding、参数并写入 manifest,保证可复现 ✓ 正确答案 B 只需固定随机种子 C Provider 后端无需固定 D 可复现性不重要
# 32. AI 测试金字塔为何比传统系统增加了评估集、真实模型抽样和线上监控层 A 与传统测试金字塔完全一致 B 新增评估集、真实模型抽样与线上监控层,以覆盖概率性输出与真实行为 ✓ 正确答案 C 只需确定性测试 D 线上监控层可有可无
# 33. 测试用例本身应版本化与代码化(Git 管理),避免“测试集依赖某次人工运行”丢失 A 测试用例可仅存在于临时运行中 B 测试集应随个人记忆保留 C 测试用例无需版本控制 D 测试用例代码化并纳入 Git 管理,与运行结果版本绑定,保证可追溯不丢失 ✓ 正确答案
# 34. 工具调用测试应断言哪些内容,参数合法性、调用顺序、错误处理、副作用幂等 A 只需断言调用成功 B 调用顺序不重要 C 副作用无需幂等 D 断言参数合法性、调用顺序、错误处理与副作用幂等 ✓ 正确答案
# 35. 如何用 LLM-as-Judge 评估回答质量,偏差(顺序/长度/自褒)如何缓解? A 偏差无法缓解 B 用换序、多 Judge、隐藏来源、规范 rubric 缓解顺序/长度/自褒偏差 ✓ 正确答案 C 只需提高温度即可 D 顺序偏差只影响人工评估
# 36. Agent 任务的评估如何设计(步骤成功率/工具调用正确率/终态达成率)? A 用终态达成率做主指标,结合步骤成功率、工具调用正确率与轨迹级归因 ✓ 正确答案 B 只看最终答案质量 C Agent 无法评估 D 过程指标不重要
# 37. 为什么需要“模型升级专项测试集”,Prompt 与模型是耦合的,模型升级常导致 Prompt 失效 A 模型升级无需测试 B Prompt 与模型耦合,升级可能导致 Prompt 失效,需专项测试集验证兼容性 ✓ 正确答案 C 模型升级后 Prompt 自动兼容 D 专项测试集只测性能
# 38. 评估指标应包含哪些与延迟、成本、安全相关的“非质量”维度 A 纳入延迟、成本、安全、可用性等非质量维度,并设门槛 ✓ 正确答案 B 只需评估回答质量 C 成本与安全不属于评估范围 D 延迟只影响体验不影响上线
# 39. MT-Bench、Chatbot Arena 等公开偏好基准为何不能直接替代企业任务评估 A 公开基准可直接替代企业评估 B 企业评估无用 C 公开基准覆盖所有业务 D 公开基准通用能力与业务任务分布不同,只能做初筛,企业需自建业务评估 ✓ 正确答案
# 40. 契约测试(Provider 与客户端 Schema)对齐应包含哪些字段,能力、参数、错误码、流事件、usage A 只需对齐请求参数 B 错误码无需对齐 C 用 Schema 校验能力、参数、错误码、流事件、usage 等契约字段,防止接口漂移 ✓ 正确答案 D 契约测试只适用于 REST
# 41. A/B 测试的样本量、显著性、护栏指标和停止规则如何避免“看起来变好”的误判 A 样本越多越容易误判 B 只需看主指标 C 随时看结果即可停止 D 预计算样本量、显著性多重校正、护栏指标监控、固定停止规则,避免假象 ✓ 正确答案
# 42. 评测集如何持续从线上 badcase 回流并防止过拟合? A 回流越多越好 B 回流样本无需去重 C 线上 badcase 脱敏标注后回流,同时测试集与调优集分离、去重并控制比例防过拟合 ✓ 正确答案 D 可以在测试集上调参