# 1. LLM-as-Judge 作为 Agent 输出校验器时存在哪些偏差、成本与校准问题,如何防止校验器与执行器同源偏好 A Judge 的评分是绝对可靠的,可直接作为概率使用 B Judge 完全不存在任何偏差,无需缓解 C 存在位置/长度/自我偏好等偏差与成本问题,应去同源、盲评、用 rubrics 并配合确定性校验缓解 ✓ 正确答案 D 执行器与校验器用同一模型可避免自我偏好
# 2. Agent 输出如何用形式化校验(schema/类型/单测)拦截低级错误 A JSON Schema 校验无法拦截任何错误,没什么用 B 用 JSON Schema 校验结构、类型/枚举/值域校验、单元测试拦截低级错误,并结合约束生成减少失败 ✓ 正确答案 C 单元测试只适用于数据,不适用于代码生成 D 形式化校验能保证语义正确,无需语义审查
# 3. Plan-and-Execute 模式中计划与执行偏差如何实时监控 A 计划完成后一次性检查即可,无需逐步比对 B 计划与执行之间应逐步比对,关键里程碑做计划级校验,发现偏差后局部修正、重规划或回退 ✓ 正确答案 C 发现偏差应立即回退到最初,不做局部修正 D 计划与执行完全不会偏差,无需监控
# 4. 工具调用失败(超时/异常/格式错)如何分类并差异化处理 A 所有失败都应立即升级,不进行任何重试 B 所有失败都应无限重试,同一种方式 C 应分类处理:超时/瞬时可退避重试,格式错纠正参数,权限/业务拒绝直接升级,并设总重试上限 ✓ 正确答案 D 格式错误也应不断重试,无需纠正参数
# 5. 幻觉在 Agent 长链路中如何被早期信号捕获而非末端爆发 A 幻觉只要在末端检测一次即可,之前无需检查 B 中间结果的置信度与幻觉无关,无需检测 C 幻觉检测只能等全部执行完才能做 D 应在每个关键环节做置信度/自洽性/证据锚定等轻量检测,早期纠正错误,避免累积放大 ✓ 正确答案
# 6. Agent 轨迹(trace)回放如何用于版本升级回归评测,不可回放节点(副作用工具、时效数据)如何处理 A 用 Mock 隔离副作用工具、冻结时效数据、固定随机性,保证轨迹可复现,才能稳定回放 ✓ 正确答案 B 时效数据无需冻结,重放结果自然一致 C 副作用工具(扣款/发信)可以直接原样重放,无需处理 D 回放时会随机失败,无法通过固定参数保证可复现
# 7. Agent 生成代码后自动运行测试并据失败信息回修的闭环设计 A 只需把"测试未通过"这五个字告诉模型即可,无需细节 B 把失败用例、断言差异、堆栈等结构化失败信息传给模型回修,并设最大轮数、保留历史最优版本 ✓ 正确答案 C 回修时应随意改动,无需考虑已通过的用例 D 回修轮数应无限,直到模型满意为止
# 8. Agent 输出的结构化校验,JSON Schema 验证、工具参数校验与可重试的错误分类如何设计? A 工具参数无需校验,直接传给工具即可 B 只需校验 JSON 能解析即可,无需校验字段与参数 C 错误分类与重试策略无关,无需区分 D 应分层:JSON Schema 校验结构、参数校验范围/类型、错误分类区分可重试与不可重试,并复用同一份 schema 定义 ✓ 正确答案
# 9. LLM 输出的幻觉检测,事实性核对(引用检索)、自洽性检查与置信度阈值如何组合? A 置信度阈值单独就足够可靠,无需其他信号 B 事实性核对依赖检索,但比自洽性检查更可靠 C 应组合事实性核对(证据比对)、自洽性检查(多次生成是否矛盾)与置信度阈值,先粗筛再精核 ✓ 正确答案 D 三种信号应各自独立使用,不组合
# 10. 输出检测的分层,语法(可解析)、语义(字段含义)与事实(证据支持)三层校验应如何组织,每层的失败处理有何不同 A 语法层最不可靠,应在最后做 B 三层校验必须同时进行,且失败处理相同 C 事实层最可靠,应放在最前做 D 按语法→语义→事实分层,逐层通过,语法层失败重试修复、语义层修正、事实层标记/降级/拒绝 ✓ 正确答案
# 11. 事实性验证的工程实现,基于检索的证据核对(grounding check)、矛盾检测与不确定声明标记? A 抽取声明、检索证据、判断是否被支持,并标记/降级/引用不确定声明,形成抽取→检索→比对→标记管线 ✓ 正确答案 B 无证据支持的声明也应照常输出,无需标记 C grounding check 无需抽取声明,直接整体比对即可 D grounding check 只需把整个输出与整篇文档做一次相似度比较即可
# 12. 错误检测的效果度量,检出率、误报率与漏放率的定义与权衡,如何用带标注的 bad case 集评估校验器本身? A 检出率越高越好,误报率无关紧要 B 应定义检出率(召回)、误报率、漏放率并用带标注的 bad case 集评估,按业务风险权衡阈值 ✓ 正确答案 C 只评估错误样本即可,无需真实分布 D 误报率与漏放率总是一方为零,无需权衡
# 13. 校验器与业务规则引擎的协作,哪些错误应交给确定性规则(金额、日期、枚举),哪些交给模型校验,规则与模型的边界如何划分? A 金额/日期/枚举等可确定判断的交给规则,语义/事实/合规交给模型,规则先行、模型兜底 ✓ 正确答案 B 所有校验都应交给模型,因为规则写不全 C 所有校验都应写成规则,因为模型不可靠 D 规则校验应在模型校验之后进行
# 14. 多模型交叉验证的工程代价,用强模型复核弱模型输出(或反之)的成本与收益,什么场景下值得引入第二模型? A 任何场景都应引入第二模型复核,以保证质量 B 强模型复核弱模型永远比弱模型复核强模型好 C 根据错误代价与验证成本权衡,高风险高价值场景值得引入第二模型,低价值高实时场景不值得 ✓ 正确答案 D 第二模型与主模型同源可完全消除偏差
# 15. 流式输出的实时校验,如何在 token 流中尽早检测格式错误与敏感内容,边生成边校验与生成后校验的取舍? A 流式校验只能等生成完整后才能做,无实时性 B 对能实时判定的格式/敏感词用流式校验及早拦截,对需完整语义的用生成后校验,或流式粗检+生成后精检 ✓ 正确答案 C 流式校验能判定所有语义问题,无需生成后校验 D 敏感内容无法在流式阶段检测,只能生成后处理
# 16. 校验结果的一致性基线(多次校验一致率)如何建立,防止校验抖动造成误报 A 一致率基线与误报判定无关,无需建立 B 模型校验每次结果完全一致,无需考虑抖动 C 校验抖动会造成误报,但无需处理 D 应通过多次校验统计一致率、多数投票、固定随机参数来降低校验抖动,防止误报 ✓ 正确答案
# 17. 错误检测的闭环,失败样本如何回流到评测集与 Prompt 优化,形成持续改进? A 失败样本应回流到评测集(回归护栏)与 Prompt 优化(反例/约束),结合定期评估形成持续改进闭环 ✓ 正确答案 B 失败样本收集后应丢弃,避免污染系统 C 失败样本只需入库,无需回流使用 D 回流失败样本无需验证是否真提升了效果
# 18. 验证工具的组合,检索核对、执行测试与人工抽检在验证链路上如何分工,各自的覆盖率与成本如何 A 用自动的检索核对与执行测试做全量低成本覆盖,人工聚焦高风险/语义复杂部分,自动优先、人工聚焦 ✓ 正确答案 B 检索核对可覆盖所有输出类型,无需执行测试 C 所有验证都应人工做,最可靠 D 执行测试只能覆盖人工能判断的部分
# 19. 校验的延迟与成本预算,全量校验 vs 抽样校验在链路中的工程取舍? A 所有场景都应全量校验,哪怕成本翻倍 B 校验成本与风险无关,无需考虑 C 高风险场景全量校验,低风险海量场景抽样校验,并采用确定性全量+模型抽样+错误率动态升级的混合策略 ✓ 正确答案 D 低风险场景也应全量模型校验,保证覆盖
# 20. 校验器的自我校准,LLM-as-Judge 的置信度校准与一致性提升(投票、多次采样),校准后的阈值如何设定? A 应用标注集标定分数与实际正确率的映射,用多次采样/投票提升一致性,再按业务风险设定通过/拒绝阈值 ✓ 正确答案 B Judge 的分数天然等于正确概率,无需校准 C 校准阈值应固定不变,不随模型更新 D 多次采样只会增加成本,无法提升一致性