错误检测与验证

共 20 题
#

1. LLM-as-Judge 作为 Agent 输出校验器时存在哪些偏差、成本与校准问题,如何防止校验器与执行器同源偏好

A Judge 的评分是绝对可靠的,可直接作为概率使用
B Judge 完全不存在任何偏差,无需缓解
C 存在位置/长度/自我偏好等偏差与成本问题,应去同源、盲评、用 rubrics 并配合确定性校验缓解 ✓ 正确答案
D 执行器与校验器用同一模型可避免自我偏好
#

2. Agent 输出如何用形式化校验(schema/类型/单测)拦截低级错误

A JSON Schema 校验无法拦截任何错误,没什么用
B 用 JSON Schema 校验结构、类型/枚举/值域校验、单元测试拦截低级错误,并结合约束生成减少失败 ✓ 正确答案
C 单元测试只适用于数据,不适用于代码生成
D 形式化校验能保证语义正确,无需语义审查
#

3. Plan-and-Execute 模式中计划与执行偏差如何实时监控

A 计划完成后一次性检查即可,无需逐步比对
B 计划与执行之间应逐步比对,关键里程碑做计划级校验,发现偏差后局部修正、重规划或回退 ✓ 正确答案
C 发现偏差应立即回退到最初,不做局部修正
D 计划与执行完全不会偏差,无需监控
#

4. 工具调用失败(超时/异常/格式错)如何分类并差异化处理

A 所有失败都应立即升级,不进行任何重试
B 所有失败都应无限重试,同一种方式
C 应分类处理:超时/瞬时可退避重试,格式错纠正参数,权限/业务拒绝直接升级,并设总重试上限 ✓ 正确答案
D 格式错误也应不断重试,无需纠正参数
#

5. 幻觉在 Agent 长链路中如何被早期信号捕获而非末端爆发

A 幻觉只要在末端检测一次即可,之前无需检查
B 中间结果的置信度与幻觉无关,无需检测
C 幻觉检测只能等全部执行完才能做
D 应在每个关键环节做置信度/自洽性/证据锚定等轻量检测,早期纠正错误,避免累积放大 ✓ 正确答案
#

6. Agent 轨迹(trace)回放如何用于版本升级回归评测,不可回放节点(副作用工具、时效数据)如何处理

A 用 Mock 隔离副作用工具、冻结时效数据、固定随机性,保证轨迹可复现,才能稳定回放 ✓ 正确答案
B 时效数据无需冻结,重放结果自然一致
C 副作用工具(扣款/发信)可以直接原样重放,无需处理
D 回放时会随机失败,无法通过固定参数保证可复现
#

7. Agent 生成代码后自动运行测试并据失败信息回修的闭环设计

A 只需把"测试未通过"这五个字告诉模型即可,无需细节
B 把失败用例、断言差异、堆栈等结构化失败信息传给模型回修,并设最大轮数、保留历史最优版本 ✓ 正确答案
C 回修时应随意改动,无需考虑已通过的用例
D 回修轮数应无限,直到模型满意为止
#

8. Agent 输出的结构化校验,JSON Schema 验证、工具参数校验与可重试的错误分类如何设计?

A 工具参数无需校验,直接传给工具即可
B 只需校验 JSON 能解析即可,无需校验字段与参数
C 错误分类与重试策略无关,无需区分
D 应分层:JSON Schema 校验结构、参数校验范围/类型、错误分类区分可重试与不可重试,并复用同一份 schema 定义 ✓ 正确答案
#

9. LLM 输出的幻觉检测,事实性核对(引用检索)、自洽性检查与置信度阈值如何组合?

A 置信度阈值单独就足够可靠,无需其他信号
B 事实性核对依赖检索,但比自洽性检查更可靠
C 应组合事实性核对(证据比对)、自洽性检查(多次生成是否矛盾)与置信度阈值,先粗筛再精核 ✓ 正确答案
D 三种信号应各自独立使用,不组合
#

10. 输出检测的分层,语法(可解析)、语义(字段含义)与事实(证据支持)三层校验应如何组织,每层的失败处理有何不同

A 语法层最不可靠,应在最后做
B 三层校验必须同时进行,且失败处理相同
C 事实层最可靠,应放在最前做
D 按语法→语义→事实分层,逐层通过,语法层失败重试修复、语义层修正、事实层标记/降级/拒绝 ✓ 正确答案
#

11. 事实性验证的工程实现,基于检索的证据核对(grounding check)、矛盾检测与不确定声明标记?

A 抽取声明、检索证据、判断是否被支持,并标记/降级/引用不确定声明,形成抽取→检索→比对→标记管线 ✓ 正确答案
B 无证据支持的声明也应照常输出,无需标记
C grounding check 无需抽取声明,直接整体比对即可
D grounding check 只需把整个输出与整篇文档做一次相似度比较即可
#

12. 错误检测的效果度量,检出率、误报率与漏放率的定义与权衡,如何用带标注的 bad case 集评估校验器本身?

A 检出率越高越好,误报率无关紧要
B 应定义检出率(召回)、误报率、漏放率并用带标注的 bad case 集评估,按业务风险权衡阈值 ✓ 正确答案
C 只评估错误样本即可,无需真实分布
D 误报率与漏放率总是一方为零,无需权衡
#

13. 校验器与业务规则引擎的协作,哪些错误应交给确定性规则(金额、日期、枚举),哪些交给模型校验,规则与模型的边界如何划分?

A 金额/日期/枚举等可确定判断的交给规则,语义/事实/合规交给模型,规则先行、模型兜底 ✓ 正确答案
B 所有校验都应交给模型,因为规则写不全
C 所有校验都应写成规则,因为模型不可靠
D 规则校验应在模型校验之后进行
#

14. 多模型交叉验证的工程代价,用强模型复核弱模型输出(或反之)的成本与收益,什么场景下值得引入第二模型?

A 任何场景都应引入第二模型复核,以保证质量
B 强模型复核弱模型永远比弱模型复核强模型好
C 根据错误代价与验证成本权衡,高风险高价值场景值得引入第二模型,低价值高实时场景不值得 ✓ 正确答案
D 第二模型与主模型同源可完全消除偏差
#

15. 流式输出的实时校验,如何在 token 流中尽早检测格式错误与敏感内容,边生成边校验与生成后校验的取舍?

A 流式校验只能等生成完整后才能做,无实时性
B 对能实时判定的格式/敏感词用流式校验及早拦截,对需完整语义的用生成后校验,或流式粗检+生成后精检 ✓ 正确答案
C 流式校验能判定所有语义问题,无需生成后校验
D 敏感内容无法在流式阶段检测,只能生成后处理
#

16. 校验结果的一致性基线(多次校验一致率)如何建立,防止校验抖动造成误报

A 一致率基线与误报判定无关,无需建立
B 模型校验每次结果完全一致,无需考虑抖动
C 校验抖动会造成误报,但无需处理
D 应通过多次校验统计一致率、多数投票、固定随机参数来降低校验抖动,防止误报 ✓ 正确答案
#

17. 错误检测的闭环,失败样本如何回流到评测集与 Prompt 优化,形成持续改进?

A 失败样本应回流到评测集(回归护栏)与 Prompt 优化(反例/约束),结合定期评估形成持续改进闭环 ✓ 正确答案
B 失败样本收集后应丢弃,避免污染系统
C 失败样本只需入库,无需回流使用
D 回流失败样本无需验证是否真提升了效果
#

18. 验证工具的组合,检索核对、执行测试与人工抽检在验证链路上如何分工,各自的覆盖率与成本如何

A 用自动的检索核对与执行测试做全量低成本覆盖,人工聚焦高风险/语义复杂部分,自动优先、人工聚焦 ✓ 正确答案
B 检索核对可覆盖所有输出类型,无需执行测试
C 所有验证都应人工做,最可靠
D 执行测试只能覆盖人工能判断的部分
#

19. 校验的延迟与成本预算,全量校验 vs 抽样校验在链路中的工程取舍?

A 所有场景都应全量校验,哪怕成本翻倍
B 校验成本与风险无关,无需考虑
C 高风险场景全量校验,低风险海量场景抽样校验,并采用确定性全量+模型抽样+错误率动态升级的混合策略 ✓ 正确答案
D 低风险场景也应全量模型校验,保证覆盖
#

20. 校验器的自我校准,LLM-as-Judge 的置信度校准与一致性提升(投票、多次采样),校准后的阈值如何设定?

A 应用标注集标定分数与实际正确率的映射,用多次采样/投票提升一致性,再按业务风险设定通过/拒绝阈值 ✓ 正确答案
B Judge 的分数天然等于正确概率,无需校准
C 校准阈值应固定不变,不随模型更新
D 多次采样只会增加成本,无法提升一致性