反思与自我纠正

共 17 题
#

1. ReAct 循环中 Thought→Action→Observation 的失败如何被 Agent 自察

A 发现失败后应保持原计划不变,盲目继续下一步
B Agent 只需依赖模型直觉,无需任何外部信号即可发现失败
C 只要 Observation 格式合法就代表执行成功,无需检查内容
D 把工具失败结构化(错误码、可重试标志)写入 Observation,是模型能读懂失败并纠错的关键 ✓ 正确答案
#

2. Reflexion 框架如何让 Agent 基于环境反馈做语言化反思并改进

A Reflexion 通过微调模型权重来改善 Agent 行为
B Reflexion 把失败经验写成语言化反思文本,存入 memory 并在后续尝试中复用,无需梯度更新 ✓ 正确答案
C Reflexion 的反思文本必须由人工编写,不能由模型生成
D Reflexion 的反思只存在于单次会话,无法在后续尝试中复用
#

3. Self-Correction 在代码生成中如何避免"越改越错"的循环

A 每轮修改都应无条件采纳,即使通过测试数下降
B 模型只要"感觉更好"就应采纳,无需测试验证
C 用测试结果作为唯一收敛判据,测试通过数下降时回退到上一版本,避免越改越错 ✓ 正确答案
D 应一次性做最大改动,不需要保存失败快照
#

4. 多轮反思的收敛判据如何设计以避免无谓的 Token 消耗

A 只需设置最大轮数,无需关心是否还有改进
B 结合质量达标(验证通过/分数达阈值)与收益递减(连续无改进)信号,并叠加预算上限做早停 ✓ 正确答案
C 只要还没到预算就应一直反思,不必判断是否达标
D 收敛判据应只依赖模型自评,不依赖外部验证器
#

5. Agent 何时该放弃重试并升级给人类,而非无限自我修复

A 升级时只需给人类一句"处理不了",无需附上下文
B 任何失败都应无限重试,直到成功为止
C 所有错误都应立即升级给人类,无需尝试自动修复
D 应区分可重试与不可重试错误,对确定性错误、预算耗尽或高风险场景及时升级并附上下文摘要 ✓ 正确答案
#

6. Agent 反思(Reflection)的触发条件,何时值得二次推理,成本如何控制?

A 应对每个输出都进行反思,以保证质量
B 反思应选择性触发(低置信、验证失败、高风险),并控制轮数与预算,避免无差别二次推理 ✓ 正确答案
C 反思只应对低风险任务触发,高风险任务直接执行
D 反思轮数应不限,直到模型满意为止
#

7. 自我纠正的"验证器"设计,工具结果校验、规则校验与模型自评如何分层?

A 所有校验都应交给 LLM 自评,因为模型最智能
B 按确定性规则→工具结果→模型自评分层,规则层能拦截的短路处理,模型自评只覆盖语义层 ✓ 正确答案
C 确定性规则校验不可靠,应完全弃用
D 应由模型自评在最前,规则校验在后
#

8. Agent 的反思机制,Self-Refine、CRITIC 与自我评判?

A Self-Refine 与 CRITIC 完全等价,没有区别
B 反思机制只能使用一种,不能组合
C CRITIC 不用外部工具,仅靠模型内省
D Self-Refine 用纯内省迭代,CRITIC 引入外部工具验证,自我评判作触发信号,三者可组合使用 ✓ 正确答案
#

9. 反思的实现,多轮采样与自评(self-verification)?

A 多轮采样只生成一个候选,然后无限修正
B 多轮采样生成多个独立候选,再用自评或多数投票选出最优,可抵抗单次采样随机性 ✓ 正确答案
C 多轮采样与单次生成在成本上完全一致
D 多数投票只会放大模型偏见,应弃用
#

10. 反思的元认知设计,模型何时应拒答(承认不知道)而非反思重试,如何用校准阈值与评估集调参?

A 模型应永不拒答,任何问题都须给出答案
B 校准阈值应固定不变,无需调参
C 拒答应完全随机,与置信度无关
D 置信度低于校准阈值且重试无改善时应拒答,阈值用带标注的评估集调参,权衡拒答率与覆盖率 ✓ 正确答案
#

11. 反思日志如何持久化以便同类任务复用历史教训

A 反思日志应结构化持久化,按任务类型/语义检索复用,并做去重与时效管理 ✓ 正确答案
B 同一教训反复注入也完全没问题,无需去重
C 反思只应存在单次会话内存中,用完即弃
D 反思日志应存储为不可检索的纯文本堆叠
#

12. 反思循环的终止条件,最大迭代次数、置信阈值与成本上限如何设置?

A 只设最大迭代次数即可,无需其他条件
B 所有任务都应使用相同的轮数与预算
C 到达终止条件时返回最后一轮输出即可
D 终止条件由质量达标、最大迭代次数与成本上限三层构成,且按任务价值差异化设定 ✓ 正确答案
#

13. 反思的代价,多轮生成的延迟、Token 成本与质量收益应如何权衡

A 反思的次数越多质量一定越好,不必考虑收益递减
B 反思总是提升质量,应无条件多轮,无需考虑成本
C 应按场景权衡:延迟敏感场景限反思、质量敏感场景允许多轮,并量化收益递减与性价比 ✓ 正确答案
D 实时交互场景应尽量多轮反思以保证质量
#

14. 自我纠正的边界,何时该停止、何时该求助?

A Agent 应永不停下,永远自行纠正直到成功
B 求助应作为最后手段,且不附任何上下文
C 只要成本允许就应一直自行纠正,不要求助
D 应明确停止信号(验证通过/无改进/预算耗尽)与求助信号(确定性错误/多次失败/高风险),低成本自解、高成本求助 ✓ 正确答案
#

15. 反思的评测,修正率与过度修正的平衡?

A 同时度量修正率与破坏率,用净改善评估反思价值,避免只优化修正率导致过度修正 ✓ 正确答案
B 反思永远不会把正确输出改错
C 只需看修正率,越高越好
D 评测集只需包含错误样本,无需正确样本
#

16. 反思的停止条件,置信度阈值与预算控制?

A 只需置信度阈值,无需预算控制
B 停止后应返回最后一轮输出
C 用置信度阈值做质量达标软条件、预算做硬性兜底,两者配合,停止时返回历史最优结果 ✓ 正确答案
D 预算只用于限制模型大小,与反思停止无关
#

17. 反思的工程化实现,LangGraph 中反思节点的状态设计、循环控制与成本上限?

A 反思只能写成普通 for 循环,不能用图表达
B 用状态(State)维护生成/评估/轮数/成本,用条件边做循环控制,超限或达标时路由到终止边 ✓ 正确答案
C LangGraph 无法表达条件的循环控制
D 成本上限不能在状态中维护,只能写死在代码里