# 1. ReAct 循环中 Thought→Action→Observation 的失败如何被 Agent 自察 A 发现失败后应保持原计划不变,盲目继续下一步 B Agent 只需依赖模型直觉,无需任何外部信号即可发现失败 C 只要 Observation 格式合法就代表执行成功,无需检查内容 D 把工具失败结构化(错误码、可重试标志)写入 Observation,是模型能读懂失败并纠错的关键 ✓ 正确答案
# 2. Reflexion 框架如何让 Agent 基于环境反馈做语言化反思并改进 A Reflexion 通过微调模型权重来改善 Agent 行为 B Reflexion 把失败经验写成语言化反思文本,存入 memory 并在后续尝试中复用,无需梯度更新 ✓ 正确答案 C Reflexion 的反思文本必须由人工编写,不能由模型生成 D Reflexion 的反思只存在于单次会话,无法在后续尝试中复用
# 3. Self-Correction 在代码生成中如何避免"越改越错"的循环 A 每轮修改都应无条件采纳,即使通过测试数下降 B 模型只要"感觉更好"就应采纳,无需测试验证 C 用测试结果作为唯一收敛判据,测试通过数下降时回退到上一版本,避免越改越错 ✓ 正确答案 D 应一次性做最大改动,不需要保存失败快照
# 4. 多轮反思的收敛判据如何设计以避免无谓的 Token 消耗 A 只需设置最大轮数,无需关心是否还有改进 B 结合质量达标(验证通过/分数达阈值)与收益递减(连续无改进)信号,并叠加预算上限做早停 ✓ 正确答案 C 只要还没到预算就应一直反思,不必判断是否达标 D 收敛判据应只依赖模型自评,不依赖外部验证器
# 5. Agent 何时该放弃重试并升级给人类,而非无限自我修复 A 升级时只需给人类一句"处理不了",无需附上下文 B 任何失败都应无限重试,直到成功为止 C 所有错误都应立即升级给人类,无需尝试自动修复 D 应区分可重试与不可重试错误,对确定性错误、预算耗尽或高风险场景及时升级并附上下文摘要 ✓ 正确答案
# 6. Agent 反思(Reflection)的触发条件,何时值得二次推理,成本如何控制? A 应对每个输出都进行反思,以保证质量 B 反思应选择性触发(低置信、验证失败、高风险),并控制轮数与预算,避免无差别二次推理 ✓ 正确答案 C 反思只应对低风险任务触发,高风险任务直接执行 D 反思轮数应不限,直到模型满意为止
# 7. 自我纠正的"验证器"设计,工具结果校验、规则校验与模型自评如何分层? A 所有校验都应交给 LLM 自评,因为模型最智能 B 按确定性规则→工具结果→模型自评分层,规则层能拦截的短路处理,模型自评只覆盖语义层 ✓ 正确答案 C 确定性规则校验不可靠,应完全弃用 D 应由模型自评在最前,规则校验在后
# 8. Agent 的反思机制,Self-Refine、CRITIC 与自我评判? A Self-Refine 与 CRITIC 完全等价,没有区别 B 反思机制只能使用一种,不能组合 C CRITIC 不用外部工具,仅靠模型内省 D Self-Refine 用纯内省迭代,CRITIC 引入外部工具验证,自我评判作触发信号,三者可组合使用 ✓ 正确答案
# 9. 反思的实现,多轮采样与自评(self-verification)? A 多轮采样只生成一个候选,然后无限修正 B 多轮采样生成多个独立候选,再用自评或多数投票选出最优,可抵抗单次采样随机性 ✓ 正确答案 C 多轮采样与单次生成在成本上完全一致 D 多数投票只会放大模型偏见,应弃用
# 10. 反思的元认知设计,模型何时应拒答(承认不知道)而非反思重试,如何用校准阈值与评估集调参? A 模型应永不拒答,任何问题都须给出答案 B 校准阈值应固定不变,无需调参 C 拒答应完全随机,与置信度无关 D 置信度低于校准阈值且重试无改善时应拒答,阈值用带标注的评估集调参,权衡拒答率与覆盖率 ✓ 正确答案
# 11. 反思日志如何持久化以便同类任务复用历史教训 A 反思日志应结构化持久化,按任务类型/语义检索复用,并做去重与时效管理 ✓ 正确答案 B 同一教训反复注入也完全没问题,无需去重 C 反思只应存在单次会话内存中,用完即弃 D 反思日志应存储为不可检索的纯文本堆叠
# 12. 反思循环的终止条件,最大迭代次数、置信阈值与成本上限如何设置? A 只设最大迭代次数即可,无需其他条件 B 所有任务都应使用相同的轮数与预算 C 到达终止条件时返回最后一轮输出即可 D 终止条件由质量达标、最大迭代次数与成本上限三层构成,且按任务价值差异化设定 ✓ 正确答案
# 13. 反思的代价,多轮生成的延迟、Token 成本与质量收益应如何权衡 A 反思的次数越多质量一定越好,不必考虑收益递减 B 反思总是提升质量,应无条件多轮,无需考虑成本 C 应按场景权衡:延迟敏感场景限反思、质量敏感场景允许多轮,并量化收益递减与性价比 ✓ 正确答案 D 实时交互场景应尽量多轮反思以保证质量
# 14. 自我纠正的边界,何时该停止、何时该求助? A Agent 应永不停下,永远自行纠正直到成功 B 求助应作为最后手段,且不附任何上下文 C 只要成本允许就应一直自行纠正,不要求助 D 应明确停止信号(验证通过/无改进/预算耗尽)与求助信号(确定性错误/多次失败/高风险),低成本自解、高成本求助 ✓ 正确答案
# 15. 反思的评测,修正率与过度修正的平衡? A 同时度量修正率与破坏率,用净改善评估反思价值,避免只优化修正率导致过度修正 ✓ 正确答案 B 反思永远不会把正确输出改错 C 只需看修正率,越高越好 D 评测集只需包含错误样本,无需正确样本
# 16. 反思的停止条件,置信度阈值与预算控制? A 只需置信度阈值,无需预算控制 B 停止后应返回最后一轮输出 C 用置信度阈值做质量达标软条件、预算做硬性兜底,两者配合,停止时返回历史最优结果 ✓ 正确答案 D 预算只用于限制模型大小,与反思停止无关
# 17. 反思的工程化实现,LangGraph 中反思节点的状态设计、循环控制与成本上限? A 反思只能写成普通 for 循环,不能用图表达 B 用状态(State)维护生成/评估/轮数/成本,用条件边做循环控制,超限或达标时路由到终止边 ✓ 正确答案 C LangGraph 无法表达条件的循环控制 D 成本上限不能在状态中维护,只能写死在代码里