1. Agentic RAG 把检索、改写和证据评估做成工具后,怎样限制循环、成本与非确定性
Agentic RAG 把检索、改写与证据评估做成工具后,如何限制循环、成本与非确定性?
- Agentic RAG 的循环风险(无限检索、重复改写)
- 成本控制机制(步数上限、Token 预算、并行与缓存)
- 非确定性的来源与治理(采样温度、路由抖动)
Agentic RAG 让模型自主决定"是否检索、怎么检索、如何用证据",带来了三方面的失控风险。循环限制:设置硬性步数上限(如最多 3 轮检索)、单轮工具调用的次数上限;检测"查询-结果循环"——同一查询重复检索且结果无变化时强制终止;对改写结果做去重(改写后查询与历史查询相似度高于阈值则停止扩展)。成本控制:为每轮分配 Token 预算(输入输出上限),工具返回内容做裁剪(只保留 top-k 证据与元数据);子查询并行执行而非串行;对相同查询与相同工具的调用做缓存(结果缓存、改写缓存);用小模型做路由决策、大模型只做最终生成(分层成本);全链路按 session 累计成本监控,超预算降级为"固定检索 + 生成"。非确定性治理:检索决策与生成使用低温度(0-0.3)并固定种子;路由/终止决策输出 JSON 结构化结果并记录决策日志;相同输入的可复现性用"决策树回放"验证;对不确定分支设置默认兜底路径(如无法确认时走"无法回答"而不是自由发挥)。最后用"轨迹评估集"验证:在标准 Agentic 任务上统计平均步数、成本、成功率与退出原因分布。
Agentic RAG 的能力来自"自主",风险也来自"自主":循环与成本失控是工程层问题,非确定性是模型层问题。答题按"循环限制(硬上限+循环检测)→成本控制(预算+缓存+分层模型)→非确定性治理(低温+结构化输出+回放验证)"三层展开,缺一不可。