可靠性、观测

共 20 题
#

1. 多 Agent 系统的级联失败如何检测与熔断

A 级联失败无法检测
B 监控错误率/超时/依赖健康定位故障源,断路器熔断切断传播,配超时与降级防扩散 ✓ 正确答案
C 熔断一次后永远断开
D 级联失败只影响单个 Agent
#

2. 如何为每个 Agent 设置独立的预算、步数上限与超时

A 每个 Agent 应共享同一预算,无需独立
B 超时后应无限重试
C 步数上限会限制 Agent 能力,不应设置
D 为每个 Agent 设 token/成本预算、步数上限与超时,超限触发降级并记录超限环节 ✓ 正确答案
#

3. 多 Agent 决策的可解释性如何向业务方呈现

A 直接给业务方展示完整 token 轨迹即可
B 可解释性只需技术方理解
C 用决策摘要+证据链+置信度标注,把技术轨迹翻译成业务可核验的语言 ✓ 正确答案
D 业务方无需核验证据
#

4. Agent 间循环调用(A↔B)如何检测与打破

A 用步数上限+重复状态去重检测循环,超限终止或降级,记录日志分析根因 ✓ 正确答案
B 循环调用只能靠人工发现
C 循环调用检测会误伤正常调用,不应做
D Agent 循环调用无成本,无需处理
#

5. 多 Agent 系统的成本归因如何分摊到具体子任务

A 采集 token/模型/工具成本,按 traceId 关联到子任务,按任务/Agent/工具/用户多维归因 ✓ 正确答案
B 成本只能按总任务统计,无法细分
C 缓存成本应归因到每个调用者
D 成本归因与优化无关
#

6. 多 Agent 流水线中哪些节点必须设置人工审批(生产变更、资金操作、对外发送),中断与恢复如何工程化实现而不丢上下文

A 生产变更/资金/对外发送等不可逆操作前设审批,用 checkpoint 持久化状态支持中断恢复 ✓ 正确答案
B 所有节点都需人工审批才安全
C 审批会中断整个流程,应避免
D 审批后上下文必然丢失
#

7. 人工审批超时时的降级策略(自动通过、自动拒绝、转人工队列)如何按风险等级设定不同默认值

A 所有审批超时都应自动通过
B 高风险操作超时应自动通过提升效率
C 按风险等级设定默认值:高风险自动拒绝、中风险转队列、低风险自动通过,并记录审计 ✓ 正确答案
D 超时降级无需审计
#

8. 部分成功合并,子任务部分失败时如何聚合部分结果并标记不确定性,避免整体重跑?

A 任一子任务失败就整体重跑全部
B 部分失败的结果应直接丢弃
C 聚合成功结果、局部重试失败子任务,标记部分结果与不确定性,避免整体重跑 ✓ 正确答案
D 部分成功无需标记缺口
#

9. 背压与过载保护,下游 Agent 或 LLM 响应变慢时,队列深度、限流与请求丢弃如何协同防止过载扩散?

A 下游慢时无限堆积请求,等待恢复
B 用有限队列背压+限流控制速率+丢弃/熔断处理过载,快速失败防扩散 ✓ 正确答案
C 背压只影响发送方
D 过载时应无限重试
#

10. 多 Agent 系统中审批请求如何路由到正确的 owner(按 Agent、按资源),防止人人都以为别人会批

A 审批单应广播给所有相关人,谁批都行
B 审批路由与审计无关
C owner 无需唯一,人人可批即可
D 审批按 Agent/资源/角色路由到唯一 owner,配状态流转与超时升级,防止责任漂移 ✓ 正确答案
#

11. 如何向审批人呈现 Agent 的中间推理与工具调用摘要,降低审核成本又不泄露敏感正文

A 应把完整原始正文展示给审批人
B 展示推理与工具调用摘要、脱敏敏感信息、结论前置且证据可核验,降低审核成本 ✓ 正确答案
C 摘要无法支撑审批判断
D 脱敏会破坏审批有效性,不应做
#

12. 人机协同下 Agent 决策的责任边界与审计留痕如何设计,记录中如何区分人批准与 Agent 自主

A 所有决策都记为 Agent 自主
B 明确人批/Agent 自主的边界,记录含操作者类型与审批轨迹,让每个决策可追溯负责人 ✓ 正确答案
C 责任边界与合规无关
D 审计留痕无需区分决策者
#

13. 审批决定本身如何版本化与可回放,支持事后审计与同类场景复用

A 审批决定带版本与上下文快照,可回放审计,并沉淀为先例库供同类场景复用 ✓ 正确答案
B 审批决定只需记录结果,无需上下文
C 审批决定不可复用
D 版本化与审计无关
#

14. 如何防止审批疲劳(弹窗过频导致一律同意),审批频率与质量如何度量与优化

A 聚合/分级/合理默认值减少噪音,用频率、驳回率、事故率度量并优化审批质量,防疲劳 ✓ 正确答案
B 审批弹窗越多越安全
C 审批疲劳无法度量
D 一律同意会提高审批质量
#

15. LangGraph interrupt/resume 在长任务人工介入中的状态持久化如何设计,才能支持进程重启后恢复与跨节点审批

A interrupt 后上下文必然丢失
B 用 checkpointer 持久化状态,interrupt 暂停、resume 恢复,支持进程重启恢复与跨节点审批 ✓ 正确答案
C interrupt 一次后无法继续
D 人工审批不需要状态持久化
#

16. Agent 系统的可靠性,重试、超时与幂等在节点级与任务级应如何分层配置,避免重试风暴

A 重试次数越多越可靠
B 所有错误都应无限重试
C 节点级快速失败、任务级兜底,指数退避+抖动+上限+幂等+共享预算,避免重试风暴 ✓ 正确答案
D 幂等与重试无关
#

17. 告警风暴降噪,同类错误并发时如何聚合、去重并按根因分组,避免告警疲劳?

A 告警聚合会漏掉故障
B 每条错误都应单独告警,越多越详尽
C 告警风暴无法处理
D 同类错误聚合去重、按根因分组,分级+窗口+静默抑制,防告警疲劳 ✓ 正确答案
#

18. 多 Agent 追踪(trace)如何在 LangSmith/Arize 中聚合展示

A 追踪平台只能展示单一 LLM 调用
B 追踪平台与调优无关
C 多 Agent 无法被追踪聚合
D LangSmith/Arize 把多 Agent 的 span 按 traceId 聚合为调用链,按 Agent/工具/模型统计 token、延迟与错误 ✓ 正确答案
#

19. Agent 的观测,执行轨迹、工具调用序列与 token 统计应如何记录,异常定位与成本归因如何复用这些数据

A 观测只需记录最终结果
B 记录执行轨迹、工具调用与 token,按 traceId 关联,支撑异常回放与成本归因 ✓ 正确答案
C 观测数据无法复用
D token 统计与成本无关
#

20. trace 采样策略,高并发下如何保留失败样本与关键链路,控制存储成本?

A 优先全量保留失败与关键链路,常规按比例采样,配过期与聚合控制存储成本 ✓ 正确答案
B 采样后无法定位失败
C 失败样本也应按低比例采样
D 高并发下应全量存所有 trace