# 1. 多 Agent 系统的级联失败如何检测与熔断 A 级联失败无法检测 B 监控错误率/超时/依赖健康定位故障源,断路器熔断切断传播,配超时与降级防扩散 ✓ 正确答案 C 熔断一次后永远断开 D 级联失败只影响单个 Agent
# 2. 如何为每个 Agent 设置独立的预算、步数上限与超时 A 每个 Agent 应共享同一预算,无需独立 B 超时后应无限重试 C 步数上限会限制 Agent 能力,不应设置 D 为每个 Agent 设 token/成本预算、步数上限与超时,超限触发降级并记录超限环节 ✓ 正确答案
# 3. 多 Agent 决策的可解释性如何向业务方呈现 A 直接给业务方展示完整 token 轨迹即可 B 可解释性只需技术方理解 C 用决策摘要+证据链+置信度标注,把技术轨迹翻译成业务可核验的语言 ✓ 正确答案 D 业务方无需核验证据
# 4. Agent 间循环调用(A↔B)如何检测与打破 A 用步数上限+重复状态去重检测循环,超限终止或降级,记录日志分析根因 ✓ 正确答案 B 循环调用只能靠人工发现 C 循环调用检测会误伤正常调用,不应做 D Agent 循环调用无成本,无需处理
# 5. 多 Agent 系统的成本归因如何分摊到具体子任务 A 采集 token/模型/工具成本,按 traceId 关联到子任务,按任务/Agent/工具/用户多维归因 ✓ 正确答案 B 成本只能按总任务统计,无法细分 C 缓存成本应归因到每个调用者 D 成本归因与优化无关
# 6. 多 Agent 流水线中哪些节点必须设置人工审批(生产变更、资金操作、对外发送),中断与恢复如何工程化实现而不丢上下文 A 生产变更/资金/对外发送等不可逆操作前设审批,用 checkpoint 持久化状态支持中断恢复 ✓ 正确答案 B 所有节点都需人工审批才安全 C 审批会中断整个流程,应避免 D 审批后上下文必然丢失
# 7. 人工审批超时时的降级策略(自动通过、自动拒绝、转人工队列)如何按风险等级设定不同默认值 A 所有审批超时都应自动通过 B 高风险操作超时应自动通过提升效率 C 按风险等级设定默认值:高风险自动拒绝、中风险转队列、低风险自动通过,并记录审计 ✓ 正确答案 D 超时降级无需审计
# 8. 部分成功合并,子任务部分失败时如何聚合部分结果并标记不确定性,避免整体重跑? A 任一子任务失败就整体重跑全部 B 部分失败的结果应直接丢弃 C 聚合成功结果、局部重试失败子任务,标记部分结果与不确定性,避免整体重跑 ✓ 正确答案 D 部分成功无需标记缺口
# 9. 背压与过载保护,下游 Agent 或 LLM 响应变慢时,队列深度、限流与请求丢弃如何协同防止过载扩散? A 下游慢时无限堆积请求,等待恢复 B 用有限队列背压+限流控制速率+丢弃/熔断处理过载,快速失败防扩散 ✓ 正确答案 C 背压只影响发送方 D 过载时应无限重试
# 10. 多 Agent 系统中审批请求如何路由到正确的 owner(按 Agent、按资源),防止人人都以为别人会批 A 审批单应广播给所有相关人,谁批都行 B 审批路由与审计无关 C owner 无需唯一,人人可批即可 D 审批按 Agent/资源/角色路由到唯一 owner,配状态流转与超时升级,防止责任漂移 ✓ 正确答案
# 11. 如何向审批人呈现 Agent 的中间推理与工具调用摘要,降低审核成本又不泄露敏感正文 A 应把完整原始正文展示给审批人 B 展示推理与工具调用摘要、脱敏敏感信息、结论前置且证据可核验,降低审核成本 ✓ 正确答案 C 摘要无法支撑审批判断 D 脱敏会破坏审批有效性,不应做
# 12. 人机协同下 Agent 决策的责任边界与审计留痕如何设计,记录中如何区分人批准与 Agent 自主 A 所有决策都记为 Agent 自主 B 明确人批/Agent 自主的边界,记录含操作者类型与审批轨迹,让每个决策可追溯负责人 ✓ 正确答案 C 责任边界与合规无关 D 审计留痕无需区分决策者
# 13. 审批决定本身如何版本化与可回放,支持事后审计与同类场景复用 A 审批决定带版本与上下文快照,可回放审计,并沉淀为先例库供同类场景复用 ✓ 正确答案 B 审批决定只需记录结果,无需上下文 C 审批决定不可复用 D 版本化与审计无关
# 14. 如何防止审批疲劳(弹窗过频导致一律同意),审批频率与质量如何度量与优化 A 聚合/分级/合理默认值减少噪音,用频率、驳回率、事故率度量并优化审批质量,防疲劳 ✓ 正确答案 B 审批弹窗越多越安全 C 审批疲劳无法度量 D 一律同意会提高审批质量
# 15. LangGraph interrupt/resume 在长任务人工介入中的状态持久化如何设计,才能支持进程重启后恢复与跨节点审批 A interrupt 后上下文必然丢失 B 用 checkpointer 持久化状态,interrupt 暂停、resume 恢复,支持进程重启恢复与跨节点审批 ✓ 正确答案 C interrupt 一次后无法继续 D 人工审批不需要状态持久化
# 16. Agent 系统的可靠性,重试、超时与幂等在节点级与任务级应如何分层配置,避免重试风暴 A 重试次数越多越可靠 B 所有错误都应无限重试 C 节点级快速失败、任务级兜底,指数退避+抖动+上限+幂等+共享预算,避免重试风暴 ✓ 正确答案 D 幂等与重试无关
# 17. 告警风暴降噪,同类错误并发时如何聚合、去重并按根因分组,避免告警疲劳? A 告警聚合会漏掉故障 B 每条错误都应单独告警,越多越详尽 C 告警风暴无法处理 D 同类错误聚合去重、按根因分组,分级+窗口+静默抑制,防告警疲劳 ✓ 正确答案
# 18. 多 Agent 追踪(trace)如何在 LangSmith/Arize 中聚合展示 A 追踪平台只能展示单一 LLM 调用 B 追踪平台与调优无关 C 多 Agent 无法被追踪聚合 D LangSmith/Arize 把多 Agent 的 span 按 traceId 聚合为调用链,按 Agent/工具/模型统计 token、延迟与错误 ✓ 正确答案
# 19. Agent 的观测,执行轨迹、工具调用序列与 token 统计应如何记录,异常定位与成本归因如何复用这些数据 A 观测只需记录最终结果 B 记录执行轨迹、工具调用与 token,按 traceId 关联,支撑异常回放与成本归因 ✓ 正确答案 C 观测数据无法复用 D token 统计与成本无关
# 20. trace 采样策略,高并发下如何保留失败样本与关键链路,控制存储成本? A 优先全量保留失败与关键链路,常规按比例采样,配过期与聚合控制存储成本 ✓ 正确答案 B 采样后无法定位失败 C 失败样本也应按低比例采样 D 高并发下应全量存所有 trace