AI Agent 工程化与生产实践

共 17 题
#

1. Agent 在生产环境的成功率基线,SWE-bench Verified、WebArena、OSWorld 等基准的数字会随模型代际快速变化,为何不能直接外推为生产成功率,如何理解这些基准与 Demo 表现的差距?

A 基准分数可直接作为生产成功率
B 基准过拟合不影响其作为生产基线的价值
C Demo 表现就等于生产表现
D 基准数字会随代际快速变化且与生产环境差异大,应作为趋势参照,用企业自有评测集建立真实生产基线 ✓ 正确答案
#

2. Agent 可观测性的三大支柱,Token 成本、任务完成率、错误类型分布;如何用 Langfuse/LangSmith/Helicone 构建 Dashboard?

A 三大支柱是 Token 成本、任务完成率、错误类型分布,用观测平台采集 trace 并聚合展示、设告警 ✓ 正确答案
B 只需记录 token 用量即可
C 错误类型无需细分,统一记为失败
D Dashboard 只能看原始日志,无法聚合
#

3. Agent 失败的常见模式,循环(Loop)、幻觉(Hallucination)、参数错填、工具超时;如何设计检测 + 熔断 + 回退的兜底链?

A Agent 失败只能靠人工发现
B 熔断会永远中断任务,应避免
C 应对循环、幻觉、参数错填、工具超时分别设计检测、熔断与回退,形成可约束的兜底链 ✓ 正确答案
D 参数错填无需校验,模型会自行修复
#

4. Multi-Agent 系统的成本治理,Supervisor/Worker 模式下的总 token 是单一 Agent 的 3-10x,如何分摊与配额?

A Multi-Agent 成本与单 Agent 相同
B 成本无法按 Agent 归集
C 多 Agent 不应设配额,以免影响效果
D 应建立按任务/租户/团队的成本分摊与配额,用缓存压缩上下文,并评估成本放大带来的质量收益是否值得 ✓ 正确答案
#

5. Human-in-the-Loop(HITL)实际落地,哪些步骤必须人审?置信度阈值如何与 UX 平衡?

A 所有步骤都应人审以保证安全
B 置信度只由模型决定,与后果无关
C 高风险/不可逆/敏感操作必须人审,置信度阈值应随后果严重度调整,并用异步与应用队列平衡 UX ✓ 正确答案
D 人审不需要 UX 设计
#

6. Agent 的状态持久化,哪些状态必须保存(对话上下文、工具结果、审批状态),哪些可以按需重建?

A 所有中间结果都必须持久化
B 状态无需持久化,重启后重建即可
C 对话上下文、工具结果、审批状态等关键状态必须保存,可重算的中间结果可按需重建 ✓ 正确答案
D 工具结果无需保存,每次重新调用
#

7. Agent 多会话并发时如何隔离上下文、工具会话与配额,防止单个任务耗尽共享资源?

A 所有会话共享同一上下文即可
B 应隔离上下文、工具会话与配额,并为每个任务设独立限额与并发上限,防止单任务耗尽共享资源 ✓ 正确答案
C 工具凭证可全局共用
D 配额隔离不重要,重在效果
#

8. Agent 的测试分层,工具 mock、轨迹快照回放与 E2E 评估集(AgentBench 类)在 CI 中的工程实践?

A 分层为工具 mock、轨迹快照回放、E2E 评估集,MR 跑快层、夜间跑 E2E,并纳入发布门禁 ✓ 正确答案
B 只需跑 E2E 评估即可
C 轨迹回放无法用于回归测试
D 测试分层层层都慢,无法进 CI
#

9. Agent Memory 的层次化设计,Working Memory(当前会话)、Episodic Memory(用户历史)、Semantic Memory(事实库)的协同?

A 所有记忆都放在同一个缓冲区
B 记忆只需存用户输入,无需存结果
C Working/Episodic/Semantic 三种记忆分别管会话、历史、知识,按需检索注入当前上下文并做好权限控制 ✓ 正确答案
D 记忆不需要清理,一直保留
#

10. Agent 在长任务(>30 分钟)中的 Context Window 管理,自动压缩、关键事实提取、工具结果缓存的工程实现?

A 应通过自动压缩、关键事实提取与工具结果缓存,把窗口变成"摘要+按需事实+当前块"的分层结构 ✓ 正确答案
B 上下文越长越好,无需管理
C 工具结果每次都重新调用并注入,不用缓存
D 长任务只能靠换更大窗口模型
#

11. Agent 的工具权限应如何按最小权限授予,外部内容注入(网页、文档、工具结果)如何与系统指令隔离?

A 应给 Agent 全部权限以提升效率
B 应按最小权限授予并隔离凭证,用标记隔开系统指令与外部内容,外部内容不可执行指令 ✓ 正确答案
C 外部内容与系统指令同等信任
D 工具结果可以同时携带指令被执行
#

12. Agent 多轮任务的 token 消耗应如何预算与控制(最大步数、上下文压缩、工具结果裁剪)?

A 应通过最大步数、上下文压缩与工具结果裁剪做全链路预算控制,并设任务级 token 硬上限 ✓ 正确答案
B 预算无需控制,完成任务最重要
C 工具结果必须全量注入,不能裁剪
D 最大步数限制会降低质量,应取消
#

13. Agent 评测应如何区分任务完成率、效率与成本三个维度,企业自有评测集如何构建并纳入发布门禁?

A 只看任务完成率即可
B 成本不应纳入评测,以免影响质量
C 评测集只能从公开基准取
D 应区分完成率、效率、成本三维度,用真实采样构建自有评测集并设发布门禁 ✓ 正确答案
#

14. Agent 执行轨迹应记录哪些事件(思考、工具调用、重试、终止原因),才能在故障时复现并定位循环与误调用?

A 应记录思考、工具调用、重试、终止原因等结构化事件及上下文快照,以便故障时可复现并定位循环与误调用 ✓ 正确答案
B 只记录最终结果即可
C 轨迹只需记录耗时,无需记录内容
D 终止原因无需记录
#

15. Agent 崩溃或断线后如何从状态快照恢复,并保证未完成的副作用调用不会被重复执行?

A 崩溃后直接重跑整个任务即可
B 应从状态快照恢复,并用幂等键 + 状态机保证副作用调用不会被重复执行 ✓ 正确答案
C 副作用无法幂等,只能接受重复
D 快照只需要在任务结束时保存
#

16. 长任务中途中断后如何恢复(检查点、重放、人工接管),重放边界应如何确定?

A 中断后可直接从头重跑
B 检查点越多越慢,应少设
C 重放边界无需考虑副作用
D 应从无副作用的完整检查点开始重放,重放区域内副作用必须幂等,必要时人工接管 ✓ 正确答案
#

17. Agent 的组合版本发布,Prompt、工具 Schema、模型与知识库的版本绑定与一键回滚?

A 只需对模型版本做管理
B 各组件独立发布即可,无需绑定
C 应把 Prompt、工具 Schema、模型与知识库绑定成组合版本,原子发布并支持一键回滚 ✓ 正确答案
D 回滚只需换模型,提示词无需还原