# 1. Anthropic MCP 协议(稳定规范)在多 Agent 工具调用的工程价值 A MCP 用标准化协议统一工具接入,多 Agent 以统一方式调用工具,提升可移植与可维护性 ✓ 正确答案 B MCP 是 Anthropic 私有 API,不开放 C MCP 只用于单个 LLM 调用 D MCP 与多 Agent 无关
# 2. Google A2A(Agent-to-Agent)协议在跨厂商 Agent 互操作的工程价值 A A2A 只用于 Agent 调用工具 B A2A 与 MCP 功能完全相同 C A2A 是 Google 封闭协议,无互操作价值 D A2A 定义跨厂商 Agent 间能力发现、任务委派与消息交换的标准,支持异构 Agent 协作 ✓ 正确答案
# 3. 短期记忆(Context Window)、长期记忆(Vector Store)、情景记忆(Episodic)的工程设计 A 三类记忆功能完全相同 B 短期记忆管上下文窗口、长期记忆存向量库、情景记忆存过往事件,各配生命周期与检索 ✓ 正确答案 C 长期记忆只需存最终答案 D 情景记忆无需结构化
# 4. MemGPT、Letta 的分层记忆架构的工程价值 A MemGPT 只是把记忆全存进上下文 B MemGPT 无法管理长对话 C 分层记忆只适用于单轮 D MemGPT 借鉴 OS 内存分层,把记忆分主上下文与外部存储,自动换页归档与检索,突破窗口限制 ✓ 正确答案
# 5. Agent 状态机(Finite State Machine)在多步任务中的工程实战 A FSM 状态无需持久化 B FSM 会限制 Agent 全部能力,应避免 C FSM 与 LLM 无法结合 D 用 FSM 建模确定性状态与转移,LLM 只在决策点选择转移,保证流程可控可恢复 ✓ 正确答案
# 6. Agent 工具调用成功率、任务完成率、Token 消耗的评估体系 A 只需看任务完成率,不需管 token B token 消耗无法统计 C 工具成功率与完成率无关 D 用工具成功率、任务完成率、token 构建质量/效率/成本三角指标,用评测集统计并联动优化 ✓ 正确答案
# 7. ReAct、Reflexion、Plan-and-Execute、AutoGPT 等范式在工具调用频率、失败恢复与 token 开销上应如何实测对比后选型? A AutoGPT 的 token 开销最低 B ReAct 不消耗额外 token C 各范式在工具频率、失败恢复、token 上差异大,需在相同评测集上实测完成后按任务选型 ✓ 正确答案 D 所有范式效果相同
# 8. Agent 跨会话记忆应保存哪些事实与偏好、如何设置过期与撤回,才能在个性化与隐私之间取得平衡? A 应保存所有用户信息以最大化个性化 B 跨会话记忆不可删除 C 隐私与个性化必须二选一 D 保存用户知情且有用的偏好,敏感信息不存,配 TTL 过期与用户可撤回删除,平衡隐私与个性化 ✓ 正确答案
# 9. Agent Cost 监控(按任务、按用户、按工具)的工程实战 A 成本监控与优化无关 B 成本只能按整体统计 C 采集 token/模型/工具成本,按任务/用户/工具归因,设预算与告警,用成本异常驱动优化 ✓ 正确答案 D 成本无法按用户归因
# 10. Agent "幻觉检测"与"事实一致性"评估的工程方法 A 用证据核对、自洽检查、引用溯源与置信度阈值检测幻觉,用评测集量化评估并回归 ✓ 正确答案 B 幻觉无法检测,只能靠人工 C 幻觉检测只看语言流畅度 D 事实一致性无法评估
# 11. Agent 反思(Self-Reflection)机制在错误恢复的工程价值 A 反思让 Agent 分析失败原因并生成改进策略,结合外部反馈重试,配循环上限控制成本 ✓ 正确答案 B 反思无需外部反馈 C 反思就是简单重试一次 D 反思会无限循环,应禁用
# 12. Agent 计划(Planning)与重计划(Replanning)的工程实战 A 计划一旦生成就不可修改 B 重计划无需监控偏差 C 计划与执行结果无需记录 D 先结构化计划再执行,监控偏差,超阈值触发重计划修正,配上限防无限重规划 ✓ 正确答案
# 13. Agent 用知识图谱做长期记忆时,实体抽取错误如何纠偏,图谱更新与失效如何治理? A 实体抽取天然准确,无需校验 B 抽取结果经校验标记低置信,冲突合并仲裁,过期淘汰并保留纠错链,维护图谱质量 ✓ 正确答案 C 图谱一旦建立永不更新 D 冲突图谱应直接删除新信息
# 14. Agent 对抗性测试(Prompt Injection、Jailbreak)应覆盖哪些攻击面(工具结果、外部文档、多轮上下文),测试集如何维护? A 只需测试用户直接输入 B 覆盖用户输入、工具结果、外部文档、多轮上下文等攻击面,维护按攻击面分类的注入用例集并回归 ✓ 正确答案 C 工具结果不会注入指令 D 对抗测试集无需更新
# 15. Agent 性能基准(延迟、吞吐、并发)的工程实战 A 用代表性任务压测延迟/吞吐/并发,控制变量建基线,定位瓶颈优化并回归 ✓ 正确答案 B 并发与性能无关 C 性能只需测平均延迟 D 性能基线一旦建立无需更新
# 16. Agent 评测基准(GAIA、SWE-bench、τ-bench、AgentBench)的成功判定与领域侧重有何差异,企业选型时应如何取舍? A 各基准侧重不同(GAIA 通用、SWE-bench 代码、τ-bench 工具调用、AgentBench 综合),企业按业务场景匹配并自建评测集 ✓ 正确答案 B SWE-bench 评测通用对话 C 公开基准可直接替代业务评测 D 所有基准都评测同一能力
# 17. OpenAI Operator、Anthropic Computer Use、Manus AI Agent 的工程价值 A 三者功能完全相同 B 三者都是纯文本对话 Agent C Operator 操作浏览器、Computer Use 操作计算机、Manus 为通用任务 Agent,实现操作自动化与人机协同 ✓ 正确答案 D 操作 Agent 无需安全审批
# 18. Agent Trace(LangSmith、Langfuse、Helicone、LangWatch)的工程价值 A Trace 平台只能看成本 B 追踪与评测无关 C Trace 平台无法观测多 Agent D Agent Trace 平台提供观测、评估、回放与调优,是多 Agent 工程化的基础设施 ✓ 正确答案
# 19. OpenAI Swarm、AG2、Semantic Kernel Agents 框架对比 A 三个框架功能完全相同 B Swarm 是生产级框架 C AG2 不支持多 Agent D Swarm 轻量、AG2 复杂协作、Semantic Kernel 企业生态,按任务复杂度与语言栈选型 ✓ 正确答案
# 20. Mem0、Zep、LangMem 等专用 Agent 记忆框架对比 A 所有记忆框架机制完全相同 B 记忆框架无需抽取事实 C Mem0/Zep/LangMem 在抽取、存储、检索、生态上各有侧重,按应用类型与集成选型 ✓ 正确答案 D 记忆框架只能存储不能检索
# 21. OpenHands、Cline、Continue 等 Coding Agent 框架对比 A 三者能力完全相同 B 三个框架都是 IDE 插件 C Coding Agent 无需操作文件 D OpenHands 自主编码、Cline/Continue 交互辅助,按任务复杂度与集成方式选型 ✓ 正确答案
# 22. Agent 沙箱(E2B、Modal、Daytona)的工程价值 A Agent 代码应直接在宿主运行 B 沙箱无法隔离 C 沙箱提供隔离执行环境,安全运行 Agent 代码并可回收,是执行不可信代码的安全边界 ✓ 正确答案 D 沙箱只需开发环境
# 23. Agent "冷启动"与"预热"策略的工程价值 A 预热总是优于冷启动 B 冷启动无任何开销 C 预热策略与资源无关 D 预热降低首次延迟并复用资源,但占用资源,按频率与延迟敏感度权衡 ✓ 正确答案