# 1. Agent 与人协作的真实工作流设计 A 人机协作要明确责任边界,用审批流与触发条件安排人工介入 ✓ 正确答案 B Agent 应接管所有任务,无需人工 C 人工介入会降低所有效率 D 协作工作流无需设计
# 2. Agent 在企业级应用(CRM、ERP)的真实集成 A Agent 集成 CRM/ERP 需最小权限、数据一致性与审计日志 ✓ 正确答案 B Agent 可直接访问企业所有数据 C 企业集成无需鉴权 D Agent 操作无需留痕
# 3. Agent 工具调用(Tool Use)的真实成功率与失败模式 A 工具调用成功率恒为 100% B 工具调用失败不可修复 C 工具调用成功率受工具描述与输入影响,需清晰契约与重试纠错 ✓ 正确答案 D 工具数量越多越好
# 4. Agent 执行副作用(Side Effects)的真实风险 A Agent 副作用无风险 B 写操作可直接执行 C Agent 副作用无需审计 D Agent 副作用需用只读/写分离、幂等、审批与沙箱管控 ✓ 正确答案
# 5. Agent 的真实生产案例(Devin、AutoGPT、CrewAI) A Agent 在任务边界清晰、可验证时表现好,生产多用人审+受限 Agent ✓ 正确答案 B 全自主 Agent 可处理任意任务 C AutoGPT 生产成功率极高 D CrewAI 无法编排多 Agent
# 6. Agent 评估(Agent Evaluation)的真实工程方法 A Agent 无需评估 B Agent 评估只看生成文本 C Agent 评估要综合成功率、步骤正确率、成本,用离线+在线+回放 ✓ 正确答案 D Agent 轨迹一定正确
# 7. Agent 长期记忆(Long-Term Memory)的真实实现 A Agent 长期记忆只在会话内 B Agent 长期记忆用向量+结构化+摘要存储,按需检索并管理更新 ✓ 正确答案 C 记忆不会污染 D 记忆无需更新
# 8. AutoGPT、LangGraph、CrewAI 等框架的真实工程取舍 A AutoGPT 最适合生产 B LangGraph 显式状态机适合生产可控流程,CrewAI 快但弱,AutoGPT 实验性 ✓ 正确答案 C 所有框架等价 D 生产无需框架编排
# 9. Multi-Agent 协作的真实工程复杂度与失败模式 A 多 Agent 越多越好 B 多 Agent 无成本 C 多 Agent 不会冲突 D Multi-Agent 需清晰协议、权威状态与协调者,且简单任务用单 Agent ✓ 正确答案
# 10. OpenAI Assistants API vs LangChain Agents 的真实差异 A Assistants API 与 LangChain 完全等价 B Assistants 托管省事但锁平台,LangChain 灵活但抽象多,按需选型 ✓ 正确答案 C LangChain 无法接多模型 D Assistants 完全可自定义
# 11. Agent Memory 的真实工程实现(短期、长期、共享) A Agent 记忆只有一种 B 共享记忆无需一致 C 记忆无需清理 D Agent 记忆分短期、长期、共享,需分层存储、按需检索与管理 ✓ 正确答案
# 12. Agent 沙箱(Sandbox)的真实工程实现 A Agent 沙箱用容器、网络、文件与资源限制隔离,配合最小权限与审计 ✓ 正确答案 B Agent 无需沙箱 C 沙箱只限制网络 D 沙箱内可用 root
# 13. Agent 的可观测性(Agent Observability)实现 A Agent 轨迹不可观测 B 只需记录最终输出 C Agent 可观测性靠全链路追踪、结构化日志、指标与回放实现 ✓ 正确答案 D 可观测性无价值
# 14. Agent 的成本控制(Cost Control)工程实现 A Agent 成本只有一次调用 B 成本无法控制 C 重试无成本 D Agent 成本控制靠模型路由、上下文精简、缓存、步数预算与成本上限 ✓ 正确答案
# 15. Agent 面对工具调用失败、上下文超限、循环死锁三类典型失败时,如何设计重试、降级与人工接管的退路? A 三类失败需分别设计重试、降级与人工接管,且设重试上限 ✓ 正确答案 B Agent 失败无需处理 C 重试要无限次 D 人类接管总会失败
# 16. LangGraph 0.2+ 的真实生产应用 A LangGraph 只做简单链条 B LangGraph 不支持持久化 C LangGraph 用图状态机+持久化+中断恢复,适合生产长任务 ✓ 正确答案 D LangGraph 不能恢复
# 17. Plan-and-Execute、Reflexion / Self-Refine 的真实工程价值 A Plan-and-Execute 无成本 B Reflexion 只用于简单任务 C Plan-and-Execute 提结构,Reflexion 提质量,都增加成本,适合可验证任务 ✓ 正确答案 D 两范式不值得使用
# 18. ReAct 范式的真实工程实现与边界 A ReAct 适合所有任务 B ReAct 交替思考-行动-观察,适合多步任务,但需步数预算与成本控制 ✓ 正确答案 C ReAct 无成本 D ReAct 不会循环
# 19. AutoGen / CrewAI 多 Agent 框架的真实工程边界 A 多 Agent 永远优于单 Agent B 多 Agent 框架复杂度与成本高,生产优先单 Agent,确需再引入 ✓ 正确答案 C 多 Agent 无成本 D 多 Agent 调试容易
# 20. Code Agent 的真实生产力提升幅度 A Code Agent 在可验证任务上提升明显,复杂需求仍需人把控 ✓ 正确答案 B Code Agent 可完全替代开发 C Code Agent 无边界 D Code Agent 不需测试
# 21. Human-in-the-Loop 在 Agent 中的真实工程位置 A HITL 需全程人工干预 B HITL 降低所有质量 C HITL 在关键节点按风险介入,无风险部分交给 Agent 全自动 ✓ 正确答案 D HITL 无需设计
# 22. Agent 在 Devin / Cognition 等产品形态的真实价值 A Devin 可完全替代工程师 B Devin 适合所有项目 C Devin 无成本 D Devin 类产品在受控任务上提升,但复杂任务仍需人,价值在协作 ✓ 正确答案
# 24. 离线评测(Offline Eval)与在线评测(Online Eval)的协同 A 离线评测可替代在线 B 离线评测无需贴近线上 C 在线评测无需监控 D 离线快筛、在线验证并防回归,二者协同形成闭环 ✓ 正确答案
# 25. 评测集构建的真实工程成本(标注、QA、维护) A 评测集一次性构建即可 B 评测集无需 QA C 评测集成本在标注、QA 与维护,需用真实数据采样与版本化控制 ✓ 正确答案 D 评测集越大越好
# 26. 评测集的版本管理与防数据泄漏(Contamination) A 评测集需版本化、权限隔离与防泄漏,避免训练数据污染分数 ✓ 正确答案 B 评测集无需版本管理 C 评测集可公开随意 D 污染不影响分数
# 27. 评测集(Eval Set)的设计原则与代表性 A 评测集只需挑简单样本 B 评测集样本越少越好 C 评测集不需要更新 D 评测集要代表真实分布,覆盖高频、难例与边界,且可判定可复现 ✓ 正确答案
# 28. 领域评测集(Domain-Specific Eval)的真实价值 A 领域评测集反映领域真实表现,但需专家标注且维护成本高 ✓ 正确答案 B 领域评测集可用通用评测替代 C 领域评测集无价值 D 领域评测集不需更新
# 29. Pairwise 两两比较如何消除绝对评分的偏好漂移,样本量与聚合方式(Bradley-Terry)如何选择? A 绝对评分无漂移 B Pairwise 无需样本量 C Pairwise 消除绝对尺度漂移,用 Bradley-Terry 聚合,需足够样本量 ✓ 正确答案 D Bradley-Terry 与绝对评分等价
# 30. 开源评测框架(HELM、OpenCompass、Promptfoo)的真实参考价值 A 开源框架提供方法论,业务评测需自建集,Promptfoo 适合工程回归 ✓ 正确答案 B 开源框架可直接用于业务评测 C HELM 只支持中文 D OpenCompass 无参考价值
# 31. AI Agent 与传统自动化的真实差异点 A Agent 与传统自动化完全相同 B Agent 适合固定流程 C 传统自动化赢在稳定可预测,Agent 赢在灵活理解,按任务选型 ✓ 正确答案 D 传统自动化能理解语义
# 32. Agent 任务分解(Task Decomposition)的真实边界 A 任务分解越细越好 B 任务分解无需预算 C 任务分解提升复杂任务稳定性,但过度分解新增成本,需适度 ✓ 正确答案 D 分解必然正确
# 33. Agent 在浏览器(Browser Use)的真实可用性 A 浏览器 Agent 可处理任何站点 B 浏览器 Agent 无需凭据管理 C 浏览器 Agent 对常见站点可行,但动态页面、验证码与安全是边界 ✓ 正确答案 D 页面结构变化不影响
# 34. Anthropic Computer Use / OpenAI Operator 在企业自动化的真实可用性 A Computer Use 可处理所有 GUI 任务 B Computer Use 无 token 成本 C Computer Use/Operator 在受控标准任务可行,但 GUI 易变、成本高、需沙箱 ✓ 正确答案 D GUI 操作永不失败
# 35. ReAct、Plan-and-Execute、Reflexion 等范式的真实适用场景 A ReAct 适合工具交互,Plan 适合全局规划,Reflexion 适合质量迭代 ✓ 正确答案 B 所有范式适用于所有任务 C Reflexion 适合检索 D 范式不可组合
# 36. Agent 上线后如何监控成功率、成本、用户干预率等指标,并自动触发回归评测与版本回滚? A Agent 上线后无需监控 B Agent 上线后需监控成功率、成本、干预率,指标恶化自动触发回归与回滚 ✓ 正确答案 C 回滚无法自动 D 监控只看成功率
# 37. Agent 的权限控制(Permission Boundary) A Agent 应有全部权限 B Agent 权限控制用最小权限、操作分级、沙箱与审计 ✓ 正确答案 C Agent 权限不可撤销 D 权限边界无需设计
# 38. EvalLM / Promptfoo 等工具的真实使用 A Promptfoo 可替代全部评测 B Promptfoo 提供断言、CI 回归与对比,复杂指标仍需自建 ✓ 正确答案 C Promptfoo 无 CI 能力 D 评测工具无需自建用例
# 39. LLM-as-Judge 的真实可靠度(与人类标注的一致性) A LLM-as-Judge 一致性中高但有位置、长度、自我偏好偏差,需校准 ✓ 正确答案 B LLM-as-Judge 与人类完全一致 C LLM-as-Judge 无偏差 D LLM-as-Judge 不可用于初筛
# 40. 金标准(Gold Standard)与人工标注(Human Annotation)的真实成本 A 金标准无需人工 B 金标准不可靠 C 人工标注无成本 D 金标准权威但成本高,用于校准自动评测,小样本人工+大样本自动 ✓ 正确答案
# 41. Likert 量表评分的真实一致性 A Likert 评分完全一致 B Likert 无需校准 C Likert 评分受主观差异影响,需 rubric、校准与多人平均提升一致性 ✓ 正确答案 D Likert 与 Pairwise 等价
# 42. Pairwise 比较与 Likert 量表的真实差异 A Pairwise 稳定可给相对排序但成本高,Likert 快但一致性低,按需选 ✓ 正确答案 B Pairwise 与 Likert 完全等价 C Likert 一致性好 D Pairwise 成本低