智能体与 Agent 工程与评测集建设

共 42 题
#

1. Agent 与人协作的真实工作流设计

A 人机协作要明确责任边界,用审批流与触发条件安排人工介入 ✓ 正确答案
B Agent 应接管所有任务,无需人工
C 人工介入会降低所有效率
D 协作工作流无需设计
#

2. Agent 在企业级应用(CRM、ERP)的真实集成

A Agent 集成 CRM/ERP 需最小权限、数据一致性与审计日志 ✓ 正确答案
B Agent 可直接访问企业所有数据
C 企业集成无需鉴权
D Agent 操作无需留痕
#

3. Agent 工具调用(Tool Use)的真实成功率与失败模式

A 工具调用成功率恒为 100%
B 工具调用失败不可修复
C 工具调用成功率受工具描述与输入影响,需清晰契约与重试纠错 ✓ 正确答案
D 工具数量越多越好
#

4. Agent 执行副作用(Side Effects)的真实风险

A Agent 副作用无风险
B 写操作可直接执行
C Agent 副作用无需审计
D Agent 副作用需用只读/写分离、幂等、审批与沙箱管控 ✓ 正确答案
#

5. Agent 的真实生产案例(Devin、AutoGPT、CrewAI)

A Agent 在任务边界清晰、可验证时表现好,生产多用人审+受限 Agent ✓ 正确答案
B 全自主 Agent 可处理任意任务
C AutoGPT 生产成功率极高
D CrewAI 无法编排多 Agent
#

6. Agent 评估(Agent Evaluation)的真实工程方法

A Agent 无需评估
B Agent 评估只看生成文本
C Agent 评估要综合成功率、步骤正确率、成本,用离线+在线+回放 ✓ 正确答案
D Agent 轨迹一定正确
#

7. Agent 长期记忆(Long-Term Memory)的真实实现

A Agent 长期记忆只在会话内
B Agent 长期记忆用向量+结构化+摘要存储,按需检索并管理更新 ✓ 正确答案
C 记忆不会污染
D 记忆无需更新
#

8. AutoGPT、LangGraph、CrewAI 等框架的真实工程取舍

A AutoGPT 最适合生产
B LangGraph 显式状态机适合生产可控流程,CrewAI 快但弱,AutoGPT 实验性 ✓ 正确答案
C 所有框架等价
D 生产无需框架编排
#

9. Multi-Agent 协作的真实工程复杂度与失败模式

A 多 Agent 越多越好
B 多 Agent 无成本
C 多 Agent 不会冲突
D Multi-Agent 需清晰协议、权威状态与协调者,且简单任务用单 Agent ✓ 正确答案
#

10. OpenAI Assistants API vs LangChain Agents 的真实差异

A Assistants API 与 LangChain 完全等价
B Assistants 托管省事但锁平台,LangChain 灵活但抽象多,按需选型 ✓ 正确答案
C LangChain 无法接多模型
D Assistants 完全可自定义
#

11. Agent Memory 的真实工程实现(短期、长期、共享)

A Agent 记忆只有一种
B 共享记忆无需一致
C 记忆无需清理
D Agent 记忆分短期、长期、共享,需分层存储、按需检索与管理 ✓ 正确答案
#

12. Agent 沙箱(Sandbox)的真实工程实现

A Agent 沙箱用容器、网络、文件与资源限制隔离,配合最小权限与审计 ✓ 正确答案
B Agent 无需沙箱
C 沙箱只限制网络
D 沙箱内可用 root
#

13. Agent 的可观测性(Agent Observability)实现

A Agent 轨迹不可观测
B 只需记录最终输出
C Agent 可观测性靠全链路追踪、结构化日志、指标与回放实现 ✓ 正确答案
D 可观测性无价值
#

14. Agent 的成本控制(Cost Control)工程实现

A Agent 成本只有一次调用
B 成本无法控制
C 重试无成本
D Agent 成本控制靠模型路由、上下文精简、缓存、步数预算与成本上限 ✓ 正确答案
#

15. Agent 面对工具调用失败、上下文超限、循环死锁三类典型失败时,如何设计重试、降级与人工接管的退路?

A 三类失败需分别设计重试、降级与人工接管,且设重试上限 ✓ 正确答案
B Agent 失败无需处理
C 重试要无限次
D 人类接管总会失败
#

16. LangGraph 0.2+ 的真实生产应用

A LangGraph 只做简单链条
B LangGraph 不支持持久化
C LangGraph 用图状态机+持久化+中断恢复,适合生产长任务 ✓ 正确答案
D LangGraph 不能恢复
#

17. Plan-and-Execute、Reflexion / Self-Refine 的真实工程价值

A Plan-and-Execute 无成本
B Reflexion 只用于简单任务
C Plan-and-Execute 提结构,Reflexion 提质量,都增加成本,适合可验证任务 ✓ 正确答案
D 两范式不值得使用
#

18. ReAct 范式的真实工程实现与边界

A ReAct 适合所有任务
B ReAct 交替思考-行动-观察,适合多步任务,但需步数预算与成本控制 ✓ 正确答案
C ReAct 无成本
D ReAct 不会循环
#

19. AutoGen / CrewAI 多 Agent 框架的真实工程边界

A 多 Agent 永远优于单 Agent
B 多 Agent 框架复杂度与成本高,生产优先单 Agent,确需再引入 ✓ 正确答案
C 多 Agent 无成本
D 多 Agent 调试容易
#

20. Code Agent 的真实生产力提升幅度

A Code Agent 在可验证任务上提升明显,复杂需求仍需人把控 ✓ 正确答案
B Code Agent 可完全替代开发
C Code Agent 无边界
D Code Agent 不需测试
#

21. Human-in-the-Loop 在 Agent 中的真实工程位置

A HITL 需全程人工干预
B HITL 降低所有质量
C HITL 在关键节点按风险介入,无风险部分交给 Agent 全自动 ✓ 正确答案
D HITL 无需设计
#

22. Agent 在 Devin / Cognition 等产品形态的真实价值

A Devin 可完全替代工程师
B Devin 适合所有项目
C Devin 无成本
D Devin 类产品在受控任务上提升,但复杂任务仍需人,价值在协作 ✓ 正确答案
#

23. A/B 实验与对照组的真实工程设计

A A/B 实验无需对照组
B 样本量无所谓
C A/B 实验要随机分流、设对照、算样本量并做显著检验 ✓ 正确答案
D 无需考虑 novelty 效应
#

24. 离线评测(Offline Eval)与在线评测(Online Eval)的协同

A 离线评测可替代在线
B 离线评测无需贴近线上
C 在线评测无需监控
D 离线快筛、在线验证并防回归,二者协同形成闭环 ✓ 正确答案
#

25. 评测集构建的真实工程成本(标注、QA、维护)

A 评测集一次性构建即可
B 评测集无需 QA
C 评测集成本在标注、QA 与维护,需用真实数据采样与版本化控制 ✓ 正确答案
D 评测集越大越好
#

26. 评测集的版本管理与防数据泄漏(Contamination)

A 评测集需版本化、权限隔离与防泄漏,避免训练数据污染分数 ✓ 正确答案
B 评测集无需版本管理
C 评测集可公开随意
D 污染不影响分数
#

27. 评测集(Eval Set)的设计原则与代表性

A 评测集只需挑简单样本
B 评测集样本越少越好
C 评测集不需要更新
D 评测集要代表真实分布,覆盖高频、难例与边界,且可判定可复现 ✓ 正确答案
#

28. 领域评测集(Domain-Specific Eval)的真实价值

A 领域评测集反映领域真实表现,但需专家标注且维护成本高 ✓ 正确答案
B 领域评测集可用通用评测替代
C 领域评测集无价值
D 领域评测集不需更新
#

29. Pairwise 两两比较如何消除绝对评分的偏好漂移,样本量与聚合方式(Bradley-Terry)如何选择?

A 绝对评分无漂移
B Pairwise 无需样本量
C Pairwise 消除绝对尺度漂移,用 Bradley-Terry 聚合,需足够样本量 ✓ 正确答案
D Bradley-Terry 与绝对评分等价
#

30. 开源评测框架(HELM、OpenCompass、Promptfoo)的真实参考价值

A 开源框架提供方法论,业务评测需自建集,Promptfoo 适合工程回归 ✓ 正确答案
B 开源框架可直接用于业务评测
C HELM 只支持中文
D OpenCompass 无参考价值
#

31. AI Agent 与传统自动化的真实差异点

A Agent 与传统自动化完全相同
B Agent 适合固定流程
C 传统自动化赢在稳定可预测,Agent 赢在灵活理解,按任务选型 ✓ 正确答案
D 传统自动化能理解语义
#

32. Agent 任务分解(Task Decomposition)的真实边界

A 任务分解越细越好
B 任务分解无需预算
C 任务分解提升复杂任务稳定性,但过度分解新增成本,需适度 ✓ 正确答案
D 分解必然正确
#

33. Agent 在浏览器(Browser Use)的真实可用性

A 浏览器 Agent 可处理任何站点
B 浏览器 Agent 无需凭据管理
C 浏览器 Agent 对常见站点可行,但动态页面、验证码与安全是边界 ✓ 正确答案
D 页面结构变化不影响
#

34. Anthropic Computer Use / OpenAI Operator 在企业自动化的真实可用性

A Computer Use 可处理所有 GUI 任务
B Computer Use 无 token 成本
C Computer Use/Operator 在受控标准任务可行,但 GUI 易变、成本高、需沙箱 ✓ 正确答案
D GUI 操作永不失败
#

35. ReAct、Plan-and-Execute、Reflexion 等范式的真实适用场景

A ReAct 适合工具交互,Plan 适合全局规划,Reflexion 适合质量迭代 ✓ 正确答案
B 所有范式适用于所有任务
C Reflexion 适合检索
D 范式不可组合
#

36. Agent 上线后如何监控成功率、成本、用户干预率等指标,并自动触发回归评测与版本回滚?

A Agent 上线后无需监控
B Agent 上线后需监控成功率、成本、干预率,指标恶化自动触发回归与回滚 ✓ 正确答案
C 回滚无法自动
D 监控只看成功率
#

37. Agent 的权限控制(Permission Boundary)

A Agent 应有全部权限
B Agent 权限控制用最小权限、操作分级、沙箱与审计 ✓ 正确答案
C Agent 权限不可撤销
D 权限边界无需设计
#

38. EvalLM / Promptfoo 等工具的真实使用

A Promptfoo 可替代全部评测
B Promptfoo 提供断言、CI 回归与对比,复杂指标仍需自建 ✓ 正确答案
C Promptfoo 无 CI 能力
D 评测工具无需自建用例
#

39. LLM-as-Judge 的真实可靠度(与人类标注的一致性)

A LLM-as-Judge 一致性中高但有位置、长度、自我偏好偏差,需校准 ✓ 正确答案
B LLM-as-Judge 与人类完全一致
C LLM-as-Judge 无偏差
D LLM-as-Judge 不可用于初筛
#

40. 金标准(Gold Standard)与人工标注(Human Annotation)的真实成本

A 金标准无需人工
B 金标准不可靠
C 人工标注无成本
D 金标准权威但成本高,用于校准自动评测,小样本人工+大样本自动 ✓ 正确答案
#

41. Likert 量表评分的真实一致性

A Likert 评分完全一致
B Likert 无需校准
C Likert 评分受主观差异影响,需 rubric、校准与多人平均提升一致性 ✓ 正确答案
D Likert 与 Pairwise 等价
#

42. Pairwise 比较与 Likert 量表的真实差异

A Pairwise 稳定可给相对排序但成本高,Likert 快但一致性低,按需选 ✓ 正确答案
B Pairwise 与 Likert 完全等价
C Likert 一致性好
D Pairwise 成本低