评测基准与动态任务环境

共 17 题
#

1. 多基准汇总排名如何避免被覆盖度差异和单次实验运气放大,而采用区间和显著性

A 覆盖度差异不影响排名,可忽略
B 直接对每个基准的平均分再取平均即可得到可靠排名
C 只要覆盖率不同,两个模型就必然有显著差异
D 用置信区间与显著性检验区分统计噪声与真实能力差异,避免被单次实验运气放大 ✓ 正确答案
#

2. Agent 评测出现新版本基准或旧基准退役时,CI 门禁和回归基线应如何平滑过渡

A 当天直接切换新基准并删除旧基准
B 新基准仅用于展示,永远不参与门禁
C 新旧基准并行运行,映射对齐后更新门禁阈值,再渐进切换 ✓ 正确答案
D 放弃所有门禁,仅靠人工查看
#

3. SWE-bench Verified 的人工验证、回归控制与不可解 issue 子集如何在工程 Agent 评估中被使用

A 衡量 Agent 的回答速度
B 判定代码修复是否真正让原本失败的测试通过,防止假修复 ✓ 正确答案
C 测试 Agent 的文档阅读能力
D 衡量 token 消耗
#

4. SWE-bench Multimodal 与 SWE-bench Lite 的样本规模、多模态比例和与 Verified 的可比性应如何解读

A 各子集分数可直接横向比较
B Lite 样本最多,分数最可靠
C 所有子集都只含纯文本 issue
D Multimodal 额外测多模态输入理解能力,与 Verified 分布不同,不可直接比较 ✓ 正确答案
#

5. AgentBench 的多任务设计如何被用来发现 Agent 在不同能力切片上的薄弱点

A 仅用于训练 token 统计
B 只用于给出一个总分排名
C 替代所有线上评测
D 按任务切片定位 Agent 在不同能力维度上的薄弱点,指导定向改进 ✓ 正确答案
#

6. GAIA 的通用助手真实任务、WebArena 的网站任务与 OSWorld 的桌面任务在 Agent 评估中各代表什么粒度

A GAIA 测通用助手任务完成,WebArena 测网页操作,OSWorld 测桌面 GUI 操作,粒度不同 ✓ 正确答案
B GAIA、WebArena、OSWorld 粒度完全相同
C OSWorld 只测纯文本问答
D WebArena 不需要任何网页交互
#

7. τ-bench 与 τ²-bench 的双轮用户模拟和领域任务难度应如何被用于对话型 Agent 评估

A 只用单轮问答打分
B 只测文本生成质量
C 用模拟用户进行多轮对话,测试澄清、状态维护与工具调用 ✓ 正确答案
D 不测工具调用
#

8. 动态评测环境(SWE-bench 类/Agent 沙箱)与静态题库的差异,防作弊如何设计?

A 时间切分与候选集隔离,防止评测样本泄漏到训练语料,并用 fail-to-pass 判定真实修复 ✓ 正确答案
B 让 Agent 自由修改评测脚本
C 不限制 Agent 对沙箱文件系统的访问
D 允许 Agent 直接读取答案文件
#

9. 业务专属评测集的建设,种子问题→标注→迭代回流的完整流程?

A 让评测集保持静态不变
B 把线上 badcase 与人工确认样本回流,保持评测集代表性与时效性 ✓ 正确答案
C 减少评测样本数量
D 仅用于美化报告
#

10. LLM 应用评测的层级,单元、集成、端到端与用户反馈?

A 只需做端到端评测即可
B 各层互相独立,无需配合
C 用户反馈完全不重要
D 单元/集成定位问题、端到端保整体质量、用户反馈作为最终 KPI,四层配合 ✓ 正确答案
#

11. 用 LLM 从线上日志改写与扩写生成合成评测样本时,生成→判别器过滤→embedding 去重→难度分层的流水线应如何搭建,如何防止合成集与真实线上分布偏差导致离线分数虚高,以及评测题与模型训练语料重合导致的污染虚高

A 用真实样本做锚点对齐难度分布,并用时间切分与相似度检测防止评测题污染训练语料 ✓ 正确答案
B 增加合成样本数量即可
C 只生成不校验
D 让评测题进入训练语料
#

12. WebVoyager 等视觉浏览评估如何处理站点变更、登录态和地区内容的不可重现性

A 随机访问任何站点
B 用受控测试账号、固定环境/快照与失效任务隔离,必要时人工复核 ✓ 正确答案
C 不记录地区参数
D 忽略登录态差异
#

13. 评测分数与线上指标的错位(离线高分、线上翻车)如何归因与修复?

A 模型过度训练
B 代码写得太好
C 评测集与线上输入分布不匹配或评测口径与线上指标不一致 ✓ 正确答案
D 评测完全准确无需怀疑
#

14. 评测集的建设,人工标注、对抗样本与自动生成?

A 只用一种来源
B 人工做黄金标准锚点、自动扩规模、对抗压边界,混合并校验 ✓ 正确答案
C 自动生成即可,无需校验
D 对抗样本越多越好,无需人工
#

15. 动态评测环境,任务模板、指标与评分标准在线更新时,如何保证历史结果可比

A 直接改标准,不重跑
B 版本化冻结+旧版重跑校准+双轨过渡 ✓ 正确答案
C 删除历史结果
D 忽略规则变化
#

16. 评测的统计,A/B 实验的样本量、显著性检验与多重比较校正应如何应用

A 样本量越小越容易显著
B 需做功效分析定样本量,区分统计显著性与业务显著性,多指标时做多重比较校正 ✓ 正确答案
C p 值越小就一定代表业务价值越大
D 多重比较无需校正
#

17. 评测的自动化,回归门禁与 prompt 变更联动?

A 门禁不记录版本
B 直接改 prompt 不评测
C 只人工看效果
D 变更触发评测,按阈值自动阻断并生成 diff 报告,配合灰度验证 ✓ 正确答案