# 1. 多基准汇总排名如何避免被覆盖度差异和单次实验运气放大,而采用区间和显著性 A 覆盖度差异不影响排名,可忽略 B 直接对每个基准的平均分再取平均即可得到可靠排名 C 只要覆盖率不同,两个模型就必然有显著差异 D 用置信区间与显著性检验区分统计噪声与真实能力差异,避免被单次实验运气放大 ✓ 正确答案
# 2. Agent 评测出现新版本基准或旧基准退役时,CI 门禁和回归基线应如何平滑过渡 A 当天直接切换新基准并删除旧基准 B 新基准仅用于展示,永远不参与门禁 C 新旧基准并行运行,映射对齐后更新门禁阈值,再渐进切换 ✓ 正确答案 D 放弃所有门禁,仅靠人工查看
# 3. SWE-bench Verified 的人工验证、回归控制与不可解 issue 子集如何在工程 Agent 评估中被使用 A 衡量 Agent 的回答速度 B 判定代码修复是否真正让原本失败的测试通过,防止假修复 ✓ 正确答案 C 测试 Agent 的文档阅读能力 D 衡量 token 消耗
# 4. SWE-bench Multimodal 与 SWE-bench Lite 的样本规模、多模态比例和与 Verified 的可比性应如何解读 A 各子集分数可直接横向比较 B Lite 样本最多,分数最可靠 C 所有子集都只含纯文本 issue D Multimodal 额外测多模态输入理解能力,与 Verified 分布不同,不可直接比较 ✓ 正确答案
# 5. AgentBench 的多任务设计如何被用来发现 Agent 在不同能力切片上的薄弱点 A 仅用于训练 token 统计 B 只用于给出一个总分排名 C 替代所有线上评测 D 按任务切片定位 Agent 在不同能力维度上的薄弱点,指导定向改进 ✓ 正确答案
# 6. GAIA 的通用助手真实任务、WebArena 的网站任务与 OSWorld 的桌面任务在 Agent 评估中各代表什么粒度 A GAIA 测通用助手任务完成,WebArena 测网页操作,OSWorld 测桌面 GUI 操作,粒度不同 ✓ 正确答案 B GAIA、WebArena、OSWorld 粒度完全相同 C OSWorld 只测纯文本问答 D WebArena 不需要任何网页交互
# 7. τ-bench 与 τ²-bench 的双轮用户模拟和领域任务难度应如何被用于对话型 Agent 评估 A 只用单轮问答打分 B 只测文本生成质量 C 用模拟用户进行多轮对话,测试澄清、状态维护与工具调用 ✓ 正确答案 D 不测工具调用
# 8. 动态评测环境(SWE-bench 类/Agent 沙箱)与静态题库的差异,防作弊如何设计? A 时间切分与候选集隔离,防止评测样本泄漏到训练语料,并用 fail-to-pass 判定真实修复 ✓ 正确答案 B 让 Agent 自由修改评测脚本 C 不限制 Agent 对沙箱文件系统的访问 D 允许 Agent 直接读取答案文件
# 9. 业务专属评测集的建设,种子问题→标注→迭代回流的完整流程? A 让评测集保持静态不变 B 把线上 badcase 与人工确认样本回流,保持评测集代表性与时效性 ✓ 正确答案 C 减少评测样本数量 D 仅用于美化报告
# 10. LLM 应用评测的层级,单元、集成、端到端与用户反馈? A 只需做端到端评测即可 B 各层互相独立,无需配合 C 用户反馈完全不重要 D 单元/集成定位问题、端到端保整体质量、用户反馈作为最终 KPI,四层配合 ✓ 正确答案
# 11. 用 LLM 从线上日志改写与扩写生成合成评测样本时,生成→判别器过滤→embedding 去重→难度分层的流水线应如何搭建,如何防止合成集与真实线上分布偏差导致离线分数虚高,以及评测题与模型训练语料重合导致的污染虚高 A 用真实样本做锚点对齐难度分布,并用时间切分与相似度检测防止评测题污染训练语料 ✓ 正确答案 B 增加合成样本数量即可 C 只生成不校验 D 让评测题进入训练语料
# 12. WebVoyager 等视觉浏览评估如何处理站点变更、登录态和地区内容的不可重现性 A 随机访问任何站点 B 用受控测试账号、固定环境/快照与失效任务隔离,必要时人工复核 ✓ 正确答案 C 不记录地区参数 D 忽略登录态差异
# 13. 评测分数与线上指标的错位(离线高分、线上翻车)如何归因与修复? A 模型过度训练 B 代码写得太好 C 评测集与线上输入分布不匹配或评测口径与线上指标不一致 ✓ 正确答案 D 评测完全准确无需怀疑
# 14. 评测集的建设,人工标注、对抗样本与自动生成? A 只用一种来源 B 人工做黄金标准锚点、自动扩规模、对抗压边界,混合并校验 ✓ 正确答案 C 自动生成即可,无需校验 D 对抗样本越多越好,无需人工
# 16. 评测的统计,A/B 实验的样本量、显著性检验与多重比较校正应如何应用 A 样本量越小越容易显著 B 需做功效分析定样本量,区分统计显著性与业务显著性,多指标时做多重比较校正 ✓ 正确答案 C p 值越小就一定代表业务价值越大 D 多重比较无需校正
# 17. 评测的自动化,回归门禁与 prompt 变更联动? A 门禁不记录版本 B 直接改 prompt 不评测 C 只人工看效果 D 变更触发评测,按阈值自动阻断并生成 diff 报告,配合灰度验证 ✓ 正确答案