# 1. 多模型评估如何控制 Prompt 拼写、上下文顺序和语言差异带来的非防御性波动 A 随意使用不同 Prompt B 只比较一次 C 统一模板、固定上下文顺序与语言、随机化并多次采样,让差异可归因于模型能力 ✓ 正确答案 D 忽略差异
# 2. Position bias 在对比评测中如何被出现顺序放大,评估设计应怎样用随机化和位置平衡 A 固定顺序 B 忽略顺序 C 只放一个模型 D 随机化 A/B 顺序并做位置平衡(双向出现、方向均衡),必要时校正位置效应 ✓ 正确答案
# 3. 评分 rubric 设计应如何做维度划分、锚点示例选择与打分理由分离,减少 judge 的整体印象打分 A 只给一个总分 B 让 judge 自由发挥 C 维度划分、锚点示例参照、打分理由与分数分离并用结构化输出 ✓ 正确答案 D 不设 rubric
# 4. Verbosity bias 为什么让长回答被偏好,评分模板和截断策略应如何抵消 A 越长越好 B 只评长回答 C 忽略长度 D 评分模板强调按要点与准确性打分、对内容做长度规范化并给"短而准"对照锚点 ✓ 正确答案
# 5. Self-enhancement bias 如何让某些模型倾向给同源回答高分,跨模型盲评如何解决 A 跨模型盲评、匿名化来源,并用多个异构 judge 交叉打分 ✓ 正确答案 B 让模型评自己的回答 C 只用一个 judge D 不防
# 6. Anchoring bias 在 LLM 评分中如何被参考样本或参考答案放大,盲打分和打分理由分离为什么重要 A 先给高分参考答案 B 不设参考 C 只用一个锚点 D 盲打分隐藏来源、打分理由与分数分离、提供多档锚点样例 ✓ 正确答案
# 7. Format bias 如何让编号、Markdown 表格或代码块等结构被误读为高质量,应如何规范化评估输入 A 格式越漂亮分越高 B 不处理 C 只评格式 D 评分前规范化去格式、统一格式模板、明确格式不计分只评内容要点 ✓ 正确答案
# 8. pairwise 对比与 pointwise 打分的适用场景与统计功效有何差异,pairwise 结果何时应转化为 ELO/Bradley-Terry 排序 A pairwise 判断更自然、统计功效更强,适合相对比较并可转化为 ELO/Bradley-Terry 全局排序 ✓ 正确答案 B pointwise 适合相对排序 C pairwise 只能打分 D 两者无差别
# 9. judge 输出的结构化约束、解析失败重试与人工复核流水线应如何设计,防止评分失败静默污染指标 A 结构化约束输出、解析失败重试、仍失败进人工复核并隔离,失败率异常则告警 ✓ 正确答案 B 失败直接填默认分 C 忽略失败 D 失败就跳过
# 10. 多个 judge 模型投票或加权时,模型间相关性和校准集权重应如何选取 A 所有 judge 等权 B 按 judge 间相关性降权、按校准集准确度加权,保持独立且准确 ✓ 正确答案 C 只加相关 judge D 随机加权
# 11. 评估结果用于回归门禁或路由策略调整时,bias 检查为何必须先于阈值调整 A 阈值无关 bias B 先调阈值 C 含 bias 的指标会误导调整,先验证指标可信再动阈值,避免追着噪声调整 ✓ 正确答案 D bias 无影响
# 12. 人工评审抽样的最小样本量、置信区间和重评一致性应如何与 LLM 自动评分共同决策 A 随意抽样 B 按置信度计算最小样本量、报告置信区间与重评一致性,用人工标尺校准 LLM 达标后再放量 ✓ 正确答案 C 只信人工 D 只信 LLM
# 13. 评估集污染与 judge 过拟合(针对特定 judge 偏好优化回答)如何检测,跨 judge 交叉验证如何做 A 只看单一 judge B 不看评估集 C 检测样本重叠与留出集差距,用多个异构 judge 交叉验证,观察分数是否随 judge 剧变 ✓ 正确答案 D 忽略
# 14. rubric 变更如何做版本管理与校准样本回归,防止评分口径调整导致历史分数不可比 A 直接改 B 忽略 C 不记录版本 D 版本管理并溯源,用固定校准样本在新旧 rubric 下回归量化影响,避免跨版本混比 ✓ 正确答案
# 15. trace 采样率与存储成本如何权衡,关键会话(失败、高成本、高价值用户)的全采策略如何设计 A 普通会话随机降采,失败/高成本/高价值用户关键会话全采并分级管理保留期 ✓ 正确答案 B 全部全采 C 全部不采 D 只采普通
# 16. 在线评估(online eval)流水线(生产采样→judge 打分→告警→回流评估集)如何自动化,回流样本如何防止引入标注噪声 A 全部回流 B 不回流 C 只回流高置信度样本、人工抽检校验、去重去劣并延迟入库 ✓ 正确答案 D 随意回流
# 17. 评估平台如何与生产 trace 联动,使线上回归自动成为评估集补充样本 A 评估集静态不变 B 只用手工造数据 C 用统一 trace 语义按策略采样线上会话,自动入库评估集并反馈回归 ✓ 正确答案 D 不联动
# 18. Prompt 版本管理应如何与模型版本、工具版本和数据快照共同构成可重现记录 A 同时记录 Prompt、模型、工具版本与数据快照并生成环境指纹 ✓ 正确答案 B 只记 Prompt 版本 C 只记模型 D 不记录
# 19. 评估数据集的版本管理如何与回归门禁集成,确保每次发布对应固定的数据集快照与评分基线 A 数据集随意变 B 不设基线 C 数据集不可变带版本,发布锁定固定快照与基线,门禁在同快照同基线下比较 ✓ 正确答案 D 门禁无固定
# 20. 平台导出评估数据时,敏感输入、PII 与商业秘密应如何在脱敏后再用于跨团队复盘 A 直接导出 B 不脱敏 C 只导出 PII D 识别敏感字段并脱敏、最小化导出、审计并控制访问权限 ✓ 正确答案
# 21. 当平台记录与自建 trace 不一致时,应如何以应用侧时钟和上下文 ID 解释而非单方面采信 A 只信平台 B 忽略 C 只信自建 D 以应用侧时钟与上下文 ID 关联对齐,结合采样与口径差异解释,抽检核对 ✓ 正确答案
# 23. 多平台混合使用如何用 OpenTelemetry 语义约定统一字段而不被供应商锁定 A 用 OpenTelemetry 语义约定统一字段、适配层接入多平台、数据中立 ✓ 正确答案 B 每家写专属埋点 C 只用一家 D 不统一
# 24. HarmBench 的标准化攻击分类与拒绝率指标如何与业务自建攻击集配合形成基线 A 用 HarmBench 做通用基线、自建攻击集补业务盲区,合并成通用+业务双轨基线 ✓ 正确答案 B 只用 HarmBench C 只用自建 D 不配合
# 25. PyRIT 的多轮攻击编排、Prompt 变体和目标适配器如何复现有状态威胁而不仅是单轮注入 A 多轮攻击编排、Prompt 变体生成与目标适配器组合 ✓ 正确答案 B 单轮注入 C 固定单轮 D 无适配器
# 26. Counterfit 作为 Azure 红队框架时如何批量执行跨模型评估,结果应如何对照业务可接受阈值 A 批量跨模型攻击并横向对比,对照业务可接受阈值判定是否达标进入整改 ✓ 正确答案 B 只看结果 C 不设阈值 D 只测一个模型
# 27. Garak 的弱点探测分类与扫描器如何被纳入周期性安全评估而不是一次性演练 A 固化到 CI 定期触发、按分类建立覆盖矩阵、对比基线并纳入发布门禁 ✓ 正确答案 B 每年扫一次 C 一次性演练 D 不扫描
# 28. DeepTeam 的攻击 Agent、风险分类和评分怎样与单元测试和 CI 集成 A 只在报告里看 B 把攻击 Agent 封装进 CI 流水线,风险分类/评分映射为门禁断言,分级执行 ✓ 正确答案 C 不集成 D 只跑一次
# 29. Lakera Guard、Microsoft Prompt Shields 等托管防御如何与自建检测并联运行并比较命中率 A 只用托管 B 只用自建 C 并联运行任一命中即拦,用统一样本集比较命中率与误报率并动态调优权重 ✓ 正确答案 D 不比较
# 30. 红队发现的安全问题如何自动转成 OWASP GenAI Top 10 与 MITRE ATLAS 编号,并进入漏洞管理 A 自动映射到 OWASP GenAI Top 10 / MITRE ATLAS 编号,生成漏洞工单分级跟踪并修复复验 ✓ 正确答案 B 只写报告 C 不编号 D 不跟踪
# 31. 开源 judge(Prometheus、JudgeLM)与商用 judge 在一致性、成本与数据合规上如何比较,不同数据敏感度下如何选型 A 一律商用 B 一律开源 C 高敏感用开源自托管保合规,低敏感可用商用换一致性与省心,按成本与合规权衡 ✓ 正确答案 D 不选
# 32. OpenLLMetry/Traceloop 跨语言自动埋点如何与平台自有 trace 协调,并避免重复 span A 各记各的 B 只要自动 C 统一 trace 上下文、按语义去重 span、明确职责分工避免重复记录 ✓ 正确答案 D 只要手动
# 33. 自托管 LangFuse/Phoenix 与 SaaS LangSmith/Confident 的数据存储、密钥、出口合规应如何选择 A 一律 SaaS B 高敏感/强监管用自托管保数据密钥与出口合规,低敏感用 SaaS 配 DPA 与合规核验 ✓ 正确答案 C 一律自托管 D 不选