AI 安全与对齐工程

共 19 题
#

1. OWASP Top 10 for LLM Applications(v2.0),Prompt Injection、Insecure Output Handling、Training Data Poisoning 等风险的防御优先级?

A 按清单顺序逐一防御即可
B Training Data Poisoning 是应用层最优先要防的
C 应按风险概率×危害×可控性排序,Prompt Injection 与输出处理等应用层高频风险最优先 ✓ 正确答案
D 所有风险优先级相同
#

2. Indirect Prompt Injection(间接提示注入)的工程防御,从 RAG 文档、Tool 返回值、Web 抓取内容中识别攻击载荷的检测机制?

A 只要过滤掉可疑指令即可彻底防住
B 应通过内容信任分级、输入检测与工具权限/审批的行为约束组合防御,不信任外部内容 ✓ 正确答案
C 外部内容应完全信任
D 间接注入无法通过任何工程手段缓解
#

3. 模型/API 选型时的安全能力评估,如何用标准化评测集对比不同模型的安全行为(拒答率、越狱鲁棒性、偏见与有害内容率),并把评估结果纳入选型与灰度放量决策?

A 只需看能力打分,安全不重要
B 应通过标准化评测集量化拒答率、越狱鲁棒性、偏见与有害内容率,并作为选型与灰度放量的硬性门禁 ✓ 正确答案
C 安全评测无法量化
D 灰度放量无需盯安全指标
#

4. 模型更新的安全回归,新版本上线前安全行为(拒答率、注入鲁棒性、偏见)如何与旧版本对比?

A 新版本能力更强,无需安全回归
B 安全回归只能看总体指标
C 应用固定安全评测集把新旧版本各维度对比,关键安全维度退化则阻断上线或回滚 ✓ 正确答案
D 偏见这类问题无法在新旧版本间对比
#

5. AI 应用的供应链安全,依赖的 Model(HF/Self-hosted)、Embedding、Vector DB 自身的 CVE 与许可证审计?

A 只需关注模型权重,忽略推理引擎
B 开源依赖无需许可证审计
C 应通过 SBOM 记录组件、CVE 扫描漏洞、核对模型来源与许可证合规,形成供应链安全基线 ✓ 正确答案
D 向量库不是供应链组件,无需审计
#

6. 安全约束导致的能力下降(所谓“对齐税”)应如何度量,安全与能力的权衡如何向业务解释

A 应区分"该拒"与"误伤",用"安全收益 vs 误伤成本"量化权衡并向业务解释,把约束做成可调优参数 ✓ 正确答案
B 安全约束无任何能力代价
C 误伤率与安全约束无关
D 安全收益无法量化,只能靠直觉
#

7. 提示注入的防御,输入过滤、指令隔离与输出约束的组合方案应如何分层落地,各自的失效模式是什么

A 输入过滤、指令隔离、输出约束各有失效模式,应多层叠加并配合权限紧缩做纵深防御 ✓ 正确答案
B 输入过滤可彻底防住注入
C 指令隔离一旦设置就不可被绕过
D 只需输出约束即可,无需其他层
#

8. 红队测试的覆盖矩阵与自动化,注入/越狱/隐私/偏见维度的攻击集、评分(ASR)与回归门禁?

A 应构建多维攻击集、用 ASR 量化攻击成功率,并接入 CI 做回归门禁,攻击集持续扩充 ✓ 正确答案
B 红队测试只需人工做一次即可
C ASR 无法量化攻击成功率
D 红队测试不接入发布流程
#

9. 偏见与公平性评估,敏感属性与样本分布如何设计评测集,业务影响如何量化?

A 只要覆盖敏感词汇即可测出偏见
B 样本分布无需考虑敏感属性
C 偏见无法量化,只能定性
D 应通过属性置换的对照样本设计评测集,用处置差异率等指标量化偏见对业务的影响并纳入门禁 ✓ 正确答案
#

10. AI 输出水印(Watermarking)与生成内容检测(C2PA、SynthID)在企业合规场景的落地?

A AI 生成内容无需任何标识
B 水印在压缩后必然失效,无法使用
C 应通过 C2PA 凭证、SynthID 类水印标注 AI 生成内容,并建设检测与追溯能力满足合规要求 ✓ 正确答案
D 内容检测无法识别 AI 生成内容
#

11. 应用层安全与模型层对齐的边界,哪些风险必须靠系统设计而非模型对齐解决?

A 模型对齐可解决所有安全问题
B 模型可以自我约束工具权限
C 系统设计无需考虑安全,交给模型即可
D 权限、越权、数据隔离、不可逆操作审批等必须靠系统设计兜底,模型对齐只管"说什么" ✓ 正确答案
#

12. 内容安全的分类,NSFW、暴力、政治敏感与合规风险应如何分级定义,分类模型与规则引擎如何组合

A 内容只需分成"安全/不安全"两档
B 分类模型无需分级,直接拦截即可
C 单一规则引擎即可覆盖所有内容风险
D 应分级定义各类风险并明确处置动作,用分类模型 + 规则引擎组合兼顾召回与精度,必要时人工复核 ✓ 正确答案
#

13. 红队测试的自动化,对抗样本生成、越狱变体枚举与结果分级应如何流水线化,结果如何进入发布门禁

A 红队测试只能靠人工,无法自动化
B 攻击样本无需变体,一次生成即可
C 应把对抗样本生成、越狱变体枚举与结果分级流水线化,用 ASR 与高危突破数作为发布门禁并回流攻击集 ✓ 正确答案
D 红队结果无需进入发布门禁
#

14. 隐私与安全,输入输出脱敏、访问控制与数据留存应在调用链的哪些环节落地,脱敏如何不破坏功能

A 只需在输入侧脱敏即可
B 日志可原样记录敏感输入
C 脱敏必然破坏模型功能
D 应在输入、输出、存储与日志各环节做脱敏/访问控制/留存管理,并用占位符可还原脱敏以不破坏功能 ✓ 正确答案
#

15. 输出内容的合规,敏感词过滤、版权风格规避与 AIGC 标识应如何组合,误杀与漏放如何权衡

A 误杀与漏放不可兼得,只能选其一
B 敏感词过滤、版权规避与 AIGC 标识组合覆盖不同风险,用分级处置、人工复核与双指标监控平衡误杀与漏放 ✓ 正确答案
C 只需敏感词过滤即可满足合规
D 误杀率不重要,漏放率才重要
#

16. 安全评测指标(攻击成功率、拒绝率、误伤率)如何进入模型选型与上线决策?

A 安全指标只作参考,不设门槛
B 误伤率无法进入决策
C 应把 ASR、拒绝率、误伤率设为选型硬门槛与上线门禁,并用安全+能力双轴评估 ✓ 正确答案
D 上线灰度无需监控安全指标
#

17. AI 应用上线前的安全验收清单,提示注入、越狱、隐私泄露与内容违规如何逐项测试?

A 只需测试内容违规即可
B 安全验收不影响上线
C 验收清单一次制定即可,无需更新
D 应针对注入、越狱、隐私泄露、内容违规逐项用固定测试集测试并纳入发布门禁,辅以人工复核 ✓ 正确答案
#

18. 红队发现的攻击面如何转化为应用层的缓解措施(输入过滤、输出校验、权限收敛、人工审批)?

A 红队只需发现攻击面,无需修复
B 只修发现的具体样本即可
C 应把攻击面映射到输入过滤、输出校验、权限收敛、人工审批等机制层,并用回归验证缓解是否有效 ✓ 正确答案
D 缓解措施无需回归验证
#

19. 拒答解释与替代路径,模型拒绝请求时如何解释原因并提供安全替代,避免对抗性追问?

A 应解释拒答原因并提供安全替代路径,用一致且中性的拒答避免对抗性追问 ✓ 正确答案
B 直接拒绝即可,无需解释
C 拒答越严厉越能防越狱
D 用户换种说法问就应改变答案