Jailbreaking 与多模态对抗

共 19 题
#

1. 直接/间接 Prompt Injection、Role-Play 和 Many-Shot 越狱分别利用了什么上下文弱点

A 注入攻指令边界、Role-Play 攻角色约束、Many-Shot 攻上下文学习,需针对性防御 ✓ 正确答案
B 所有越狱都利用同一弱点,可统一防御
C Many-Shot 与上下文无关,利用的是模型参数
D Role-Play 不会影响安全约束
#

2. Crescendo 多轮递进怎样绕过单轮过滤,系统如何进行跨轮风险累积判断

A 加强单轮过滤即可完全防住 Crescendo
B Crescendo 与多轮无关,单轮即可识别
C 维护会话级风险状态,对每轮做风险评分并累积,超过阈值即拦截,追踪主题演进 ✓ 正确答案
D 跨轮累积判断无需跟踪会话状态
#

3. Role-Play、Many-Shot、Skebedelic 等越狱手法利用了什么上下文弱点,防御如何有针对性

A 对 Role-Play 强化角色安全约束、对 Many-Shot 控制示例、对 Skebedelic 做规范化后再检测,组合纵深防御 ✓ 正确答案
B 统一文本过滤即可防住所有手法
C 三种手法攻同一弱点,可统一处理
D 规范化检测对 Skebedelic 无效
#

4. Crescendo、Token Smuggling、Base64/Unicode 混淆等攻击的检测与规范化策略

A 直接把原始输入交给关键词检测即可
B 混淆无法还原,只能放弃检测
C 规范化多余,检测器天然处理混淆
D 先做规范化(解码、Unicode 归一化、token 还原)再检测,并配合跨轮累积与分类器组合防御 ✓ 正确答案
#

5. GCG、通用可迁移后缀和 AutoDAN 类攻击为何可能跨模型迁移,防御如何避免只封关键词

A 封禁攻击关键词即可彻底防住
B 关键词封禁足够所有攻击,无需语义检测
C 不同模型攻击不可迁移,无需担心
D 用语义检测、对抗鲁棒训练与变体枚举测试提升泛化,避免只封已知关键词导致闭集过拟合 ✓ 正确答案
#

6. 视觉提示注入,把指令嵌入图像或截图(含隐形文字)绕过文本过滤,如何用 OCR 前置与图文一致性校验防御?

A 文本过滤能覆盖图像中的指令,无需额外处理
B 隐形文字无法被 OCR 检测,只能放弃图像输入
C 用 OCR 提取图像文字做指令检测,并做图文一致性校验,图像内容仅作数据不直接执行 ✓ 正确答案
D 图像指令与文本指令无需校验一致性
#

7. 音频指令注入,转写内容携带指令时如何区分“内容”与“指令”,音频检测如何与文本护栏联动?

A 音频转写输入无需检测,只过滤文本即可
B 音频中的指令无法区分,只能整体接受
C 把音频转写标记为不可信数据,与指令隔离,并与文本护栏联动统一检测,注入后隔离告警限权 ✓ 正确答案
D 音频检测与文本护栏应完全独立,互不联动
#

8. 模型窃取(Model Stealing)与成员推断(Membership Inference)等隐私探测攻击在 API 场景下应如何通过限速、日志审计与输出扰动防护

A 无需防护,模型输出天然安全
B 成员推断无法通过限速干扰
C 输出扰动会损害所有用户的正常使用,应禁用
D 用限速配额抬攻击成本、日志审计检测高频查询、输出扰动降低信息增益并配合访问控制 ✓ 正确答案
#

9. 模型安全拒答与“过度拒绝”(拒绝合法请求)的权衡应如何通过双向评估集量化,护栏参数如何校准

A 用有害与合法双向评估集量化拒答率与过度拒绝率,扫描护栏参数选业务可接受平衡点 ✓ 正确答案
B 只需提高拒答率,过度拒绝无所谓
C 过度拒绝是安全代价,无需量化
D 护栏参数一次设定终身不变
#

10. 安全分类器与模型拒答策略的效果应如何通过适应性攻击(变体枚举)复验,防止只封已知关键词

A 封住已知攻击关键词即可一劳永逸
B 关键词封禁已足够所有攻击,无需语义检测
C 变体枚举无法发现防御弱点
D 用变体枚举对已知样本生成变体测绕过率,发现过拟合后用语义检测与变体训练加固,持续复验 ✓ 正确答案
#

11. 安全拒答既要阻止有害行为又要减少过度拒绝,双向评估集应如何构造

A 只需有害样本即可评估拒答
B 应平衡有害与合法样本,并包含边界样本,分开报告拒答率与过度拒绝率 ✓ 正确答案
C 边界样本无需单独标注
D 两类样本越多越好,无需平衡
#

12. 安全分类器(Guardrails)的对抗鲁棒性如何测试,绕过率如何监控

A 用对抗样本与变体枚举测绕过率,并在测试与线上持续监控,绕过率上升即告警加固 ✓ 正确答案
B 护栏测试一次即可,无需监控
C 绕过率与护栏质量无关
D 护栏更新后无需重测绕过率
#

13. 越狱攻击在中文场景下的差异(谐音、文言、敏感词变体)如何构造评测集

A 直接用英文越狱集即可代表中文
B 应覆盖谐音、文言、敏感词变体与本土场景,标注原始意图与变体类型,评估中文护栏泛化能力 ✓ 正确答案
C 中文攻击与英文完全一致,无需差异化
D 谐音与文言不影响中文检测,无需构造
#

14. 安全护栏的“过度拒绝”(Over-refusal)对用户体验的影响如何量化

A 过度拒绝是安全代价,无需量化
B 只统计拒答率即可代表体验
C 用误拒率、任务失败率、用户满意度与业务损失等多维度量化,推动校准护栏参数 ✓ 正确答案
D 过度拒绝不影响用户流失
#

15. 越狱攻击与“角色一致性”需求的边界如何划分(如创意写作、安全教育)

A 任何涉及危险情境的角色都应拒绝
B 按目的、输出是否实操有害、是否破坏系统安全区分,允许可控的教育/创作角色并单独检测越狱性角色 ✓ 正确答案
C 越狱与合法角色无区别,无需划分
D 教育场景可完全无约束地输出危险内容
#

16. 越狱成功的分级处置,从拒绝到有害输出的分级响应(重答、转人工、留存样本)如何配置?

A 所有越狱统一拒绝即可
B 高危越狱无需转人工,自动处理即可
C 按严重度分级响应:低危拒绝重答、高危停止输出转人工复核,并留存会话样本审计 ✓ 正确答案
D 样本留存无关紧要,无需记录
#

17. 安全防御的多层组合(输入过滤 + 输出过滤 + 模型对齐 + 人工审核)

A 只需一层过滤即可保证安全
B 输入过滤、输出过滤、模型对齐与人工审核各守一层,组合成纵深防御,降低单层绕过风险 ✓ 正确答案
C 层数越多越安全,无需协调
D 人工审核是多余的,自动化即可
#

18. 回滚策略、人工兜底与对抗评估集更新的协同流程应如何设计

A 三要素独立运作,无需协同
B 攻击后回滚止损、人工兜底临时防御、更新评估集固化修复,三联动形成快速响应与持续加固 ✓ 正确答案
C 回滚后无需更新评估集
D 人工兜底长期替代自动防御即可
#

19. 多模态对抗评测集,图像、音频与视频注入攻击如何构造统一评测集并纳入安全回归?

A 图像、音频、视频各自独立评测即可
B 评测集建一次即可,无需更新
C 多模态对抗样本无需统一,混在一起即可
D 用统一格式构造图像/音频/视频对抗样本集,接入自动回归,每次变更测绕过率并定期扩充 ✓ 正确答案