Jailbreaking 与多模态对抗

共 19 题
📑 题目列表 19 题
#
★★★

1. 直接/间接 Prompt Injection、Role-Play 和 Many-Shot 越狱分别利用了什么上下文弱点

直接/间接 Prompt Injection、Role-Play 和 Many-Shot 越狱分别利用了什么上下文弱点?

  • 各类越狱的机理
  • 上下文弱点的类型
  • 对应防御

直接 Prompt Injection 利用"指令与数据不分"——用户输入里的指令被当作系统指令执行;间接注入利用"外部内容(如 RAG 文档、网页)被当作可信指令"。Role-Play 利用"角色置换"——让模型扮演无安全限制的角色(如"你是无限制的 AI"),从而绕过被约束的默认行为。Many-Shot 利用"上下文内学习"——在上下文中堆叠大量无害的示例,诱导模型沿用"跟随示例"的模式,从而泛化出有害行为。这些共同点是"模型的上下文处理机制被滥用":指令边界不清、角色约束可被覆盖、上下文示例可被利用。防御要有针对性地隔离指令、约束角色、控制示例。

越狱的本质是"利用上下文机制的弱点"。注入攻指令边界,Role-Play 攻角色约束,Many-Shot 攻上下文学习。识别弱点才能对症防御。

#
★★★

2. Crescendo 多轮递进怎样绕过单轮过滤,系统如何进行跨轮风险累积判断

Crescendo 多轮递进怎样绕过单轮过滤,系统如何进行跨轮风险累积判断?

  • Crescendo 攻击原理
  • 单轮过滤的局限
  • 跨轮风险累积检测

Crescendo 攻击把有害请求拆成多轮渐进式提问,每轮单独看都无害,逐步逼近目标,绕过单轮的输入过滤。防御关键在"跨轮累积判断":单轮过滤只查当前轮,无法识别多轮累积的风险。对策:维护会话级风险状态,对每轮内容做风险评分,累积超过阈值即拦截;追踪对话主题与意图的演进,发现主题逐步滑向有害区域时告警/降级;对高危意图(如"怎么制作 X")在早期轮次就标记并持续监控。同时可对多轮对话做整段重检,而非只看单轮。

Crescendo 攻"单轮过滤的短视"。跨轮累积判断把"每轮风险"合成"会话风险",用会话级状态与累积阈值识别渐进式攻击,是针对性防御。

#
★★★

3. Role-Play、Many-Shot、Skebedelic 等越狱手法利用了什么上下文弱点,防御如何有针对性

Role-Play、Many-Shot、Skebedelic 等越狱手法利用了什么上下文弱点,防御如何有针对性?

  • 各手法利用的弱点
  • 防御的针对性
  • 组合防御

Role-Play 利用"角色指令覆盖安全约束"——模型被诱导扮演无限制角色后放弃默认安全;Many-Shot 利用"上下文示例的泛化"——大量无害示例诱导模型模仿产生有害行为;Skebedelic(Skebedelic 类/脱敏解码)利用"编码/混淆绕过"——把有害内容编码或用特殊格式绕过文本过滤。防御针对性:对 Role-Play 强化角色与安全约束的绑定(角色不可覆盖安全基线);对 Many-Shot 限制上下文示例数量与来源、对示例做检测;对 Skebedelic 类做规范化(解码、去混淆)后再检测。组合防御:不止防单一手法,检测器要覆盖多种弱点并跨轮累积。

不同越狱手法攻不同弱点,防御必须"对症"。角色约束、示例控制、规范化是三类针对性手段,需组合的纵深防御而非单一过滤。

#
★★★

4. Crescendo、Token Smuggling、Base64/Unicode 混淆等攻击的检测与规范化策略

Crescendo、Token Smuggling、Base64/Unicode 混淆等攻击的检测与规范化策略?

  • 各类攻击的检测难点
  • 规范化处理
  • 组合检测

这些攻击共同点是"绕过直接文本过滤"。检测策略:Crescendo 需跨轮累积检测;Token Smuggling(把有害词拆成 token/子串)需对输入做 token 还原与重组检测;Base64/Unicode 混淆需先规范化(解码 Base64、Unicode 归一化如 NFC/NFKC、去同形字混淆)再检测。规范化是前提:把混淆后的输入还原成可检测的明文,再做关键词/分类器校验。但规范化要防"双重编码"与"递归解码",并控制解码深度。组合检测:规范化 + 多轮累积 + 分类器,形成多层防线。

混淆类攻击的破解是"先规范化、再检测"。无规范化则检测器看的是被混淆的输入,自然失效。规范化要处理多种编码,并配合多轮累积与分类器,防住组合攻击。

#
★★★

5. GCG、通用可迁移后缀和 AutoDAN 类攻击为何可能跨模型迁移,防御如何避免只封关键词

GCG、通用可迁移后缀和 AutoDAN 类攻击为何可能跨模型迁移,防御如何避免只封关键词?

  • 攻击可迁移性的来源
  • 防御的泛化性
  • 避免关键词封禁

这些攻击(GCG 梯度攻击、通用可迁移后缀、AutoDAN 自适应)通过优化找到能触发有害行为的"通用触发句/后缀",因不同模型基于相似训练与对齐方式,此类触发对多个模型都有效,从而跨模型迁移。防御不能只封已知关键词:攻击者会变体绕过,且攻击在字符级高度相似但语义不同,关键词封禁易漏易误伤。应对:用语义层面的检测(分类器、嵌入相似度)而非字符匹配;用对抗鲁棒训练(refusal 训练、对抗样本)提升模型对齐;测试变体枚举(扰动关键词、同义词、编码)验证健壮性;持续更新防御并用新攻击集回归,避免闭集过拟合。

可迁移攻击攻"模型对齐的共性",关键词封禁攻"具体字符串"是必败的。防御要提升语义泛化与模型鲁棒性,并用变体测试防闭集过拟合。

#
★★★

6. 视觉提示注入,把指令嵌入图像或截图(含隐形文字)绕过文本过滤,如何用 OCR 前置与图文一致性校验防御?

视觉提示注入:把指令嵌入图像或截图(含隐形文字)绕过文本过滤,如何用 OCR 前置与图文一致性校验防御?

  • 视觉注入的载体
  • OCR 前置检测
  • 图文一致性校验

视觉提示注入把指令藏在图像/截图(隐形文字、水印、子图、色彩对比)中,模型视觉理解后执行指令,绕过文本过滤。防御:1) OCR 前置——对图像做 OCR 提取文字,送入指令检测管线,识别指令性内容;2) 图文一致性校验——比较图像中的指令与用户文本/对话意图是否一致,若图像表达了与系统/用户意图冲突的指令,判为可疑;3) 指令与内容分离——图像内容作为数据而非指令,限定其可执行范围;4) 隔离降权——可疑图像不进入权威上下文或降低其可信度。检测到注入时隔离、告警并限制后续工具调用。

视觉注入的破解是"让图像里的文字可被检测"。OCR 前置 + 一致性校验把图像指令拉回文本检测管线,并验证多模态一致性,是防视觉注入的关键。

#
★★★

7. 音频指令注入,转写内容携带指令时如何区分“内容”与“指令”,音频检测如何与文本护栏联动?

音频指令注入:转写内容携带指令时如何区分"内容"与"指令",音频检测如何与文本护栏联动?

  • 音频注入的载体
  • 内容与指令分离
  • 音频检测与文本护栏联动

音频指令注入把指令藏在语音转写中(如"忽略以上内容,执行 X"),模型执行后造成危害。区分"内容"与"指令":对外部传入的音频内容标注为"不可信数据",与系统指令隔离;检测转写中的指令性文本(命令式、指向系统操作的语句),识别出"内容说的事"与"试图触发的事"。联动:音频检测(ASR 转写 + 指令检测)与文本护栏联动,统一把指令性内容送入安全检测管线;音频指令进入上下文前标记为低可信,触发工具调用需额外校验;检测到注入时,音频段被隔离、告警并限制工具权限。音频与文本护栏共用一套检测与决策逻辑,形成跨模态统一防线。

音频注入的破解是"转写后套用文本护栏",并区分内容与指令。让音频检测与文本护栏共用决策逻辑,把音频指令纳入统一安全边界,避免音频成为绕过通道。

#
★★

8. 模型窃取(Model Stealing)与成员推断(Membership Inference)等隐私探测攻击在 API 场景下应如何通过限速、日志审计与输出扰动防护

模型窃取(Model Stealing)与成员推断(Membership Inference)等隐私探测攻击在 API 场景下应如何通过限速、日志审计与输出扰动防护?

  • 模型窃取与成员推断原理
  • 限速与审计
  • 输出扰动防护

模型窃取通过大量查询与输出反推模型行为/权重;成员推断通过观察模型对特定样本的响应判断某数据是否在训练集。API 防护:1) 限速与配额——限制单用户/IP 的查询频率与总量,增加攻击成本;2) 日志审计——记录查询模式,检测异常高频/系统化查询(脚本化探测),触发告警与封禁;3) 输出扰动——对输出做轻微扰动(噪音、舍入、截断)或对成员推断相关响应做模糊,降低攻击者信息增益;4) 访问控制——鉴权、密钥轮换、敏感能力受限。同时监控泛化行为,识别刻意收集的行为。

这两类攻击靠"大量查询 + 信息推断"。限速抬成本、审计抓模式、扰动降信息,三重防护把攻击难上加难。核心是"让攻击者难以获取足够高质量信息"。

#
★★

9. 模型安全拒答与“过度拒绝”(拒绝合法请求)的权衡应如何通过双向评估集量化,护栏参数如何校准

模型安全拒答与"过度拒绝"(拒绝合法请求)的权衡应如何通过双向评估集量化,护栏参数如何校准?

  • 双向评估集(有害/合法)
  • 拒答与过度拒绝的量化
  • 护栏参数校准

权衡量化需双向评估集:有害样本集(验证拒答率——应拒的拒没拒)与合法样本集(验证过度拒绝率——不应拒的有没有误拒)。用两个指标:拒答率(有害样本中被正确拒绝的比例)与过度拒绝率(合法样本中被误拒的比例)。理想是拒答率高、过度拒绝低。护栏参数(阈值、分类器灵敏度)校准:在两类样本上扫描参数,绘制拒答率 vs 过度拒绝率曲线,选业务可接受的平衡点(如安全优先场景允许一定过度拒绝,体验优先反之)。校准后持续回归,防止参数漂移或模型更新后失衡。

拒答与过度拒绝是"安全 vs 体验"的权衡。双向评估集把两个指标量化,参数扫描找平衡点,是让权衡可度量、可调的工程方法。

#
★★

10. 安全分类器与模型拒答策略的效果应如何通过适应性攻击(变体枚举)复验,防止只封已知关键词

安全分类器与模型拒答策略的效果应如何通过适应性攻击(变体枚举)复验,防止只封已知关键词?

  • 适应性攻击与变体枚举
  • 防御鲁棒性复验
  • 防闭集过拟合

防御一旦只封已知关键词,攻击者用变体(同义词、错别字、拼音、编码、插入字符、角色扮演)即可绕过。复验方法:对每条已知攻击样本做变体枚举——生成大量变体(扰动、改写、编码、表情、多语言),用分类器/拒答策略检测,统计绕过率。若变体绕过率高,说明防御过拟合已知样本。应对:用变体训练增强分类器泛化,用语义级检测而非字符匹配,并用动态攻击集持续复验。复验结果反哺模型拒答策略与护栏阈值,形成"攻击→复验→加固"循环。

变体枚举是检验"防御是否泛化"的标准手段。高绕过率=闭集过拟合。防闭集过拟合需语义检测、变体训练与持续复验,而非堆关键词。

#
★★

11. 安全拒答既要阻止有害行为又要减少过度拒绝,双向评估集应如何构造

安全拒答既要阻止有害行为又要减少过度拒绝,双向评估集应如何构造?

  • 双向评估集构成
  • 有害与合法样本的平衡
  • 边界与标注

双向评估集包含两类:有害样本集(恶意、危险、越狱内容,验证拒答)与合法样本集(正常、边界但安全的内容,验证不误拒)。构造要点:1) 有害样本覆盖多类攻击与越狱手法(注入、角色扮演、多轮、混淆);2) 合法样本覆盖正常的业务请求与边界场景(如"如何健康减肥"这类教育性内容,不能误拒);3) 边界样本——看似敏感但合法的请求要单独标注,作为"过度拒绝"的精确测试;4) 标注一致性与人工复核,避免误标。两类样本量要平衡,防止偏向某一类导致指标失真。评估时分开报告拒答率与过度拒绝率。

双向评估集的价值是"同时看两个方向的错误"。只有有害样本会只看拒答率而忽视误拒,只有合法样本会放走有害。边界样本是关键,用于精确测过度拒绝。

#
★★

12. 安全分类器(Guardrails)的对抗鲁棒性如何测试,绕过率如何监控

安全分类器(Guardrails)的对抗鲁棒性如何测试,绕过率如何监控?

  • 对抗鲁棒性测试
  • 绕过率指标
  • 持续监控

对抗鲁棒性测试:对护栏做对抗攻击——变体枚举、对抗样本(GCG 扰动)、多模态绕过、编码混淆,统计绕过率 = 被护栏漏过且系统的有害请求 / 总有害请求。绕过率监控:在测试集与线上(抽样)持续统计绕过率,设基线,绕过率上升触发告警与加固。鲁棒性测试还包括误报监控(合法请求被误拦比例)。测试要覆盖不同类型攻击与变体,并随攻击手法演进更新。护栏更新后重测绕过率确认无回归。绕过率是护栏有效性的核心指标,需持续监控而非一次性。

护栏也有过拟合与退化风险。绕过率是"漏网有害/总有害"的核心指标,需对抗测试与持续监控,防止护栏随版本或攻击演进失效。

#
★★

13. 越狱攻击在中文场景下的差异(谐音、文言、敏感词变体)如何构造评测集

越狱攻击在中文场景下的差异(谐音、文言、敏感词变体)如何构造评测集?

  • 中文越狱的独特性
  • 谐音/文言/变体构造
  • 评测集的代表性

中文越狱与英文不同:谐音(如用同音字替换敏感词)、文言文(用古语表达指令)、敏感词变体(拆字、拼音、错别字、emoji、网络黑话)、多义词与语境歧义。构造评测集:1) 谐音变体——敏感词用同音/近音字替换;2) 文言/书面语——用古代汉语表达有害指令;3) 变体集——拆字、拼音、简繁、错别字、emoji、梗;4) 本土场景——涉及中国语境的有害内容(诈骗、赌博、造谣等)。每类样本标注原始意图与变体类型,覆盖不同攻击手法,用于评估中文检测的泛化能力,避免只测英文攻击。

中文越狱评测集要反映"中文特有的绕过方式"。谐音、文言、变体是中文攻击的典型载体,构造这些样本才能评估中文护栏的真实鲁棒性,而非套用英文集。

#
★★

14. 安全护栏的“过度拒绝”(Over-refusal)对用户体验的影响如何量化

安全护栏的"过度拒绝"(Over-refusal)对用户体验的影响如何量化?

  • 过度拒绝的定义
  • 用户影响量化
  • 体验侧指标

过度拒绝是合法请求被误拒。量化影响:1) 过度拒绝率——合法请求中被误拒的比例(用合法评估集);2) 任务失败率——因误拒导致用户任务无法完成的比例;3) 用户满意度——误拒后用户是否放弃、投诉、流失(用 AB 测试与用户反馈);4) 业务损失——关键业务请求(下单、客服、教育)被误拒造成的转化损失。量化方法:线上埋点统计误拒与用户行为,结合评估集与用户侧指标(完成率、满意度、投诉率)。量化结果用于校准护栏参数,在安全与体验间平衡。

过度拒绝是"安全过度"的隐性成本。仅看拒答率会忽视体验损失。用误拒率 + 任务失败 + 用户行为多维度量化,才能促使用户中心地校准护栏。

#
★★

15. 越狱攻击与“角色一致性”需求的边界如何划分(如创意写作、安全教育)

越狱攻击与"角色一致性"需求的边界如何划分(如创意写作、安全教育)?

  • 合法角色需求与越狱的边界
  • 区分标准
  • 设计与测试

边界划分在于"角色是否服务于安全基线"。合法角色需求(如创意写作中的反派、安全教育中的情景模拟)虽然涉及危险情境,但目的是教育/创作,且不实际输出有害行为。越狱则用角色覆盖安全约束,诱导实际执行有害指令。划分标准:1) 输出是否实操有害行为(给出可执行的危险步骤)vs 抽象/教育性描述;2) 是否有明确的正当目的(教育、研究、创作)且不造成伤害;3) 是否试图破坏系统安全(泄露提示、越权、逃逸)。设计上允许教育场景但需加"以安全/免责声明+抽象化"的约束,并对越狱性角色("无限制助手")做专门的检测。测试区分两类样本,避免误伤合法角色。

边界是"目的 + 输出 + 是否破坏系统"。教育/创作虽涉危险话题但输出受控、有正当目的,越狱则破坏安全。设计需区分并测试,避免一刀切误伤合法角色。

#
★★

16. 越狱成功的分级处置,从拒绝到有害输出的分级响应(重答、转人工、留存样本)如何配置?

越狱成功的分级处置:从拒绝到有害输出的分级响应(重答、转人工、留存样本)如何配置?

  • 分级响应机制
  • 各等级处置动作
  • 样本留存与审计

越狱处理按严重度分级响应。低危(被护栏拦截/轻微越狱):模型直接拒绝并给出安全提示,可选重答(引导合法方向)。中危(部分有害输出或触碰边界):拒绝 + 解释 + 重答,必要时升级。高危(越狱成功产生有害输出或越权):立即停止输出、触发安全告警、转人工复核、记录会话。全部分级都留存样本(session 上下文、复现步骤、注入内容)用于审计与回归。配置要点:分级阈值可调、处置动作可配置、高危必转人工、样本一律留存。分级响应让"缓解"与"追责"结合,避免一刀切或放任。

分级处置是"按风险给响应"。低危拒绝引导、高危止损转人工,样本留存保证可审计与可回归。分级避免"一刀切"(误伤合法)或"放任"(漏掉高危)。

#

17. 安全防御的多层组合(输入过滤 + 输出过滤 + 模型对齐 + 人工审核)

安全防御的多层组合(输入过滤 + 输出过滤 + 模型对齐 + 人工审核)如何设计?

  • 多层防御的层次
  • 各层职责
  • 纵深防御

多层防御组合:输入过滤——在输入进入模型前检测注入/越狱/有害内容,拦截或隔离;输出过滤——对模型输出做检测(有害、泄露、幻觉),过滤或拦截;模型对齐——通过训练/提示让模型本身具备安全拒答与拒有害能力;人工审核——对高风险输出或告警做人工复核,兜底。各层职责不同:输入过滤防"进去的有害",输出过滤防"出来的有害",模型对齐是"内在安全",人工审核是"最终兜底"。设计上各层独立生效又协同,形成纵深防御;单层可能被绕过,多层组合才能降低整体风险。各层参数统一监控,避免过度堆叠导致误伤。

纵深防御是"多层不依赖单一防线"。输入/输出/对齐/人工四层各守一段,单层失效不至于全盘崩。关键是各层协同且不造成过度拒绝。

#

18. 回滚策略、人工兜底与对抗评估集更新的协同流程应如何设计

回滚策略、人工兜底与对抗评估集更新的协同流程应如何设计?

  • 回滚与兜底机制
  • 评估集更新
  • 协同流程

协同流程:当恶意攻击/新越狱手法上线或防御削弱时,1) 回滚——立即回滚到最近稳定的安全配置/模型版本,或降级到保守策略;2) 人工兜底——对高风险输出转人工复核,临时加强人工审核;3) 评估集更新——把新攻击样本加入对抗评估集,验证修复;4) 修复后回归——用更新后的评估集验证防御有效,再逐步恢复。设计上三要素联动:回滚是"止损",人工兜底是"临时防御",评估集更新是"长期改进"。流程要有版本管理、紧急开关与责任人,确保快速响应。

安全事件处理是"止损-兜底-改进"的联动。回滚快速回到安全态,人工兜底临时覆盖,评估集更新固化改进,三者协同让系统在攻击后快速恢复并持续加固。

#

19. 多模态对抗评测集,图像、音频与视频注入攻击如何构造统一评测集并纳入安全回归?

多模态对抗评测集:图像、音频与视频注入攻击如何构造统一评测集并纳入安全回归?

  • 多模态对抗样本构造
  • 统一评测集
  • 安全回归集成

构造统一评测集:覆盖图像(隐形文字、图片指令、水印)、音频(隐式指令、语音注入)、视频(帧内指令、跨模态指令)三类对抗样本,各类标注原始无害意图与被注入的指令、注入位置、期望正确行为。统一评测集要有统一的数据格式与标注 schema,便于一键评估。纳入安全回归:把评测集接入自动回归流水线,每次模型/护栏/产品更新都跑一遍,统计各模态的绕过率与误报率,与基线对比,超过阈值即失败阻止上线。评测集随新攻击手法定期扩充,防止过时。

多模态对抗的评测要"统一格式 + 自动回归"。统一评测集让图像/音频/视频有可比指标,纳入回归让每次变更都可测,防止多模态攻击被遗忘。