1. 直接/间接 Prompt Injection、Role-Play 和 Many-Shot 越狱分别利用了什么上下文弱点
直接/间接 Prompt Injection、Role-Play 和 Many-Shot 越狱分别利用了什么上下文弱点?
- 各类越狱的机理
- 上下文弱点的类型
- 对应防御
直接 Prompt Injection 利用"指令与数据不分"——用户输入里的指令被当作系统指令执行;间接注入利用"外部内容(如 RAG 文档、网页)被当作可信指令"。Role-Play 利用"角色置换"——让模型扮演无安全限制的角色(如"你是无限制的 AI"),从而绕过被约束的默认行为。Many-Shot 利用"上下文内学习"——在上下文中堆叠大量无害的示例,诱导模型沿用"跟随示例"的模式,从而泛化出有害行为。这些共同点是"模型的上下文处理机制被滥用":指令边界不清、角色约束可被覆盖、上下文示例可被利用。防御要有针对性地隔离指令、约束角色、控制示例。
越狱的本质是"利用上下文机制的弱点"。注入攻指令边界,Role-Play 攻角色约束,Many-Shot 攻上下文学习。识别弱点才能对症防御。