1. 直接注入和来自网页、邮件、PDF 的间接注入有何差异,如何构造可复现攻击测试
直接注入与来自网页、邮件、PDF 等内容的间接注入有何差异,如何构造可复现的攻击测试?
- 直接与间接注入的定义与来源
- 链路差异与信任级别
- 可复现攻击测试的构造
直接注入来自用户输入,攻击者主动把指令投喂给模型;间接注入来自被模型消费的第三方内容(网页、邮件、PDF、文档),攻击者把指令预先埋入这些内容,模型在检索或读取时被动接收。差异在于信任级别与触发时机:直接注入是主动攻击,间接注入是"被动陷阱"。构造可复现测试:定义固定的输入样例(含恶意指令的文本/文档/URL),用红队工具在固定模型版本与提示词下批量运行,记录注入是否成功,形成回归测试集。
间接注入的防御难点在于"不可信内容进入上下文",测试需模拟真实场景(如文档被检索后是否触发)。可复现性依赖固定版本、固定输入与固定评判。