提示注入、越狱与输出安全

共 32 题
#

1. 直接注入和来自网页、邮件、PDF 的间接注入有何差异,如何构造可复现攻击测试

A 间接注入指令埋藏在第三方内容中,模型被动接收 ✓ 正确答案
B 间接注入来自用户主动输入
C 两者信任级别完全相同
D 间接注入无法测试
#

2. 为什么 system Prompt 的优先级不能替代鉴权,模型永远不应决定哪些权限

A 系统 Prompt 优先级高,可替代鉴权
B 权限决策必须由应用层确定性授权机制强制执行,模型不裁决权限 ✓ 正确答案
C 模型可以判断用户是否管理员
D 系统 Prompt 不会被注入
#

3. 模型输出进入 HTML、SQL、Shell、URL 或工具参数时,如何按目标上下文校验与编码

A 一套编码适用于所有上下文
B 模型输出可直接作为 SQL 执行
C 应按目标上下文选择对应编码与校验,模型输出视为不可信数据 ✓ 正确答案
D Shell 拼接无需转义
#

4. 间接 Prompt Injection(来自邮件、文档、网页)如何绕过输入过滤,应用层应采用哪些数据隔离与检测手段?

A 数据隔离与注入检测需结合,因为内容能绕过规则过滤 ✓ 正确答案
B 输入过滤可以完全阻止间接注入
C 间接注入无需防御
D 文档内容可直接拼入系统指令
#

5. 系统 Prompt 的“不可见”为何不能作为安全边界,应用层应假设 Prompt 完全泄露

A 系统 Prompt 不可见,可存储机密
B 密钥可以写在 Prompt 中
C 系统 Prompt 无法被提取
D 应假设 Prompt 完全泄露,敏感规则与权限逻辑放后端 ✓ 正确答案
#

6. 如何防止输出触发 XSS、SQL 注入、SSRF、命令执行和越权资源访问

A 信任模型输出即可
B 只有 SQL 需要参数化
C 需在输出进入执行上下文前做编码校验,执行前做授权与隔离 ✓ 正确答案
D SSRF 无法防护
#

7. 内容过滤、策略模型、Constitutional AI 等控制为何仍需与权限、沙箱和人工审核组合

A Constitutional AI 可完全替代权限控制
B 人工审核没有必要
C 内容过滤 100% 可靠
D 模型侧控制是概率性的,需与权限、沙箱和人工审核组合 ✓ 正确答案
#

8. 角色扮演越狱(“假装你是没有限制的 AI”)为何在某些模型上仍然有效,应用层应如何检测与降级

A 模型对齐无法被绕过
B 角色扮演越狱对所有模型都无效
C 应用层应检测越狱迹象并对高风险请求降级处理 ✓ 正确答案
D 无需检测越狱
#

9. 输出过滤(Moderation API、Llama Guard、自研分类器)应如何选型与分层部署,误杀率如何控制?

A 只需单一工具即可覆盖所有场景
B 应分层部署,并通过阈值、人工复核与申诉控制误杀率 ✓ 正确答案
C 误杀率无法控制
D 自研分类器永远优于 Moderation API
#

10. Constitutional AI、deliberative alignment 等“模型内省”机制在对抗越狱时能起多大作用

A 可完全阻止所有越狱
B 与应用层过滤无关
C 只增加成本,无任何作用
D 能提升对已知越狱的鲁棒性,但仍是概率性防线,需确定性控制兜底 ✓ 正确答案
#

11. 当安全过滤误杀合法请求时,如何提供人工申诉通道又不被攻击者滥用

A 应提供可审计的申诉入口,同时做频率限制防止滥用 ✓ 正确答案
B 申诉通道应完全开放,无限流
C 误杀无需申诉
D 申诉结果不必记录
#

12. 怎样提供可审计的申诉、人工复核和最小信息错误提示

A 错误提示应详细说明过滤规则
B 申诉应可审计、人工复核,并采用最小信息错误提示 ✓ 正确答案
C 最小信息提示会误导用户,应避免
D 复核结论无需记录
#

13. 如何验证外部内容即使声称“管理员授权”也无法提高工具权限或改变系统策略

A 内容声称管理员授权即可放行
B 文档中的授权声明应被信任
C 权限决策须基于真实身份与后端策略,不采信内容声明 ✓ 正确答案
D 无需校验权限
#

14. 提示注入的分类(直接/间接/多轮)与防御(输入输出过滤、权限隔离)如何落地?

A 注入只有直接一种
B 多轮注入需会话级风险评分,防御需输入过滤、指令隔离、输出过滤与权限隔离组合 ✓ 正确答案
C 输入过滤可完全防御所有注入
D 权限隔离与注入无关
#

15. 越狱成功案例应在多大范围内分享(厂商、社区)才能帮助提升整体防御而不暴露自家弱点

A 应立刻公开所有细节
B 公开会完全帮助我们抵抗攻击
C 永远不公开
D 应负责任披露,先向厂商报告修复后再公开,敏感细节分级分享 ✓ 正确答案
#

16. 为什么“用户指令永远优先”是危险的,应用应如何在 Prompt 中固化不可覆盖的边界

A 用户指令应永远优先
B Prompt 边界足够安全
C 安全边界需在 Prompt 声明并由后端强制,防止被注入覆盖 ✓ 正确答案
D 无需安全边界
#

17. XSS 通过模型输出注入时,前端输出编码与 Content-Security-Policy 应如何分工

A 编码即可完全防御 XSS
B CSP 能替代编码
C 输出编码是主防线,CSP 是兜底线,两者互补 ✓ 正确答案
D 两者互不相关
#

18. SSRF 风险在 AI 工具调用(抓取网页、读取 URL)时如何避免访问内部网络

A 需校验内网地址、协议白名单、DNS 复查并配合网络隔离 ✓ 正确答案
B 校验 URL 字符串即可完全防护
C 模型提供的 URL 总是可信的
D 元数据地址可以访问
#

19. 命令注入风险在 Bash/Shell 工具中应如何结合白名单、沙箱、临时凭证防御

A 字符串拼接命令即可
B 应结合命令白名单、沙箱隔离与临时凭证 ✓ 正确答案
C 沙箱即可单独防护
D 命令注入无需防御
#

20. Token-level 攻击(特殊字符、Unicode 控制符)

A 特殊字符不构成威胁
B 与编码无关
C 只需删除问号即可
D 应通过 Unicode 规范化、移除控制字符与统一编码来防御 ✓ 正确答案
#

21. 为什么不能仅靠 “内容分类器” 阻止输出风险,仍需在目标上下文做最终校验

A 分类器可完全阻止输出风险
B 目标上下文校验不必要
C 分类器能理解执行上下文
D 分类器是概率性判断,仍需在目标上下文做确定性的执行校验 ✓ 正确答案
#

22. MCP 工具描述投毒(description 中携带注入指令)与恶意工具 rug-pull(上架后变更行为)应如何检测与做准入治理,工具元数据如何固定版本并定期复审

A 工具接入后无需复审
B 版本变更无需重新准入
C 工具 description 可信任
D 应对工具描述做注入扫描、固定版本并定期复审,防 rug-pull ✓ 正确答案
#

23. 多模态注入诱导工具调用成功后,损害控制(撤权、撤销副作用)与证据保全如何做,检测规则如何更新

A 只需撤权即可
B 需撤权、撤销副作用、保全证据并更新检测规则 ✓ 正确答案
C 无需保存证据
D 检测规则无需更新
#

24. Prompt 注入防御的分层策略,输入过滤、输出校验、模型对齐、权限沙箱如何组合

A 只需输入过滤即可
B 权限沙箱与注入防御无关
C 各层相互独立,无需组合
D 输入过滤、输出校验、模型对齐与权限沙箱分层组合,权限沙箱兜底 ✓ 正确答案
#

25. 多模态注入(图片隐藏文字、白底白字)的专项防护与对抗测试

A 图片中的文字不会进入模型
B 多模态注入无需防护
C 白底白字无法检测
D 需对图片做归一化、OCR 检测与注入检测,并做对抗测试 ✓ 正确答案
#

26. Agent 工具调用的"能力最小化",如何限制工具参数范围防止恶意调用?

A 给 Agent 所有工具与参数
B 工具越多越好
C 参数无需校验
D 应只暴露所需工具并做参数范围校验,防止恶意调用 ✓ 正确答案
#

27. 输出侧的内容安全,PII 检测、合规审查与脱敏如何接入生成链路?

A 输出无需检测
B 应在返回用户前接入 PII 检测、合规审查与脱敏 ✓ 正确答案
C 脱敏只在发送前做
D 合规审查可省略
#

28. Agent 工具调用循环中,来自网页抓取、邮件、上传文件与第三方 API 的不可信工具结果注入上下文前,应如何做来源标记与信任分级、指令剥离与隔离上下文(独立解读模型、输出校验、双模型交叉验证),工具输出投毒(tool poisoning)攻击面应如何纳入红队回归用例

A 应做来源标记、信任分级、指令剥离与隔离上下文,并纳入红队回归 ✓ 正确答案
B 工具输出可信,可直接注入上下文
C 无需信任分级
D 双模型验证无意义
#

29. 角色扮演、多语言、编码走私、对抗后缀和多模态越狱应如何分层检测与回退

A 只需对输入做检测
B 越狱无需回退
C 应在输入、输出、多模态分层检测,并对高风险请求降级回退 ✓ 正确答案
D 多模态越狱不构成威胁
#

30. 多语言、编码混淆(Base64、Unicode、Token Smuggling)

A Base64 只影响人类阅读
B 应通过统一规范化、解码与 Unicode 归一化让过滤器与模型看到一致内容 ✓ 正确答案
C 编码混淆无法检测
D 不需要处理 Token smuggling
#

31. 多语言、Base64、Unicode 混淆攻击应在哪些解码与规范化阶段拦截

A 应在输入进入模型前先解码、Unicode 规范化再做过滤 ✓ 正确答案
B 应在过滤后再解码
C 拦截时机无所谓
D 只需在输出侧拦截
#

32. 红队测试的自动化,如何用对抗样本集持续评估模型安全水位?

A 用版本化对抗样本集在 CI 中自动评估,与基线对比作为发布门禁 ✓ 正确答案
B 红队只需人工做一次
C 样本集无需更新
D 评分无意义