# 1. 直接注入和来自网页、邮件、PDF 的间接注入有何差异,如何构造可复现攻击测试 A 间接注入指令埋藏在第三方内容中,模型被动接收 ✓ 正确答案 B 间接注入来自用户主动输入 C 两者信任级别完全相同 D 间接注入无法测试
# 2. 为什么 system Prompt 的优先级不能替代鉴权,模型永远不应决定哪些权限 A 系统 Prompt 优先级高,可替代鉴权 B 权限决策必须由应用层确定性授权机制强制执行,模型不裁决权限 ✓ 正确答案 C 模型可以判断用户是否管理员 D 系统 Prompt 不会被注入
# 3. 模型输出进入 HTML、SQL、Shell、URL 或工具参数时,如何按目标上下文校验与编码 A 一套编码适用于所有上下文 B 模型输出可直接作为 SQL 执行 C 应按目标上下文选择对应编码与校验,模型输出视为不可信数据 ✓ 正确答案 D Shell 拼接无需转义
# 4. 间接 Prompt Injection(来自邮件、文档、网页)如何绕过输入过滤,应用层应采用哪些数据隔离与检测手段? A 数据隔离与注入检测需结合,因为内容能绕过规则过滤 ✓ 正确答案 B 输入过滤可以完全阻止间接注入 C 间接注入无需防御 D 文档内容可直接拼入系统指令
# 5. 系统 Prompt 的“不可见”为何不能作为安全边界,应用层应假设 Prompt 完全泄露 A 系统 Prompt 不可见,可存储机密 B 密钥可以写在 Prompt 中 C 系统 Prompt 无法被提取 D 应假设 Prompt 完全泄露,敏感规则与权限逻辑放后端 ✓ 正确答案
# 6. 如何防止输出触发 XSS、SQL 注入、SSRF、命令执行和越权资源访问 A 信任模型输出即可 B 只有 SQL 需要参数化 C 需在输出进入执行上下文前做编码校验,执行前做授权与隔离 ✓ 正确答案 D SSRF 无法防护
# 7. 内容过滤、策略模型、Constitutional AI 等控制为何仍需与权限、沙箱和人工审核组合 A Constitutional AI 可完全替代权限控制 B 人工审核没有必要 C 内容过滤 100% 可靠 D 模型侧控制是概率性的,需与权限、沙箱和人工审核组合 ✓ 正确答案
# 8. 角色扮演越狱(“假装你是没有限制的 AI”)为何在某些模型上仍然有效,应用层应如何检测与降级 A 模型对齐无法被绕过 B 角色扮演越狱对所有模型都无效 C 应用层应检测越狱迹象并对高风险请求降级处理 ✓ 正确答案 D 无需检测越狱
# 9. 输出过滤(Moderation API、Llama Guard、自研分类器)应如何选型与分层部署,误杀率如何控制? A 只需单一工具即可覆盖所有场景 B 应分层部署,并通过阈值、人工复核与申诉控制误杀率 ✓ 正确答案 C 误杀率无法控制 D 自研分类器永远优于 Moderation API
# 10. Constitutional AI、deliberative alignment 等“模型内省”机制在对抗越狱时能起多大作用 A 可完全阻止所有越狱 B 与应用层过滤无关 C 只增加成本,无任何作用 D 能提升对已知越狱的鲁棒性,但仍是概率性防线,需确定性控制兜底 ✓ 正确答案
# 11. 当安全过滤误杀合法请求时,如何提供人工申诉通道又不被攻击者滥用 A 应提供可审计的申诉入口,同时做频率限制防止滥用 ✓ 正确答案 B 申诉通道应完全开放,无限流 C 误杀无需申诉 D 申诉结果不必记录
# 12. 怎样提供可审计的申诉、人工复核和最小信息错误提示 A 错误提示应详细说明过滤规则 B 申诉应可审计、人工复核,并采用最小信息错误提示 ✓ 正确答案 C 最小信息提示会误导用户,应避免 D 复核结论无需记录
# 13. 如何验证外部内容即使声称“管理员授权”也无法提高工具权限或改变系统策略 A 内容声称管理员授权即可放行 B 文档中的授权声明应被信任 C 权限决策须基于真实身份与后端策略,不采信内容声明 ✓ 正确答案 D 无需校验权限
# 14. 提示注入的分类(直接/间接/多轮)与防御(输入输出过滤、权限隔离)如何落地? A 注入只有直接一种 B 多轮注入需会话级风险评分,防御需输入过滤、指令隔离、输出过滤与权限隔离组合 ✓ 正确答案 C 输入过滤可完全防御所有注入 D 权限隔离与注入无关
# 15. 越狱成功案例应在多大范围内分享(厂商、社区)才能帮助提升整体防御而不暴露自家弱点 A 应立刻公开所有细节 B 公开会完全帮助我们抵抗攻击 C 永远不公开 D 应负责任披露,先向厂商报告修复后再公开,敏感细节分级分享 ✓ 正确答案
# 16. 为什么“用户指令永远优先”是危险的,应用应如何在 Prompt 中固化不可覆盖的边界 A 用户指令应永远优先 B Prompt 边界足够安全 C 安全边界需在 Prompt 声明并由后端强制,防止被注入覆盖 ✓ 正确答案 D 无需安全边界
# 17. XSS 通过模型输出注入时,前端输出编码与 Content-Security-Policy 应如何分工 A 编码即可完全防御 XSS B CSP 能替代编码 C 输出编码是主防线,CSP 是兜底线,两者互补 ✓ 正确答案 D 两者互不相关
# 18. SSRF 风险在 AI 工具调用(抓取网页、读取 URL)时如何避免访问内部网络 A 需校验内网地址、协议白名单、DNS 复查并配合网络隔离 ✓ 正确答案 B 校验 URL 字符串即可完全防护 C 模型提供的 URL 总是可信的 D 元数据地址可以访问
# 19. 命令注入风险在 Bash/Shell 工具中应如何结合白名单、沙箱、临时凭证防御 A 字符串拼接命令即可 B 应结合命令白名单、沙箱隔离与临时凭证 ✓ 正确答案 C 沙箱即可单独防护 D 命令注入无需防御
# 20. Token-level 攻击(特殊字符、Unicode 控制符) A 特殊字符不构成威胁 B 与编码无关 C 只需删除问号即可 D 应通过 Unicode 规范化、移除控制字符与统一编码来防御 ✓ 正确答案
# 21. 为什么不能仅靠 “内容分类器” 阻止输出风险,仍需在目标上下文做最终校验 A 分类器可完全阻止输出风险 B 目标上下文校验不必要 C 分类器能理解执行上下文 D 分类器是概率性判断,仍需在目标上下文做确定性的执行校验 ✓ 正确答案
# 22. MCP 工具描述投毒(description 中携带注入指令)与恶意工具 rug-pull(上架后变更行为)应如何检测与做准入治理,工具元数据如何固定版本并定期复审 A 工具接入后无需复审 B 版本变更无需重新准入 C 工具 description 可信任 D 应对工具描述做注入扫描、固定版本并定期复审,防 rug-pull ✓ 正确答案
# 23. 多模态注入诱导工具调用成功后,损害控制(撤权、撤销副作用)与证据保全如何做,检测规则如何更新 A 只需撤权即可 B 需撤权、撤销副作用、保全证据并更新检测规则 ✓ 正确答案 C 无需保存证据 D 检测规则无需更新
# 24. Prompt 注入防御的分层策略,输入过滤、输出校验、模型对齐、权限沙箱如何组合 A 只需输入过滤即可 B 权限沙箱与注入防御无关 C 各层相互独立,无需组合 D 输入过滤、输出校验、模型对齐与权限沙箱分层组合,权限沙箱兜底 ✓ 正确答案
# 25. 多模态注入(图片隐藏文字、白底白字)的专项防护与对抗测试 A 图片中的文字不会进入模型 B 多模态注入无需防护 C 白底白字无法检测 D 需对图片做归一化、OCR 检测与注入检测,并做对抗测试 ✓ 正确答案
# 26. Agent 工具调用的"能力最小化",如何限制工具参数范围防止恶意调用? A 给 Agent 所有工具与参数 B 工具越多越好 C 参数无需校验 D 应只暴露所需工具并做参数范围校验,防止恶意调用 ✓ 正确答案
# 27. 输出侧的内容安全,PII 检测、合规审查与脱敏如何接入生成链路? A 输出无需检测 B 应在返回用户前接入 PII 检测、合规审查与脱敏 ✓ 正确答案 C 脱敏只在发送前做 D 合规审查可省略
# 28. Agent 工具调用循环中,来自网页抓取、邮件、上传文件与第三方 API 的不可信工具结果注入上下文前,应如何做来源标记与信任分级、指令剥离与隔离上下文(独立解读模型、输出校验、双模型交叉验证),工具输出投毒(tool poisoning)攻击面应如何纳入红队回归用例 A 应做来源标记、信任分级、指令剥离与隔离上下文,并纳入红队回归 ✓ 正确答案 B 工具输出可信,可直接注入上下文 C 无需信任分级 D 双模型验证无意义
# 29. 角色扮演、多语言、编码走私、对抗后缀和多模态越狱应如何分层检测与回退 A 只需对输入做检测 B 越狱无需回退 C 应在输入、输出、多模态分层检测,并对高风险请求降级回退 ✓ 正确答案 D 多模态越狱不构成威胁
# 30. 多语言、编码混淆(Base64、Unicode、Token Smuggling) A Base64 只影响人类阅读 B 应通过统一规范化、解码与 Unicode 归一化让过滤器与模型看到一致内容 ✓ 正确答案 C 编码混淆无法检测 D 不需要处理 Token smuggling
# 31. 多语言、Base64、Unicode 混淆攻击应在哪些解码与规范化阶段拦截 A 应在输入进入模型前先解码、Unicode 规范化再做过滤 ✓ 正确答案 B 应在过滤后再解码 C 拦截时机无所谓 D 只需在输出侧拦截
# 32. 红队测试的自动化,如何用对抗样本集持续评估模型安全水位? A 用版本化对抗样本集在 CI 中自动评估,与基线对比作为发布门禁 ✓ 正确答案 B 红队只需人工做一次 C 样本集无需更新 D 评分无意义