Prompt 安全与模型安全

共 20 题
📑 题目列表 20 题
#
★★★

1. Prompt Injection(直接、间接)的工程防御应如何分层落地,输入检测、指令与数据分离、工具权限隔离与输出校验的组合

Prompt Injection(直接、间接)的工程防御应如何分层落地:输入检测、指令与数据分离、工具权限隔离与输出校验应如何组合?

  • 各层防御的定位
  • 分层组合
  • 纵深防御

分层落地:输入检测(检测并拦截注入,规范化输入);指令与数据分离(把用户输入、文档、工具结果与系统指令分离,限制其影响);工具权限隔离(模型只获最小权限,工具调用受限);输出校验(对生成内容检测,防止越狱/泄露)。各层互补:输入检测降低触发,指令分离防止内容影响指令,权限隔离限制影响,输出校验兜底。形成纵深防御。

任何单层不可靠,组合防御才有效。关键在"内容与控制分离、权限最小化、输出再校验"。

#
★★★

2. System Prompt 泄露与提取攻击应如何防御,指令与数据分离、敏感规则不进 Prompt、泄露探测与告警如何组合

System Prompt 泄露与提取攻击应如何防御:指令与数据分离、敏感规则不进 Prompt、泄露探测与告警如何组合?

  • 指令与数据分离
  • 敏感规则不进 Prompt
  • 泄露探测与告警

防御 System Prompt 泄露:指令与数据分离(系统指令与用户/文档内容分层,降低内容诱导泄露);敏感规则不进 Prompt(密钥、内部接口、权限逻辑移出 Prompt,放后端);泄露探测(用测试注入检测模型是否泄露 Prompt,纳入回归);告警(检测到疑似泄露即告警并修复)。组合使 Prompt 即使泄露也不含高价值机密,且能及时发现泄露。

关键是"Prompt 里不放机密" + "主动探测泄露"。做到泄露但无机密,且可检测、可告警。

#
★★★

3. OWASP GenAI Top 10(LLM01-LLM10)作为威胁清单,在应用安全评审、测试用例设计与上线门禁中的工程价值是什么

OWASP GenAI Top 10(LLM01-LLM10)作为威胁清单,在应用安全评审、测试用例设计与上线门禁中的工程价值是什么?

  • 威胁清单的价值
  • 评审与测试设计
  • 上线门禁

OWASP GenAI Top 10 作为结构化威胁清单,工程价值:安全评审时逐项核对应用是否覆盖十类风险;测试用例设计时按清单生成对应的注入、泄露、越权等测试项;上线门禁时把清单项作为检查项,未覆盖或未通过不允许上线。它把"AI 安全"从模糊概念转化为可评审、可测试、可验收的清单,提升工程落地性。

清单的价值是"结构化、可操作、可验收"。它驱动评审、测试与门禁,使安全要求可执行。

#
★★★

4. 针对模型 API 的对抗攻击(越狱、注入与扰动变体)在红队测试中的工程价值是什么,应用层应如何自动化复现与评估

针对模型 API 的对抗攻击(越狱、注入与扰动变体)在红队测试中的工程价值是什么?应用层应如何自动化复现与评估?

  • 对抗攻击的工程价值
  • 自动化复现
  • 评估

对抗攻击(越狱、注入、扰动变体)红队测试的价值:验证模型与应用对已知攻击的防御水平,发现薄弱点,量化安全水位。自动化复现:用红队工具(garak、PyRIT、Promptfoo)批量运行对抗样本,在 CI 中每次模型/提示词变更时执行;评估:用攻击成功率、泄露检出率等指标与基线对比,作为发布门禁,并持续扩充攻击集覆盖新变体。

对抗攻击测试把"安全评估"变成自动化工程。自动化复现 + 量化评估 + 门禁,形成持续安全验证。

#
★★★

5. RAG 知识库投毒(恶意文档注入错误事实诱导输出)的工程防御,来源校验、内容审核与检索侧拦截如何组合?

RAG 知识库投毒(恶意文档注入错误事实诱导输出)的工程防御:来源校验、内容审核与检索侧拦截如何组合?

  • 来源校验
  • 内容审核
  • 检索侧拦截

防御知识库投毒:来源校验(只接受可信来源的文档,校验上传者与来源);内容审核(对入库文档做内容扫描,检测注入指令、错误事实与恶意内容);检索侧拦截(检索时对高风险文档降权/拦截、对检索结果做信任分级与校验)。组合覆盖"入库前、检索时"两个阶段,防止恶意文档进入知识库并诱导输出。

投毒是"内容污染 + 输出误导"。来源校验管入库、内容审核管内容、检索拦截管网后的影响,三阶段组合。

#
★★★

6. 成员推断式隐私探测(通过查询试探知识库是否包含某文档)应如何通过访问审计、结果扰动与检索限制缓解?

成员推断式隐私探测(通过查询试探知识库是否包含某文档)应如何通过访问审计、结果扰动与检索限制缓解?

  • 成员推断探测
  • 结果扰动
  • 检索限制与审计

成员推断探测通过查询观察检索/输出差异,判断某文档是否在库中。缓解:访问审计(记录并分析可疑的高频/定向查询,检测探测行为);结果扰动(对相似度得分、输出加噪声,降低可区分性);检索限制(限制返回条数、敏感文档检索、对敏感度高的查询告警);对疑似探测的会话降权或阻断。组合降低攻击者确认成员关系的能力。

成员推断是"存在性泄露"。缓解思路是降低输出可区分性 + 审计检测 + 限制敏感性,使探测难以成功。

#
★★★

7. 输入侧数据防泄漏,用户与文档把密钥、PII、内部代码喂给外部模型时,如何检测、阻断或脱敏而不破坏功能?

输入侧数据防泄漏:用户与文档把密钥、PII、内部代码喂给外部模型时,如何检测、阻断或脱敏而不破坏功能?

  • 输入侧检测
  • 阻断与脱敏
  • 功能保持

输入侧防泄漏:用检测器(正则、NER、模式匹配)识别密钥、PII、内部代码等敏感内容;对高风险内容阻断(拒绝发送)或脱敏(替换为占位符再发送);脱敏需保留语义占位符,使模型仍能理解上下文而不破坏功能;对确需处理内部代码的场景提供白名单或专门通道。通过风险分级决定"阻断还是脱敏",并配合审计。

防泄漏与功能是权衡。检测识别、按风险分级决定阻断或语义化脱敏,保证功能可用且不泄露。

#
★★

8. 模型服务被批量抓取与蒸馏(API 蒸馏攻击)时,应用应如何通过限速、输出扰动、日志审计与服务条款约束保护商业模型权益

模型服务被批量抓取与蒸馏(API 蒸馏攻击)时,应用应如何通过限速、输出扰动、日志审计与服务条款约束保护商业模型权益?

  • 蒸馏攻击
  • 限速与扰动
  • 审计与条款

抵御 API 蒸馏:限速(对单用户/IP/会话限制调用频率与数量,抑制批量抓取);输出扰动(对输出做轻微扰动或截断,降低蒸馏质量,但需权衡对正常用户的影响);日志审计(识别异常高频率、高度相似的调用模式,标记可疑蒸馏);服务条款(通过 ToS 明确禁止批量抓取与蒸馏,提供法律依据)。组合减少蒸馏收益并保留证据。

蒸馏攻击威胁商业模型权益。技术控制(限速、扰动)+ 检测(审计)+ 法律(条款)多层应对。

#
★★

9. Jailbreak(角色扮演、多语言、Base64 编码、Many-Shot 等)在应用层的工程防御,输入规范化、风险分类器与输出护栏如何组合

Jailbreak(角色扮演、多语言、Base64 编码、Many-Shot 等)在应用层的工程防御:输入规范化、风险分类器与输出护栏如何组合?

  • 输入规范化
  • 风险分类器
  • 输出护栏

防御 Jailbreak:输入规范化(Unicode 归一化、解码 Base64、移除控制字符、统一多语言与编码,消除隐蔽);风险分类器(检测越狱意图,如角色扮演、Many-Shot、对抗后缀);输出护栏(对输出做检测,拦截越狱导致的违规内容)。组合:规范化让混淆无效,分类器识别越狱意图,输出护栏兜底越狱输出。三者覆盖"输入-意图-输出"。

越狱是"输入混淆 + 意图诱导 + 输出违规"。规范化、分类器、输出护栏分别对应三个环节,组合防御。

#
★★

10. Prompt 沙箱与输出过滤(NeMo Guardrails、Guardrails AI、Rebuff 等)应如何接入调用链,误杀率与绕过率如何权衡

Prompt 沙箱与输出过滤(NeMo Guardrails、Guardrails AI、Rebuff 等)应如何接入调用链,误杀率与绕过率如何权衡?

  • 护栏工具接入
  • 误杀率
  • 绕过率权衡

护栏工具(NeMo Guardrails、Guardrails AI、Rebuff)接入调用链:在模型调用前(输入护栏)与调用后(输出护栏)接入,配置规则/分类器。误杀率与绕过率权衡:提高阈值降低绕过但增加误杀(误伤合法请求),降低阈值减少误杀但增加绕过。优化:分层阈值、人工复核边界情形、用反馈数据调优、对敏感内容降级而非直接拒绝。找到业务可接受的平衡点。

误杀与绕过是"安全-可用"权衡。需分层、可调、可反馈地平衡,而非单点固定阈值。

#
★★

11. 托管 LLM 防火墙(Azure AI Content Safety、AWS Bedrock Guardrails 等)与自建护栏应如何选型并联调,命中率与延迟代价如何衡量

托管 LLM 防火墙(Azure AI Content Safety、AWS Bedrock Guardrails 等)与自建护栏应如何选型并联调,命中率与延迟代价如何衡量?

  • 托管 vs 自建选型
  • 联调
  • 命中率与延迟权衡

选型:托管防火墙(Azure、AWS)开箱即用、覆盖广、维护成本低,适合快速接入;自建护栏灵活可控、可定制、数据不出域,适合特定需求。联调:可组合使用(托管做基线过滤 + 自建做领域定制),用统一接口接入。命中率与延迟代价:用基准测试评估命中率(检出率)与延迟(每个请求增加的耗时),权衡安全覆盖与用户体验,必要时分层(快速预筛 + 精确判定)。

选型要看覆盖、成本、可控与延迟。联调需评估命中率与延迟代价,分层部署平衡。

#
★★

12. OpenAI Moderation API、Hive、Clarifai 等内容审核服务在色情、暴力与敏感内容过滤上的能力差异如何评估与组合

OpenAI Moderation API、Hive、Clarifai 等内容审核服务在色情、暴力与敏感内容过滤上的能力差异如何评估与组合?

  • 各服务能力
  • 评估方法
  • 组合策略

各内容审核服务在类别覆盖、精度、成本、延迟与多模态支持上不同:OpenAI Moderation 覆盖文本/图像的多类内容;Hive 偏多模态与具体场景;Clarifai 提供自定义分类。评估:用基准数据集测试各服务在色情、暴力、敏感内容上的检出率、误报率与延迟。组合:可叠加多个服务(多模型投票/逐级过滤)提升覆盖,或按内容类型路由到最擅长服务,控制成本与误杀。

内容审核服务各有所长,能力差异需基准评估。组合策略(叠加/路由)可提升覆盖并平衡成本。

#
★★

13. 第三方 MCP Server 与开源工具中的恶意后门(隐藏指令、数据外传)应如何通过代码审计、SBOM 与沙箱运行检测?

第三方 MCP Server 与开源工具中的恶意后门(隐藏指令、数据外传)应如何通过代码审计、SBOM 与沙箱运行检测?

  • 代码审计
  • SBOM
  • 沙箱运行

检测第三方后门:代码审计(人工/静态扫描审查源码,寻找隐藏指令、可疑外传、混淆代码);SBOM(记录依赖与来源,识别未知/可疑组件);沙箱运行(在隔离环境运行,监控网络外传、文件访问、进程行为,检测数据外传迹象)。准入治理:报告后门即拦截,未通过审计不接入。组合覆盖"静态审查、成分分析、动态行为"。

后门检测需"静态 + 成分 + 动态"三维。代码审计看源码、SBOM 看来源、沙箱看行为。

#
★★

14. 跨轮次提示注入,攻击者在多轮对话中分段植入指令(单条消息无害、整体恶意)的检测与防御(会话级风险评分)?

跨轮次提示注入:攻击者在多轮对话中分段植入指令(单条消息无害、整体恶意)的检测与防御(会话级风险评分)应如何设计?

  • 跨轮次注入的原理
  • 会话级风险评分
  • 检测与防御

跨轮次注入通过多轮对话分段植入指令,单条消息看似无害、整体构成恶意。检测与防御:会话级风险评分——对每条消息做单条风险评分,并累积到会话级风险分数,当累积分数超过阈值时判定为跨轮次注入;结合上下文回溯分析(组合多轮内容判断整体意图);对高风险会话降级、限制工具权限或终止。需在会话状态中维护风险评分与上下文。

单条消息检测会漏掉跨轮次注入。会话级风险评分把"累积意图"纳入检测,是这类攻击的关键。

#
★★

15. 输出侧数据防泄漏,模型回答中泄露的密钥、PII 与内部信息如何实时检测与脱敏?

输出侧数据防泄漏:模型回答中泄露的密钥、PII 与内部信息应如何实时检测与脱敏?

  • 输出检测
  • 实时脱敏
  • 阻断

输出侧防泄漏:在模型输出返回用户前,用检测器(正则、NER、模式匹配)实时识别密钥、PII、内部信息;对识别出的内容做脱敏(掩码、替换、截断)或阻断(不放行敏感输出);对高敏内容触发告警并记录。脱敏保障用户可用,阻断防止泄露,审计用于追溯。检测需配置白名单避免误杀。

输出侧是"泄露离开"的最后关口。实时检测 + 脱敏/阻断 + 告警,兼顾防泄露与可用性。

#
★★

16. 信任域分级,RAG 文档、工具返回与用户输入按信任级别标记,跨域内容按更高注入风险处理?

信任域分级:RAG 文档、工具返回与用户输入按信任级别标记,跨域内容按更高注入风险处理应如何设计?

  • 信任域分级
  • 来源标记
  • 跨域处理

信任域分级:把输入按来源分为信任级别(系统指令最高、用户输入次之、RAG 文档/工具返回/第三方内容更低),对每类内容打信任标记;跨域内容(低信任内容进入高信任上下文)按更高注入风险处理,即对低信任内容做更严格的隔离、指令剥离与校验。分级使系统能差异化处理不同来源的注入风险。

信任分级是"来源决定风险"的模型。低信任内容进入高信任上下文时风险更高,需更严格处理。

#

17. AIGC 内容水印与生成检测(显式标识、SynthID、C2PA)的工程落地,如何在不损失输出质量的前提下实现可溯源?

AIGC 内容水印与生成检测(显式标识、SynthID、C2PA)的工程落地:如何在不损失输出质量的前提下实现可溯源?

  • 水印与标识
  • 可溯源
  • 质量保持

工程落地:显式标识加在展示层(不改变内容质量);隐式元数据(C2PA)写入文件元数据(不影响内容);SynthID 在模型输出层嵌入不可见水印(对感知质量影响极小)。通过分层:显式标识转前端、元数据进存储、水印进输出,实现可溯源而几乎不损失输出质量。检测工具验证水印的持久性与可检测性。

可溯源与质量可兼得:把标识分流到不同层(展示、元数据、嵌入水印),避免集中破坏内容。

#

18. 模型供应商与 API 供应链安全,如何核验模型卡、备案状态与数据使用条款,防止第三方模型引入合规与安全风险?

模型供应商与 API 供应链安全:如何核验模型卡、备案状态与数据使用条款,防止第三方模型引入合规与安全风险?

  • 模型卡核验
  • 备案状态
  • 数据使用条款

核验第三方模型:模型卡(能力、局限、训练数据、安全评估);备案状态(按当地法规要求核验是否已备案/合规);数据使用条款(数据处理、驻留、传输、是否用于训练,是否合规)。选型时综合评估,防止引入未备案、数据条款不明确或使用不安全的模型;对接入后持续监控条款变更与合规状态。

第三方模型是供应链风险源。核验模型卡、备案与数据条款,确保选型合规、风险可控。

#

19. 防御纵深层次,输入过滤、指令分层、输出校验与人工审核如何分层部署,各自的失效模式与互补关系?

防御纵深层次:输入过滤、指令分层、输出校验与人工审核如何分层部署,各自的失效模式与互补关系?

  • 各层定位
  • 失效模式
  • 互补关系

分层部署:输入过滤(拦截注入)、指令分层(内容与指令分离)、输出校验(检测输出)、人工审核(兜底高风险)。各自失效模式:输入过滤被绕过(混淆/编码)、指令分层失效(内容影响指令)、输出校验漏检(新型攻击)、人工审核滞后(成本高、延迟)。互补:前层降低触发概率,后层限制/兜底影响,单层失效由其他层弥补,形成纵深。

纵深防御要求"任一层失效不致命"。理解各层失效模式才能设计互补,人工审核是最后兜底。

#

20. 编码规范化,同形字、零宽字符与 Unicode 混淆在输入分类前的归一化处理,如何控制误伤与绕过率?

编码规范化:同形字、零宽字符与 Unicode 混淆在输入分类前的归一化处理,如何控制误伤与绕过率?

  • 归一化处理
  • 误伤控制
  • 绕过控制

输入分类前做 Unicode 规范化(NFKC 归一化、映射同形字、移除零宽字符与控制字符),使混淆内容被还原,降低绕过率。控制误伤:规范化需保留合法字符的语义(如多语言文本、专有名词),配置白名单避免破坏合法内容;通过测试平衡"归一化强度"与"误伤率",对边界情形做灰度或放宽。用基准测试衡量绕过率与误伤率。

归一化降低绕过但可能误伤。关键在强度与白名单配置,用测试平衡绕过率与误伤率。