文生图与图像编辑管线

共 19 题
📑 题目列表 19 题
#
★★★

1. 文生图 API 接入的关键环节,提示词、负面提示词、采样步数、分辨率与种子如何配置?

文生图 API 接入时,提示词、负面提示词、采样步数、分辨率与种子等关键参数应如何配置?

  • 各参数对生成质量与成本的影响
  • 负面提示词与采样步数的工程取舍
  • 种子在可复现与多样性之间的作用

文生图接入的核心是构造"提示词-参数"组合。提示词应结构化描述主体、风格、光照、构图与画质锚点,负面提示词用于排除低质量或违规元素(如畸形手指、水印、模糊)。采样步数(steps)直接影响质量与延迟,一般 20-40 步即可达到收敛,过高步数收益递减且成本上升;分辨率决定细节与成本,需按模型底座(如 SD1.5 的 512 与 SDXL/Flux 的 1024)选择,过高或过低会引发构图异常。种子(seed)决定噪声初始值,固定种子可复现结果,用于回归测试与微调,随机种子用于多样性。工程上建议把参数封装成可配置模板,按场景预设几套"步数-分辨率-引导系数"组合,并在服务端做参数校验与超时控制。

这些参数并非独立,而是相互耦合:步数与 CFG 共同影响质量,分辨率与显存/成本强相关。接入时应先做参数扫描确定基线,再以种子作为可复现性锚点,负面提示词作为稳定性兜底,这是控制成本与质量平衡的关键。

#
★★★

2. ControlNet、LoRA、IP-Adapter 在图像可控生成中分别控制什么,如何组合?

ControlNet、LoRA、IP-Adapter 在图像可控生成中分别控制什么维度,如何组合使用?

  • 三种技术的控制对象与作用机制
  • 组合使用时的权重与冲突处理
  • 适用场景区分

ControlNet 通过额外条件(深度图、边缘线、姿势、Canny 等)控制"构图与结构",解决"如何布局"的问题;LoRA 通过低秩微调改变模型权重,控制"风格与主体身份",解决"画成什么样"的问题;IP-Adapter 通过图像特征注入控制"参考图像的内容与语义",解决"像哪张参考图"的问题。三者可组合:先用 ControlNet 锁定构图,再用 IP-Adapter 注入参考风格,最后用 LoRA 强化品牌风格。组合时需注意各条件权重(ControlNet weight、IP-Adapter scale、LoRA strength)不宜同时拉满,否则会互相抢占导致构图撕裂或风格过载,工程上应做权重网格扫描以确定最佳组合。

三者控制层次不同(结构/风格/参考),本质互补。组合的核心是"分层控制、权重平衡",避免多条件相互干扰,是复杂可控生成的标准工程手段。

#
★★★

3. 跨图一致性,同一角色或风格在多张图间保持一致(参考图、LoRA、种子控制)的工程手段与失效场景?

生成多张图时如何保证同一角色或风格的一致性,参考图、LoRA、种子控制等工程手段有哪些,失效场景是什么?

  • 一致性控制手段的分类
  • 各种手段的失效场景
  • 工程上的兜底策略

跨图一致性手段按控制强度排序:IP-Adapter 参考图可保留角色外观与风格,LoRA 可固化角色身份与画风,固定种子配合相同提示词可稳定构图,ControlNet 可锁定姿态与布局。失效场景包括:参考图分辨率过低或角色姿态差异大导致特征漂移;角色着装变化、多角度复杂光照下 LoRA 过拟合而僵化;固定种子在更换提示词或分辨率后不再保证一致性;复杂场景下 IP-Adapter 混入参考图噪声。工程上建议先抽取角色面部特征(如用 embedding 或参考 LoRA)再统一生成,配合"首帧锚定+后续帧对齐"的编辑流程,并对输出做一致性自动检查(如人脸相似度、色调直方图)后再放行。

一致性是生成应用的核心难点,靠单一手段可靠性有限,工程上通常以"参考图+LoRA 双保险"为基础,辅以自动一致性校验与重试,是降低失效损害的务实做法。

#
★★★

4. 崩图检测与重试,畸形、文字乱码等失败模式如何自动识别并触发重试或降级?

生成图像出现畸形、文字乱码等失败模式时,如何自动识别并触发重试或降级?

  • 常见失败模式的特征
  • 自动检测方法(规则/模型)
  • 重试与降级策略

常见失败模式包括肢体畸形、人脸扭曲、文字乱码、模糊、水印残留等。自动检测可采用多层手段:轻量规则(颜色直方图异常、边缘过度、模糊度、黑边比例)做快速过滤;训练或调用专用质量判定模型(如分类器、美学 scorer)做深度打分;用 VLM 做语义级检查("图中是否有畸形手指/乱码文字")。识别出失败后按策略处理:先固定 seed 更换参数重试有限次,仍失败则降级到更稳健的模型或降低分辨率,或直接返回人工兜底。工程上需为检测与重试设置超时与预算上限,避免无限重试拖垮成本。

崩图检测本质是"质量识别+成本控制"的闭环。规则层廉价但粗糙,模型层准确但耗时,需分级组合;重试要有预算与终止条件,这是生产级生成服务的标配。

#
★★

5. 文生图的"提示词-图像"对齐质量如何评估(CLIP 分数/人工评分/美学指标)?

文生图的"提示词-图像"对齐质量应如何评估,CLIP 分数、人工评分、美学指标分别如何应用?

  • CLIP 分数的含义与局限
  • 人评与自动指标的分工
  • 美学指标与语义对齐的区分

对齐质量评估分两层:语义对齐(图是否表达了提示词)与美学质量(图是否好看)。CLIP score 通过图文嵌入余弦相似度衡量语义对齐,速度快但只反映相关度而非准确性,且对复杂/负向描述不敏感;美学指标(如 LAION aesthetics scorer、NIQE 等)衡量画面质量。人工评分(如 A/B 对比、1-5 分或 pairwise)最贴合用户感受但成本高、有主观噪声。工程上采用"自动粗筛+人工精评":先用 CLIP/美学指标批量过滤,再对候选集做人工 A/B 或 Elo 评估,并建立与业务指标(如点击率、转化率)的关联验证。

单一指标都不完备,CLIP 测语义、美学测画面、人工测体验,三者互补。将自动指标作为低成本批量筛选、人工作为高价值最终裁决,是评测"提示词-图像"对齐的标准分层。

#
★★

6. 图像生成服务的成本与延迟优化,步数压缩、缓存与并发推理如何取舍?

图像生成服务如何优化成本与延迟,步数压缩、缓存与并发推理如何取舍?

  • 步数压缩与蒸馏模型
  • 结果缓存与相似请求复用
  • 并发与批处理

成本与延迟优化可从三层入手。模型层:压缩采样步数(如采用蒸馏/一致性模型,用更少步数达到同等质量)、使用量化(FP16/INT8)与低显存推理;缓存层:对相同提示词+参数+种子的请求做结果缓存,对有相似内容的请求做语义近似复用,避免重复计算;并发层:对同一模型的多请求做动态批处理(continuous batching)提升吞吐,用队列削峰。取舍在于:步数压缩牺牲少量质量换速度,缓存提升命中率但需管理失效与成本归属,并发提升吞吐但增加显存与排队延迟,需按业务对延迟与质量的敏感度权衡。

图像生成是计算密集型,三项优化分别作用于"单次计算、重复计算、并发计算"。工程上应先明确质量与延迟的 SLA,再决定步数压缩幅度与缓存策略,避免盲目压缩损伤质量。

#
★★

7. 图像生成的内容安全,色情/暴力/版权风格如何做输入输出双重过滤?

图像生成的内容安全如何设计,色情、暴力、版权风格如何做输入输出双重过滤?

  • 输入提示词过滤
  • 输出图像检测
  • 版权风格控制

内容安全需输入输出双重把关。输入侧对提示词做关键词与语义分类过滤(规避 NSFW、暴力、违法指令),并阻断"模仿指定在世艺术家/品牌 LOGO"的请求;输出侧对生成图像做独立检测:NSFW 分类器、暴力血腥检测、人脸识别与版权风格比对,命中即丢弃或打码并记录。版权风格需维护"受限风格/受保护主体"黑名单,在提示词与输出特征两个层面比对。工程上要配置漏检补偿机制(人审兜底)、大模型分类器与轻量规则分级,并留存审核日志用于合规审计。

输入过滤便宜但可被绕过,输出过滤准确但成本高,故需双重且独立的检测链。版权风格因涉及法律风险,需在输入约束与输出比对双端拦截,并保留审核证据。

#
★★

8. Diffusion 模型(SD/SDXL/Flux)的采样步数与 CFG 对生成质量/成本的影响,如何用 LoRA/ControlNet 控制风格与构图?

Diffusion 模型中采样步数与 CFG 对生成质量与成本的影响是什么,如何用 LoRA/ControlNet 控制风格与构图?

  • 步数与 CFG 的作用原理
  • 对质量与成本的影响
  • LoRA/ControlNet 的分工

采样步数决定去噪迭代次数,步数过少则图像粗糙、噪声残留,步数过多则收益递减并线性增加计算成本;CFG(guidance scale)控制对提示词的遵循程度,过高会导致过度饱和、色彩失真,过低则图像偏离提示。SD/SDXL/Flux 因模型底座不同有各自的推荐步数与 CFG 区间(如 SDXL 常用 20-40 步、CFG 5-7)。风格与构图的控制不靠堆步数,而是靠 LoRA 注入风格权重、ControlNet 锁定结构构图,这样既快又稳。工程上应针对底座做参数扫描固化默认值,避免在运行时反复调参。

步数与 CFG 是"质量-成本-遵循度"的三角平衡,而非越高越好。风格与构图交由 LoRA/ControlNet 等条件控制,是解耦"画质"与"内容"的工程手法,能显著降低采样开销。

#
★★

9. 图像编辑管线,图生图、局部重绘(Inpainting)、ControlNet 与参考图在电商/设计场景的工程组合?

在电商与设计场景中,图生图、局部重绘、ControlNet 与参考图如何组合成图像编辑管线?

  • 各编辑能力的适用场景
  • 管线组合与流程编排
  • 电商/设计场景的落地

电商与设计场景的编辑管线通常分层组合:图生图用于换背景、换风格、商品场景重绘;局部重绘(Inpainting)用于去背景、替换局部元素、消除瑕疵、改色,只改掩码区域;ControlNet 用于锁定商品轮廓与构图,保证主体不被破坏;参考图(IP-Adapter)用于注入品牌风格或参考商品。典型流程:先对商品图做主体分割得到掩码,用 ControlNet 保持轮廓,用图生图重绘背景,再用 Inpainting 精修细节,最后用参考图统一色调。工程上需把各步骤封装成编排节点,支持参数化与可回退,保证不改动商品主体。

电商图编辑的核心是"主体保真+环境可控"。单一工具无法兼顾,需按"结构控制-内容重绘-局部精修-风格统一"的流程编排,并把掩码与轮廓作为保真约束。

#
★★

10. 文生图模型的版本兼容与一致性,checkpoint/采样器/LoRA 的版本锁定、种子复现与回归测试?

文生图模型的 checkpoint、采样器、LoRA 版本如何锁定,种子复现与回归测试如何设计?

  • 版本组件锁定
  • 种子复现的机制
  • 回归测试体系

版本兼容的核心是"全组件锁定":checkpoint、采样器、调度器、LoRA 权重、CLIP 文本编码器、模型版本与推理参数都要记录 hash 并固化,任一组件变更都会导致种子不可复现。种子复现依赖确定性的采样流程(固定随机数种子、关闭随机性、固定 batch 与精度),并注意硬件差异(如不同 GPU 的浮点运算)可能引入微小差异。回归测试应建立"输入模板+种子+参数"的基准集,每次版本升级后对比输出与 golden 参照,度量差异(如像素差、CLIP 相似度),超阈值则告警,防止升级引入风格漂移。

生成模型是"多组件耦合"系统,版本漂移往往来自组件升级而非提示词变化。通过全组件锁定实现可复现,用固定基准集做回归对比,是质量稳定的工程保障。

#
★★

11. 用 VLM 充当多模态 Judge 对文生图/图生图产物做自动化评分时,指令遵循、视觉一致性、美学与安全等维度应如何拆分 rubric,VLM judge 的分辨率/位置偏差与自褒偏差应如何校准,人工抽检比例与发布回归门禁应如何设计

用 VLM 作为多模态 Judge 对文生图/图生图产物自动评分时,rubric 如何拆分维度,VLM 的分辨率、位置偏差与自褒偏差如何校准,人工抽检与发布门禁如何设计?

  • Judge 评分维度的拆分
  • VLM 偏差的来源与校准
  • 人工抽检与回归门禁

用 VLM 做 Judge 需把 rubric 拆成可独立判定的维度:指令遵循(是否含提示词主体)、视觉一致性(是否具备参考图特征)、美学质量(构图/光影/锐度)、安全(NSFW/违规元素)。每个维度给明确打分标准与示例,避免笼统评分。VLM 存在已知偏差:分辨率偏差(低分辨率输入被低估)、位置偏差(答案位置影响)、自褒偏差(对自己模型生成结果偏好)。校准手段包括:固定输入分辨率、多次采样取平均、对打分结果做 pairwise 对比而非绝对分、用独立检测器交叉验证。人工抽检按比例(如 5%-10%)做抽样复核并校准自动分,发布回归门禁则要求自动分与人工分达到阈值且无灾难性回归才可上线。

VLM Judge 解决"自动评测规模化"问题,但偏差不可忽视。通过拆分维度、校准偏差、人工抽检与门禁四层机制,把自动评分从"可用"提升到"可信"。

#
★★

12. 交互式生成,实时预览、渐进细化与用户反馈如何降低试错与返工成本?

交互式生成中,实时预览、渐进细化与用户反馈如何降低试错与返工成本?

  • 实时预览的实现
  • 渐进细化机制
  • 用户反馈闭环

交互式生成通过"低延迟反馈+多轮细化"降低试错成本。实时预览用低步数、低分辨率先出一版草图,让用户快速看到方向,确认后再高细节精修;渐进细化支持局部迭代(对某区域重绘、调整提示词、改参数种子),避免整图重来;用户反馈通过"喜欢/不喜欢、草图涂鸦、区域选择、文字修改"等信号驱动下一轮生成,形成人机协作闭环。工程上需把预览与精修拆成两阶段管线,提供可回退的版本历史,并记录用户反馈数据用于优化提示词与参数。

交互式生成的核心是把"一次性结果"变成"多轮逼近",以低成本的预览换取用户对方向的确认,减少无效返工。版本历史与反馈埋点是支撑迭代与优化的关键。

#

13. 图生图、局部重绘(Inpaint)与扩图(Outpaint)在 API 参数、掩码处理与成本上的工程差异是什么

图生图、局部重绘(Inpaint)与扩图(Outpaint)在 API 参数、掩码处理与成本上的工程差异是什么?

  • 三种操作的功能差异
  • 掩码处理方式
  • 成本差异

图生图以一张图加提示词为输入,重绘整张图,控制强度用 denoise strength;局部重绘(Inpaint)需提供掩码(mask)指定要重绘的区域,只改掩码内部,其余区域由原图约束,因此需要掩码预处理与边缘融合;扩图(Outpaint)是在原图四周扩展生成新内容,掩码是"待扩展区域",需处理与原图接缝。成本上,图生图重绘整图算力消耗大,Inpaint 通常只需重算掩码区域(但编码原图仍耗算力),Outpaint 因扩展区域可能增加输出分辨率而成本上升。工程上需统一掩码格式(如黑白 PNG)、处理边缘羽化,并按输出尺寸与掩码面积计费。

三者共享扩散推理内核,差异在掩码定义与生成范围。Inpaint 的小面积重绘成本低、Outpaint 的扩展分辨率成本高,需在 API 层明确掩码与面积参数以正确计费与优化。

#

14. 文生图的评测与安全,CLIP 分数、人工评估与 NSFW/版权过滤在生产环境的落地?

文生图的 CLIP 分数、人工评估与 NSFW/版权过滤在生产环境如何落地?

  • 自动评分的落地
  • 人工评估流程
  • 安全过滤闭环

生产环境落地需分层:自动层用 CLIP 分数做语义对齐的批量筛选与质量监控看板,配合美学指标过滤低质图;人工层对高价值或抽检样本做 A/B 与 1-5 分评估,建立与线上指标的关联;安全层对生成结果做 NSFW 分类与版权风格检测,命中即拦截,并记录审核日志。工程上需把 CLIP 分数作为"监控指标"而非"最终裁决",将人工评估与投诉回流作为安全兜底,并用阈值+人审双保险处理边界案例。

自动指标在生产中用于"批量把关与监控",人工用于"高价值裁决与安全兜底",安全过滤必须独立于生成链路。三者结合形成"评估-过滤-回流"的闭环。

#

15. 生成图像的合规,版权、肖像权、NSFW 与内容审核的检查流程与留存证据应如何设计

生成图像的版权、肖像权、NSFW 与内容审核检查流程及留存证据应如何设计?

  • 各合规维度检查流程
  • 证据留存设计
  • 审核链路

合规检查需覆盖四个维度:版权(生成内容是否模仿受版权保护作品/风格)、肖像权(是否生成真实人物肖像)、NSFW(色情暴力)、内容审核(违规违法)。检查流程按"输入约束+输出检测+人工复核"分层:输入侧拦截违规提示词与授权缺失的肖像/风格请求,输出侧用分类器与模型比对检测,边界案例转人工。证据留存需记录请求上下文、提示词、模型参数、检测结果、审核人、时间戳与哈希,形成可追溯的审计链,满足合规审计与争议举证。工程上证据需不可篡改留存并设置保留期限。

合规的核心是"可追溯、可举证"。仅做检测不够,必须留存完整证据链,且检测需覆盖输入、输出、人工三层,才能应对监管审查与法律争议。

#

16. 图像生成的成本核算,按张计费、失败重试与批量折扣应如何纳入单张成本模型

图像生成的成本核算中,按张计费、失败重试与批量折扣应如何纳入单张成本模型?

  • 单张成本构成
  • 失败重试成本
  • 批量折扣核算

单张成本模型需计入直接与间接成本:直接成本是每张的推理算力(按分辨率、步数、模型)与调用费;失败重试会放大成本,需把"有效产出率"(成功张数/总调用张数)纳入模型,即单张有效成本 = 单张成本 / 成功率;批量折扣通过批量调用、缓存复用、动态批处理摊薄单位成本。工程上应建立成本看板,按成功产出统计真实单张成本,以便定价与预算,并针对失败率高的提示词做优化或拒绝。批量折扣需核算是否真能摊薄,而非简单降价。

成本核算必须基于"有效产出"而非"调用次数",否则失败重试会侵蚀利润。将成功率、批量折扣纳入模型,才能准确反映单张真实成本并指导定价。

#

17. 图像的批量生成与异步任务,队列与回调?

图像的批量生成与异步任务如何设计,队列与回调如何实现?

  • 异步任务架构
  • 队列与并发控制
  • 回调机制

批量生成应从同步改为异步任务模式:客户端提交任务,服务端入队,工作进程消费队列并并发调用生成模型,任务完成后通过回调(webhook)或轮询通知结果。设计要点包括:任务状态机(pending/processing/succeeded/failed)、带优先级与超时的队列、并发与排队控制(避免打爆后端)、失败重试与幂等(结果缓存)、以及进度上报。回调需保证可靠投递(重试、签名鉴权、超时),并支持任务取消与结果查询。批量场景还需支持并发批量与限流,避免资源耗尽。

图像生成耗时长,同步阻塞不现实。异步队列解耦提交与执行,回调实现事件驱动通知,配合状态机与重试保证可靠性与可观测性,是批量生成的标准架构。

#

18. 生成图像的水印与溯源,C2PA、隐形水印在合规场景的落地与检测?

生成图像的水印与溯源(C2PA、隐形水印)在合规场景如何落地与检测?

  • C2PA 溯源机制
  • 隐形水印原理
  • 落地与检测

溯源与水印有两类。C2PA 是内容来源标准,在图像元数据中嵌入可签名的"内容凭证"(谁生成、何时、用的什么模型),可追溯生成链路,但易被截图、重编码移除;隐形水印(如把不可见信号嵌入像素)在裁剪、压缩后仍可检测,用于识别是否由 AI 生成。合规落地需同时采用:生成时写入 C2PA 凭证与隐形水印,检测时对可疑内容做水印提取与来源校验。工程上需考虑水印对图像质量的影响、检测率与误报率,并配合 AIGC 标识展示。水印检测与来源凭证互为补充,缺失时辅以深度伪造检测。

C2PA 是"可信元数据"、隐形水印是"抗篡改信号",两者互补。落地需在生成端写入、检测端校验,并权衡水印强度与画质,满足 AIGC 标识与溯源合规。

#

19. 风格模仿合规,指定艺术家风格或品牌视觉的模仿边界如何判定,授权流程如何设计?

指定艺术家风格或品牌视觉的模仿边界如何判定,授权流程如何设计?

  • 模仿边界判定标准
  • 受保护主体识别
  • 授权流程

模仿边界需区分"风格"与"可识别主体":已逝世的艺术家风格、通用艺术流派通常可模仿,而在世艺术家、品牌 LOGO、知名 IP 角色、受版权保护的独特视觉受到法律保护,直接模仿有风险。判定需结合版权法与肖像权、商标权,对"清晰可识别的受保护主体"采取拦截。授权流程包括:识别受限主体→提交授权请求→获取书面授权(明确用途、期限、范围)→在生成链路中记录授权凭证→合规审核与留存证据。工程上建议维护"受限风格/主体黑名单",对含受限主体关键词的请求做强制校验。

风格模仿的合规边界是"通用风格可仿、明确主体受限"。通过黑名单拦截+授权流程+证据留存,把法律风险转化为可管理、可追溯的合规流程。