AI · 提示词 / 应用落地

AI 应用速查

从提示词框架、模型参数调优,到 RAG 检索增强、向量库选型与 Spring AI 集成,再到成本与安全兜底,AI 应用落地全流程的 66 个关键知识点一张表收齐,随查随用。

66条速查 12大板块 持续更新

📖 速查表

点击展开各小节

💬 提示词框架
名称说明要点
Role-Task-Format 最简通用的三段式骨架:先设定角色身份,再明确任务目标,最后约定输出格式,一段话也能组织出高质量提示词 角色:资深 DBA
任务:审查这条慢 SQL
格式:表格列出问题/建议 新手首选
CRISPE 五段式结构:Capacity 能力背景 → Insight 洞见 → Statement 陈述任务 → Personality 风格设定 → Experiment 多方案权衡,适合方案对比与决策类任务 以性能优化专家身份…
给出 3 种缓存方案并比较优劣 方案对比
Few-shot 少样本提示 在提示词中附 2~5 组输入输出示例,让模型模仿格式、风格与判断口径,通常比纯指令描述更稳定 好评 → 正面;差评 → 负面;…→ ?
示例越贴近真实分布效果越好 格式类任务利器
CoT 思维链 要求模型「一步一步思考」或提供含推理过程的示例,先展开中间步骤再给结论,显著提升数学、逻辑与排查类任务准确率 请一步步推理:先列条件,再分步计算,最后作答 复杂推理必备
🎛️ 模型参数
名称说明要点
temperature 控制输出随机性:值越低越稳定确定,越高越发散有创意 0~0.3 抽取/分类 · 0.7~1.0 文案创意 评测先冻结为 0
top_p 核采样:只从累计概率达到 p 的候选词中采样,与 temperature 同为发散度旋钮 与 temperature 二选一调整,避免同时大幅改动 官方建议只调其一
max_tokens 限制单次回复最大生成长度,超出即截断,同时影响计费上限 中文约 1 字 ≈ 0.6~1 token,预留余量防截断 过小会被截断
frequency_penalty 频率惩罚:按已出现次数降低该词的再选概率,抑制复读机式输出 默认 0;翻译/代码保持 0,文案可 0.3~0.6 防复读
presence_penalty 存在惩罚:只要出现过就降低概率,鼓励引入新话题与新模式 创意写作 0.2~0.5;调太高易跑题、生造词 调高易跑题
stop 停止序列:模型生成到指定字符串立即停止并返回已完成部分 ###\n\n 分隔多段输出时按段截断 结构化截断
seed 固定随机种子,让同一请求尽量复现相同输出 回归评测时固定 seed + temperature=0 可复现评测
📚 RAG 与向量

RAG 的目标是让模型「开卷考试」:先检索资料再作答。这组参数与流程决定答案准不准、能不能溯源。

名称说明要点
RAG 流程 检索增强生成:离线把文档切分、向量化入库;在线检索相关片段、重排后拼进提示词,让模型基于资料作答而非凭记忆 切分→Embedding→入库→检索→重排→生成 先建评测集再优化
Chunk 切分 片段大小与重叠直接影响召回质量:太大稀释语义,太小丢失上下文 256~1024 token、重叠 10%~20%,按标题/段落语义边界切 经验值
相似度度量 余弦相似度只看向量方向,点积同时看方向与模长;向量归一化后两者等价 OpenAI 等归一化向量常用余弦,选型后全链路保持一致 余弦为主流
Top-K 检索 每次召回相似度最高的 K 条片段送入模型,K 是 RAG 效果与成本的第一平衡点 K=3~8 起步;K 过大引入噪声且费 token 3~8 常用
重排 Rerank 用交叉编码器对粗排候选精细打分,量少质高再进模型 20 选 5 是高性价比组合,提升常大于换模型 性价比之王
幻觉缓解 约束模型只基于检索资料回答,资料未覆盖时明确说不知道 提示词限定 仅依据资料作答 + 标注引用来源 + 低置信度走兜底 关键业务必做
🗄️ 向量数据库
名称说明要点
Milvus 云原生分布式向量数据库,支持十亿级向量、多种索引类型与标量过滤 大规模生产环境、需弹性扩缩容的场景 亿级首选
Qdrant Rust 实现,性能与内存占用优秀,payload 过滤与量化压缩能力完善 中等规模、过滤条件复杂的业务检索 性能均衡
Weaviate 内置向量 + BM25 混合检索与模块化向量化器,开箱能力全 关键词与语义混合搜索的知识库 混合检索
pgvector PostgreSQL 扩展,HNSW 索引,向量与业务表同库同事务 已有 PG 技术栈、百万级以内数据的第一选择 架构最简
Chroma 轻量嵌入式向量库,几行代码即可起服务 本地实验、原型验证、小项目 快速起步
Elasticsearch 8.x 原生支持向量字段与 kNN 检索,生态与运维体系成熟 已有 ES 集群、需全文 + 向量统一检索 存量迁移友好
🧰 常用工具生态
名称说明要点
LangChain 最流行的 LLM 应用编排框架:链式调用、Agent、RAG 组件齐全 Python/JS 双生态;概念多,按需取用 全家桶
Spring AI Spring 官方 AI 框架,统一对话、向量化、向量库等核心抽象 Java 技术栈首选,与 Spring Boot 无缝集成 Java 首选
LlamaIndex 专注数据接入与索引的 RAG 框架,文档解析与索引结构最丰富 复杂文档问答、知识库场景 RAG 利器
Ollama 本地大模型运行器,一条命令拉起 Qwen/Llama/DeepSeek 等开源模型 自带 OpenAI 兼容接口,适合离线与私有化 本地跑模
Open WebUI 自托管对话 Web 界面,支持多模型切换、知识库与权限管理 团队内部试用与共享模型入口 开箱即用
Dify 开源 LLMOps 平台,可视化编排提示词、工作流与知识库 低代码搭建 AI 应用并一键发布 API 业务快速验证
ComfyUI 节点式图像生成工作流引擎,可拖拽编排 Stable Diffusion 出图管线 图像生成、需要精细控制出图流程 绘图工作流
MCP Model Context Protocol,连接模型与外部工具、数据源的开放协议 工具接入的统一标准,替代各写各的插件 工具互联标准
AI Agent 工具调用循环
用户任务 → Agent 思考 → 调用工具 → 观察结果,循环直至完成
☕ Java 集成要点
名称说明要点
Spring AI 关键抽象 ChatClient 统一对话调用、EmbeddingModel 统一向量化、VectorStore 统一向量库读写 换厂商只换 starter 依赖与配置,业务代码不动 面向抽象编程
OpenAI 兼容接口 Qwen、DeepSeek、GLM 等国产模型普遍兼容 /v1/chat/completions 协议 base-urlapi-key 即复用整套 SDK 一套代码多模型
SSE 流式输出 Flux<ServerSentEvent> 逐 token 推送,前端 EventSource 接收渲染 设置读写超时,异常时推送收尾消息再关闭流 注意超时与中断
Function Calling 把 Java 方法注册为工具:名称、描述、参数 Schema,由模型决定何时调用 Spring AI 用 @Tool 注解暴露,描述写清「何时用」 智能体基石
🛡️ 安全与成本

上线前最容易被忽略的两件事:提示词注入是高危漏洞,token 费用是大头开销,各留一道防线。

名称说明要点
提示词注入防护 用户输入可能与系统指令冲突,诱导模型越权调用工具或泄露系统提示词 输入与指令隔离 + 工具调用白名单 + 输出侧再校验,不盲信模型返回 高危必防
敏感信息脱敏 手机号、身份证、密钥等不应原文进入模型上下文或日志 入模前掩码/替换;日志不打完整 prompt;高敏数据走私有化部署 隐私红线
Token 成本估算 费用 ≈ 输入 tokens × 输入单价 + 输出 tokens × 输出单价 RAG 场景输入占大头:压 Top-K、裁历史轮次、精简提示词最有效 输入是大头
缓存与降级 相同或语义相近的请求直接复用结果;异常时切换备用链路 精确缓存 + 语义缓存可省 30%+;超时切备用模型,非核心功能降级关键词检索 上线前备好
🖼️ 多模态速览
名称说明要点
图像生成 · 尺寸 分辨率与宽高比决定用途:方图做头像、横版做封面、竖版做海报 常用 1024×1024 / 1792×1024,先定尺寸再调其他参数
图像生成 · 步数与 CFG 采样步数影响细节与耗时;CFG 引导强度控制画面贴合提示词的程度 步数 20~30 起步、CFG 5~8;过高易过饱和失真 先小步试参
语音 · ASR 语音转文字:会议纪要、视频字幕、语音输入与客服质检 专有名词多的场景配热词表优化,准确率优先 会议 / 字幕高频
语音 · TTS 文字转语音:有声内容、智能外呼与数字人播报 关注多音字与数字读法,长文本分段合成再拼接
视觉理解 多模态模型看图作答:OCR 提取文字、图表数据解读、UI 截图走查 把图表转为 Markdown 表格 是数据处理高频用法 OCR / 图表问答
🔬 RAG 进阶
名称说明要点
混合检索 BM25 负责关键词精确匹配(型号、错误码),向量负责语义泛化,两路召回合并 RRF 融合排序,效果普遍优于单路 标配组合
父子块策略 子块(小段)负责精准匹配,命中后返回父块(大段)补全上下文 检索精度与上下文完整性兼得,长文档场景收益明显
查询改写 把口语化、带指代的问话改写成独立完整的检索 query 多轮对话必做:它怎么部署?→ X 框架如何部署?
查询扩展 一次改写为多个角度的查询并行检索,合并去重提升召回 简单做法:让模型生成 2~3 个同义变体 换角度多问几次
评估 · 召回率 衡量检索环节:该找到的资料有没有被找到,是 RAG 效果的第一瓶颈 先保召回再谈生成;命中率低先换 Embedding / 切分策略 先看检索
评估 · 生成质量 忠实度:答案是否严格基于检索资料(反幻觉);答案相关性:是否切题 RAGAS 等框架可自动评估,建 30~50 条黄金问答集持续回归
⚖️ 三种增强路径
名称说明要点
提示词工程 把规则、示例、流程写进提示词,零数据改动、即时生效 成本最低、时效最快;受上下文长度限制,复杂知识写不下 首选起步
RAG 外挂知识库实时检索,知识随时更新、答案可溯源 适合知识频繁变化、需引用来源的场景;有检索链路工程成本
微调 Fine-tuning 用领域数据改变模型行为与风格,推理时无需携带示例 适合固定风格 / 格式 / 领域术语;数据与训练成本最高 成本最高
选型口诀 按「知识变化频率 + 数据量 + 预算」三要素决策 知识常变用 RAG;风格固定才微调;先提示词、后 RAG、最后微调 由轻到重
组合使用 三者不互斥:微调定风格 + RAG 供知识 + 提示词控流程 生产级应用常见组合拳,先明确各自解决什么问题再叠加
🎚 生成参数实战

参数定义见上方「模型参数」,这里只讲实战:一句话口诀定档位,出问题按症状定位旋钮,照着调少走弯路。

症状 / 目标调参实战要点
temperature 口诀 要事实与标准答案锁 0(抽取 / 分类 / 评测回归),要创意发散 0.7 起步(文案 / 头脑风暴);微调步长 0.1,先定档再微调 0 事实 / 0.7 创作 先定档再微调
发散或复读排障 效果不受控时只动一个旋钮:固定 top_p=0.9,单调 temperature;两处同时大改,好坏都无法归因 二选一调,单变量归因 别同时拧两个
输出被截断 回复戛然而止先查 finish_reason=length;按预估输出长度 × 1.5 设置 max_tokens,超长内容分章节多次生成 预留 1.5 倍余量 截断先看 finish_reason
复读机式输出 先加 frequency_penalty(按次数罚),仍在原地绕圈再加 presence_penalty(出现过即罚);出现生造词、漏关键词立即回退 先频次后存在,过头即回退 小步加罚
控篇幅省 token 双保险:提示词写明字数上限,stop 设分隔符(如 ###)到段即停;被 stop 截断的内容不会继续计费 字数上限 + stop 双保险 省 token 免后处理
🚚 接入大模型清单

从「能跑通」到「敢上线」的六步清单:选型、密钥、体验、容错、成本、评估各一关,接新模型时照单逐项勾。

清单项说明要点
模型与厂商选型 按质量、价格、上下文长度三轴横向比较;榜单只做初筛,拿自家真实任务跑横评才算数 质量 / 价格 / 上下文 三轴定型号 真实任务横评
密钥管理 API Key 只放环境变量或配置中心,严禁进 Git 与前端代码;所有调用经后端网关统一转发 不入码库 + 后端统一转发 泄露即被刷
流式输出 SSE 逐 token 推送把首字延迟从数秒降到毫秒级,等待体验质变;断线要有收尾提示而非静默卡死 首字毫秒级,断流给收尾 体验分水岭
超时重试与降级 429 / 5xx / 超时 做指数退避重试并设总时长上限;重试耗尽切备用模型或固定话术兜底 指数退避 + 兜底链路 先想好失败怎么办
限流与成本看板 网关层按用户 / 接口限流防滥用;token 用量按天按人统计、折算成本并设预算告警 限流 + 预算告警 双保险 成本失控先熔断
效果评估集 上线前建 30~50 条真实业务问答集;换模型、改提示词、升版本都全量回归,防效果悄悄劣化 30~50 条黄金集 持续回归 没有评估集 = 盲飞