AI · 提示词 / 应用落地
AI 应用速查
从提示词框架、模型参数调优,到 RAG 检索增强、向量库选型与 Spring AI 集成,再到成本与安全兜底,AI 应用落地全流程的 66 个关键知识点一张表收齐,随查随用。
66条速查
12大板块
∞持续更新
📖 速查表
点击展开各小节
💬 提示词框架
| 名称 | 说明 | 要点 |
|---|---|---|
| Role-Task-Format | 最简通用的三段式骨架:先设定角色身份,再明确任务目标,最后约定输出格式,一段话也能组织出高质量提示词 | 角色:资深 DBA 任务:审查这条慢 SQL 格式:表格列出问题/建议 新手首选 |
| CRISPE | 五段式结构:Capacity 能力背景 → Insight 洞见 → Statement 陈述任务 → Personality 风格设定 → Experiment 多方案权衡,适合方案对比与决策类任务 | 以性能优化专家身份… 给出 3 种缓存方案并比较优劣 方案对比 |
| Few-shot 少样本提示 | 在提示词中附 2~5 组输入输出示例,让模型模仿格式、风格与判断口径,通常比纯指令描述更稳定 | 好评 → 正面;差评 → 负面;…→ ? 示例越贴近真实分布效果越好 格式类任务利器 |
| CoT 思维链 | 要求模型「一步一步思考」或提供含推理过程的示例,先展开中间步骤再给结论,显著提升数学、逻辑与排查类任务准确率 | 请一步步推理:先列条件,再分步计算,最后作答 复杂推理必备 |
🎛️ 模型参数
| 名称 | 说明 | 要点 |
|---|---|---|
| temperature | 控制输出随机性:值越低越稳定确定,越高越发散有创意 | 0~0.3 抽取/分类 · 0.7~1.0 文案创意 评测先冻结为 0 |
| top_p | 核采样:只从累计概率达到 p 的候选词中采样,与 temperature 同为发散度旋钮 | 与 temperature 二选一调整,避免同时大幅改动 官方建议只调其一 |
| max_tokens | 限制单次回复最大生成长度,超出即截断,同时影响计费上限 | 中文约 1 字 ≈ 0.6~1 token,预留余量防截断 过小会被截断 |
| frequency_penalty | 频率惩罚:按已出现次数降低该词的再选概率,抑制复读机式输出 | 默认 0;翻译/代码保持 0,文案可 0.3~0.6 防复读 |
| presence_penalty | 存在惩罚:只要出现过就降低概率,鼓励引入新话题与新模式 | 创意写作 0.2~0.5;调太高易跑题、生造词 调高易跑题 |
| stop | 停止序列:模型生成到指定字符串立即停止并返回已完成部分 | 用 ###、\n\n 分隔多段输出时按段截断 结构化截断 |
| seed | 固定随机种子,让同一请求尽量复现相同输出 | 回归评测时固定 seed + temperature=0 可复现评测 |
📚 RAG 与向量
RAG 的目标是让模型「开卷考试」:先检索资料再作答。这组参数与流程决定答案准不准、能不能溯源。
| 名称 | 说明 | 要点 |
|---|---|---|
| RAG 流程 | 检索增强生成:离线把文档切分、向量化入库;在线检索相关片段、重排后拼进提示词,让模型基于资料作答而非凭记忆 | 切分→Embedding→入库→检索→重排→生成 先建评测集再优化 |
| Chunk 切分 | 片段大小与重叠直接影响召回质量:太大稀释语义,太小丢失上下文 | 256~1024 token、重叠 10%~20%,按标题/段落语义边界切 经验值 |
| 相似度度量 | 余弦相似度只看向量方向,点积同时看方向与模长;向量归一化后两者等价 | OpenAI 等归一化向量常用余弦,选型后全链路保持一致 余弦为主流 |
| Top-K 检索 | 每次召回相似度最高的 K 条片段送入模型,K 是 RAG 效果与成本的第一平衡点 | K=3~8 起步;K 过大引入噪声且费 token 3~8 常用 |
| 重排 Rerank | 用交叉编码器对粗排候选精细打分,量少质高再进模型 | 20 选 5 是高性价比组合,提升常大于换模型 性价比之王 |
| 幻觉缓解 | 约束模型只基于检索资料回答,资料未覆盖时明确说不知道 | 提示词限定 仅依据资料作答 + 标注引用来源 + 低置信度走兜底 关键业务必做 |
🗄️ 向量数据库
| 名称 | 说明 | 要点 |
|---|---|---|
| Milvus | 云原生分布式向量数据库,支持十亿级向量、多种索引类型与标量过滤 | 大规模生产环境、需弹性扩缩容的场景 亿级首选 |
| Qdrant | Rust 实现,性能与内存占用优秀,payload 过滤与量化压缩能力完善 | 中等规模、过滤条件复杂的业务检索 性能均衡 |
| Weaviate | 内置向量 + BM25 混合检索与模块化向量化器,开箱能力全 | 关键词与语义混合搜索的知识库 混合检索 |
| pgvector | PostgreSQL 扩展,HNSW 索引,向量与业务表同库同事务 | 已有 PG 技术栈、百万级以内数据的第一选择 架构最简 |
| Chroma | 轻量嵌入式向量库,几行代码即可起服务 | 本地实验、原型验证、小项目 快速起步 |
| Elasticsearch | 8.x 原生支持向量字段与 kNN 检索,生态与运维体系成熟 | 已有 ES 集群、需全文 + 向量统一检索 存量迁移友好 |
🧰 常用工具生态
| 名称 | 说明 | 要点 |
|---|---|---|
| LangChain | 最流行的 LLM 应用编排框架:链式调用、Agent、RAG 组件齐全 | Python/JS 双生态;概念多,按需取用 全家桶 |
| Spring AI | Spring 官方 AI 框架,统一对话、向量化、向量库等核心抽象 | Java 技术栈首选,与 Spring Boot 无缝集成 Java 首选 |
| LlamaIndex | 专注数据接入与索引的 RAG 框架,文档解析与索引结构最丰富 | 复杂文档问答、知识库场景 RAG 利器 |
| Ollama | 本地大模型运行器,一条命令拉起 Qwen/Llama/DeepSeek 等开源模型 | 自带 OpenAI 兼容接口,适合离线与私有化 本地跑模 |
| Open WebUI | 自托管对话 Web 界面,支持多模型切换、知识库与权限管理 | 团队内部试用与共享模型入口 开箱即用 |
| Dify | 开源 LLMOps 平台,可视化编排提示词、工作流与知识库 | 低代码搭建 AI 应用并一键发布 API 业务快速验证 |
| ComfyUI | 节点式图像生成工作流引擎,可拖拽编排 Stable Diffusion 出图管线 | 图像生成、需要精细控制出图流程 绘图工作流 |
| MCP | Model Context Protocol,连接模型与外部工具、数据源的开放协议 | 工具接入的统一标准,替代各写各的插件 工具互联标准 |
☕ Java 集成要点
| 名称 | 说明 | 要点 |
|---|---|---|
| Spring AI 关键抽象 | ChatClient 统一对话调用、EmbeddingModel 统一向量化、VectorStore 统一向量库读写 | 换厂商只换 starter 依赖与配置,业务代码不动 面向抽象编程 |
| OpenAI 兼容接口 | Qwen、DeepSeek、GLM 等国产模型普遍兼容 /v1/chat/completions 协议 | 改 base-url 与 api-key 即复用整套 SDK 一套代码多模型 |
| SSE 流式输出 | 用 Flux<ServerSentEvent> 逐 token 推送,前端 EventSource 接收渲染 | 设置读写超时,异常时推送收尾消息再关闭流 注意超时与中断 |
| Function Calling | 把 Java 方法注册为工具:名称、描述、参数 Schema,由模型决定何时调用 | Spring AI 用 @Tool 注解暴露,描述写清「何时用」 智能体基石 |
🛡️ 安全与成本
上线前最容易被忽略的两件事:提示词注入是高危漏洞,token 费用是大头开销,各留一道防线。
| 名称 | 说明 | 要点 |
|---|---|---|
| 提示词注入防护 | 用户输入可能与系统指令冲突,诱导模型越权调用工具或泄露系统提示词 | 输入与指令隔离 + 工具调用白名单 + 输出侧再校验,不盲信模型返回 高危必防 |
| 敏感信息脱敏 | 手机号、身份证、密钥等不应原文进入模型上下文或日志 | 入模前掩码/替换;日志不打完整 prompt;高敏数据走私有化部署 隐私红线 |
| Token 成本估算 | 费用 ≈ 输入 tokens × 输入单价 + 输出 tokens × 输出单价 | RAG 场景输入占大头:压 Top-K、裁历史轮次、精简提示词最有效 输入是大头 |
| 缓存与降级 | 相同或语义相近的请求直接复用结果;异常时切换备用链路 | 精确缓存 + 语义缓存可省 30%+;超时切备用模型,非核心功能降级关键词检索 上线前备好 |
🖼️ 多模态速览
| 名称 | 说明 | 要点 |
|---|---|---|
| 图像生成 · 尺寸 | 分辨率与宽高比决定用途:方图做头像、横版做封面、竖版做海报 | 常用 1024×1024 / 1792×1024,先定尺寸再调其他参数 |
| 图像生成 · 步数与 CFG | 采样步数影响细节与耗时;CFG 引导强度控制画面贴合提示词的程度 | 步数 20~30 起步、CFG 5~8;过高易过饱和失真 先小步试参 |
| 语音 · ASR | 语音转文字:会议纪要、视频字幕、语音输入与客服质检 | 专有名词多的场景配热词表优化,准确率优先 会议 / 字幕高频 |
| 语音 · TTS | 文字转语音:有声内容、智能外呼与数字人播报 | 关注多音字与数字读法,长文本分段合成再拼接 |
| 视觉理解 | 多模态模型看图作答:OCR 提取文字、图表数据解读、UI 截图走查 | 把图表转为 Markdown 表格 是数据处理高频用法 OCR / 图表问答 |
🔬 RAG 进阶
| 名称 | 说明 | 要点 |
|---|---|---|
| 混合检索 | BM25 负责关键词精确匹配(型号、错误码),向量负责语义泛化,两路召回合并 | 用 RRF 融合排序,效果普遍优于单路 标配组合 |
| 父子块策略 | 子块(小段)负责精准匹配,命中后返回父块(大段)补全上下文 | 检索精度与上下文完整性兼得,长文档场景收益明显 |
| 查询改写 | 把口语化、带指代的问话改写成独立完整的检索 query | 多轮对话必做:它怎么部署?→ X 框架如何部署? |
| 查询扩展 | 一次改写为多个角度的查询并行检索,合并去重提升召回 | 简单做法:让模型生成 2~3 个同义变体 换角度多问几次 |
| 评估 · 召回率 | 衡量检索环节:该找到的资料有没有被找到,是 RAG 效果的第一瓶颈 | 先保召回再谈生成;命中率低先换 Embedding / 切分策略 先看检索 |
| 评估 · 生成质量 | 忠实度:答案是否严格基于检索资料(反幻觉);答案相关性:是否切题 | RAGAS 等框架可自动评估,建 30~50 条黄金问答集持续回归 |
⚖️ 三种增强路径
| 名称 | 说明 | 要点 |
|---|---|---|
| 提示词工程 | 把规则、示例、流程写进提示词,零数据改动、即时生效 | 成本最低、时效最快;受上下文长度限制,复杂知识写不下 首选起步 |
| RAG | 外挂知识库实时检索,知识随时更新、答案可溯源 | 适合知识频繁变化、需引用来源的场景;有检索链路工程成本 |
| 微调 Fine-tuning | 用领域数据改变模型行为与风格,推理时无需携带示例 | 适合固定风格 / 格式 / 领域术语;数据与训练成本最高 成本最高 |
| 选型口诀 | 按「知识变化频率 + 数据量 + 预算」三要素决策 | 知识常变用 RAG;风格固定才微调;先提示词、后 RAG、最后微调 由轻到重 |
| 组合使用 | 三者不互斥:微调定风格 + RAG 供知识 + 提示词控流程 | 生产级应用常见组合拳,先明确各自解决什么问题再叠加 |
🎚 生成参数实战
参数定义见上方「模型参数」,这里只讲实战:一句话口诀定档位,出问题按症状定位旋钮,照着调少走弯路。
| 症状 / 目标 | 调参实战 | 要点 |
|---|---|---|
| temperature 口诀 | 要事实与标准答案锁 0(抽取 / 分类 / 评测回归),要创意发散 0.7 起步(文案 / 头脑风暴);微调步长 0.1,先定档再微调 | 0 事实 / 0.7 创作 先定档再微调 |
| 发散或复读排障 | 效果不受控时只动一个旋钮:固定 top_p=0.9,单调 temperature;两处同时大改,好坏都无法归因 | 二选一调,单变量归因 别同时拧两个 |
| 输出被截断 | 回复戛然而止先查 finish_reason=length;按预估输出长度 × 1.5 设置 max_tokens,超长内容分章节多次生成 | 预留 1.5 倍余量 截断先看 finish_reason |
| 复读机式输出 | 先加 frequency_penalty(按次数罚),仍在原地绕圈再加 presence_penalty(出现过即罚);出现生造词、漏关键词立即回退 | 先频次后存在,过头即回退 小步加罚 |
| 控篇幅省 token | 双保险:提示词写明字数上限,stop 设分隔符(如 ###)到段即停;被 stop 截断的内容不会继续计费 | 字数上限 + stop 双保险 省 token 免后处理 |
🚚 接入大模型清单
从「能跑通」到「敢上线」的六步清单:选型、密钥、体验、容错、成本、评估各一关,接新模型时照单逐项勾。
| 清单项 | 说明 | 要点 |
|---|---|---|
| 模型与厂商选型 | 按质量、价格、上下文长度三轴横向比较;榜单只做初筛,拿自家真实任务跑横评才算数 | 质量 / 价格 / 上下文 三轴定型号 真实任务横评 |
| 密钥管理 | API Key 只放环境变量或配置中心,严禁进 Git 与前端代码;所有调用经后端网关统一转发 | 不入码库 + 后端统一转发 泄露即被刷 |
| 流式输出 SSE | 逐 token 推送把首字延迟从数秒降到毫秒级,等待体验质变;断线要有收尾提示而非静默卡死 | 首字毫秒级,断流给收尾 体验分水岭 |
| 超时重试与降级 | 对 429 / 5xx / 超时 做指数退避重试并设总时长上限;重试耗尽切备用模型或固定话术兜底 | 指数退避 + 兜底链路 先想好失败怎么办 |
| 限流与成本看板 | 网关层按用户 / 接口限流防滥用;token 用量按天按人统计、折算成本并设预算告警 | 限流 + 预算告警 双保险 成本失控先熔断 |
| 效果评估集 | 上线前建 30~50 条真实业务问答集;换模型、改提示词、升版本都全量回归,防效果悄悄劣化 | 30~50 条黄金集 持续回归 没有评估集 = 盲飞 |