# 1. Prompt 中的示例数量、顺序、覆盖度和多样性如何影响诱导偏差,如何构建不易被“投机取巧”模仿的反例集 A 示例应放置在 Prompt 末尾,因为模型只关注最后的内容 B 示例应兼具覆盖度(含边界与异常输入)与多样性,并注意位置引发的首因/近因效应 ✓ 正确答案 C 示例数量越多,模型效果一定越好,因为没有成本上限 D 反例集应全部使用与目标完全相同的样例以强化学习
# 2. 如何把业务规则、合规条款、品牌口吻编码为可验证的 Prompt 子句,并配合运行时校验而非完全依赖模型自控 A 把所有合规要求写进 system prompt 即可完全保证模型遵守 B 合规条款永远无法被验证,只能靠人工审核 C 规则应拆成可验证的原子子句并配合运行时断言校验,而非只依赖模型自控 ✓ 正确答案 D 运行时校验失败时应该直接静默丢弃结果
# 3. Prompt 模板变量如何做类型、长度、来源和转义校验,避免模板注入与空值污染 A 只需校验变量是否为空,其余交给模型识别 B 应兼顾类型、长度、来源与转义校验,并对 null 值做显式"省略或占位"处理 ✓ 正确答案 C 用户输入不需要转义,因为模型会自行分辨指令与数据 D 模板变量越长越好,能提供更多上下文
# 4. 系统指令、开发者约束与用户要求发生冲突时,应用层还需要哪些权限和策略控制 A 完全相信模型能识别冲突并正确处理 B 降低系统指令优先级以迁就用户 C 把用户要求原样并入 Prompt 与系统指令并列 D 在应用层建立权限模型、动作白名单与策略执行点,使副作用动作必须经过校验 ✓ 正确答案
# 5. 如何版本化 Prompt、模型、参数和示例集,并把一次线上输出追溯到完整配置 A Prompt 模板无需纳入版本管理 B 只要记录模型名称就能复现线上输出 C 参数变化不影响输出,无需记录 D 应将 Prompt、模型、参数、示例集打包为不可变配置快照,并用 request_id 关联 config_version 以便追溯 ✓ 正确答案
# 6. Prompt 拼接时如何防止占位符未替换、JSON 转义错误、Markdown 破坏代码块等低级错误污染上下文 A 用严格模板引擎渲染并对占位符缺失、JSON 可解析性、代码块分隔符做渲染后校验 ✓ 正确答案 B 直接用字符串拼接,出错也在运行时暴露 C 占位符未替换不影响输出质量 D Markdown 破损无需关注
# 7. Prompt 国际化与多语言支持时,如何处理语种切换、字符长度膨胀(如中文 vs 德语) A 把 system prompt 翻译成与用户相同的语言一定能提升效果 B 德语与中文的 token 消耗完全相同 C 多语言无需单独回归测试 D 指令应保持稳定规范语言,输出语言单独控制,并按 token 而非字符数管理预算 ✓ 正确答案
# 8. 指令冲突(业务要求 vs 用户偏好 vs 安全规则)时,如何通过 Prompt 工程而非模型权重让模型“正确让位” A 让模型自行权衡冲突并临场决定 B 冲突时一律按用户要求执行 C 删除用户偏好,只用业务要求 D 在 Prompt 中显式声明优先级层级与 if-then 冲突子句,并配合样例与运行时校验 ✓ 正确答案
# 9. 跨模型迁移 Prompt 时,如何识别角色语义、工具格式和思考控制差异,而非逐字照搬 A 迁移只需改模型名 B 同一段 Prompt 在所有模型上效果等同,可直接照搬 C 应区分语义层与语法层,保留语义、按目标模型重写语法,并用最小回归集验证 ✓ 正确答案 D 工具格式在所有模型上完全一致
# 10. 为什么不存在通用“黄金 Prompt 长度”,应如何用回归集驱动删减和重写 A 存在一个所有任务通用的最佳 Prompt 长度 B Prompt 越长信息越多,效果越好 C 应通过回归集对比指标来驱动 Prompt 删减与重写,而非追求固定长度 ✓ 正确答案 D Prompt 越短一定越好
# 11. 长篇 Prompt 是否在模型推理中被“前重后轻”处理,关键约束应放在哪些位置最不容易被忽略 A 关键约束应放在开头或结尾的高注意力区,并避免被无关中间内容淹没 ✓ 正确答案 B 模型对中间位置信息利用更好,应把关键约束放中间 C 关键约束放在任何位置效果都一样 D 位置不影响模型对指令的遵守
# 12. 为什么同一段 Prompt 在不同模型上不能保证等价效果,跨模型迁移应做哪些最小回归集验证 A 同一段 Prompt 在所有模型上保证等价效果 B 跨模型迁移应通过覆盖角色、工具、输出格式、安全与边界的最小回归集验证来收敛行为 ✓ 正确答案 C 只需验证输出长度是否一致 D 迁移无需验证,直接替换模型名即可
# 13. Prompt 中包含代码块、JSON 示例或表格时,不同模型对“示例是说明而非指令”的理解为何不稳定 A 示例中故意包含错误,让模型去纠正 B 让示例与任务指令相邻,便于模型学习 C 用显式分区标签与措辞标注"仅为示例",并做结构隔离与回归验证 ✓ 正确答案 D 完全避免使用示例
# 14. 评估集中应包含多少“刁难性 Prompt”(诱导越权、诱导泄密、诱导越界) A 存在一个所有系统通用的固定比例 B 对抗样本越少越好,以免影响正常指标 C 比例应随任务风险等级调整,并保证对抗样本类别覆盖完整、安全指标单独统计 ✓ 正确答案 D 只要加一个对抗样本就足够
# 15. 如何为 Prompt 编写单元测试(断言结构、长度、关键字段) A 只测试模板是否报错,不关心渲染结果 B 单元测试无法应用于 Prompt C 同时对模板源与固定样例渲染结果做结构、长度、关键字段断言,并接入 CI ✓ 正确答案 D 只在出问题时才写测试
# 16. 指令层级 system、developer、user、tool 在跨 Provider 时优先级为何不稳定 A 所有 Provider 对 system/developer/user/tool 的优先级处理完全一致 B 各 Provider 对角色语义映射不同,需抽象层显式建模角色意图并做适配与实测验证 ✓ 正确答案 C developer 消息在所有模型中默认最高优先级 D 工具结果永远最低优先级,无需关注
# 17. 业务规则编码为 Prompt 子句时,运行时校验应捕获哪些常见漏写 A 应捕获必现元素缺失、拒绝条件缺失、格式契约与枚举非法等常见漏写,并支持回灌重试 ✓ 正确答案 B 校验只需检查输出是否为空 C 业务规则无法被运行时校验 D 校验失败应静默丢弃
# 18. 模板变量未替换导致的 JSON 转义错误如何被 CI 自动捕获 A 无法在 CI 中自动检测,只能人工检查 B 转义错误不影响 JSON 结构 C 只要运行时 catch 住 JSON 异常即可 D 用固定及恶意样例渲染模板,断言 JSON 可解析并扫描残留占位符 ✓ 正确答案
# 19. Prompt 复用“积木”在多产品覆写时,如何避免示例拼装顺序错乱 A 每个产品各自用手写拼接,互不影响 B 共享积木升级时无需关注各产品 C 用槽位驱动的声明式组装、产品级清单与渲染快照测试来保证顺序稳定 ✓ 正确答案 D 顺序只影响观感,不影响输出
# 20. 示例中的 JSON、表格是否会被模型错当作指令,如何在 Prompt 中加护栏 A 把示例与指令并列且不加说明,让模型自行学习 B 无法防护,只能接受误读 C 用显式分区标签、措辞声明与内容净化来隔离示例与指令,并加对抗回归用例验证 ✓ 正确答案 D 示例中放越多指令越便于模型理解
# 21. ReAct 中“观察—思考—行动”循环为什么常常陷入循环调用或死锁,工程上如何设最大步数与无效动作检测 A 循环是无害的,可以无限执行 B 完全依赖模型自行判断何时停止 C 设置最大步数、无效动作指纹检测与状态无进展探测,达到上限即降级回答 ✓ 正确答案 D 只要工具越多越好,不会卡死
# 22. Plan-and-Solve 在多步任务中可能产生幻觉计划,如何让模型在执行前显式校验计划可行性 A 计划由模型自行生成即可执行,无需校验 B 校验只在执行完所有步骤后做 C 幻觉计划无法检测 D 执行前把计划拆成结构化步骤,对照工具注册表做存在性与依赖校验,失败则修订或拒绝 ✓ 正确答案
# 23. Self-Consistency 多采样投票的成本(K 次推理) A 与单次推理成本相同 B 成本约为单次推理的 K 倍(token 与延迟),适合高价值且答案可验证的任务 ✓ 正确答案 C K 越大永远越划算 D 只增加 token 不增加延迟
# 24. 如何设计 Grounding Prompt,强制回答区分模型内部知识、外部证据和无法确认的信息 A 应强制区分内部知识、外部证据与无法确认信息,并绑定引用、明确标注未知与拒答 ✓ 正确答案 B 无法确认时应尽量猜一个答案 C 引用可选,无引用也能编造 D 让模型自由发挥内部知识即可
# 25. Prompt 模板的版本管理与 A/B 实验如何工程化落地? A 模板应版本化并锁定模型/参数/示例,A/B 用用户分层与显著指标归因后再推广 ✓ 正确答案 B Prompt 改动无需版本,直接覆盖即可 C A/B 只需改 Prompt,其他因素可以随意变化 D 实验无需回滚机制
# 26. XML 标签分隔(instruction/context/example 分区)与 Markdown 在跨模型稳定性上的对比,解析器对标签残缺的容错如何设计? A Markdown 分区的边界解析比 XML 更精确和稳定 B XML 标签提供了更显式、可解析的分区边界,容错上应用宽容策略并告警而非整体失败 ✓ 正确答案 C 标签残缺时解析器应直接报错,不处理 D 分区方式不影响模型对指令的遵循
# 27. 如何拆分系统政策、用户任务、不可信上下文和示例,防止数据被模型误当作高优先级指令 A 把所有内容混在一起,让模型自行区分 B 用户数据优先级最高,应优先执行 C 用显式分区与优先级声明隔离四类内容,并声明用户数据仅为数据不构成指令 ✓ 正确答案 D 示例应放在最高优先级
# 28. 怎样把目标、约束、成功标准、拒答条件和输出契约写成可评估而非含糊的 Prompt A 目标应尽量模糊,给模型发挥空间 B 输出契约可以随意,无需固定 C 目标、约束、成功标准、拒答条件与输出契约都应写成可判定、可断言的明确形式 ✓ 正确答案 D 成功标准无需定义,模型自己判断
# 29. 如何把 Prompt 拆分为可重用的“积木”(如身份、约束、风格、输出契约) A 整个 Prompt 作为单一整体维护最简单 B 按身份、约束、风格、输出契约等职责拆分,赋予独立版本并通过槽位声明式组合 ✓ 正确答案 C 积木之间必然互相干扰,无法复用 D 积木应尽量大,减少数量
# 30. CoT、Self-Consistency、Least-to-Most 与 Plan-and-Solve 分别适合什么任务,何时其成本大于收益 A 所有任务都用 CoT 效果最好 B Plan-and-Solve 适合所有任务 C Self-Consistency 永远值得 K 倍成本 D 各模式适合不同复杂度的任务,简单任务用强推理模式成本大于收益 ✓ 正确答案
# 31. ReAct 如何交替推理和行动,应用应如何隐藏内部思考并只暴露可审计的动作摘要 A 完整 Thought 应原样展示给用户以增强信任 B 动作参数无需脱敏,直接展示 C ReAct 不需要审计动作 D 应向用户暴露可审计的动作摘要,而把完整内部思考保留在日志中 ✓ 正确答案
# 32. Self-Ask、Step-Back、Chain-of-Density 和 Skeleton-of-Thought 各改变了哪一类推理或表达结构 A Self-Ask 改变的是表达结构 B 这些方法彼此完全等价 C Step-Back 提升抽象层级,Chain-of-Density 提升摘要密度,Skeleton-of-Thought 组织内容骨架 ✓ 正确答案 D 它们都只改变输出长度
# 33. Google Search Grounding、Anthropic Citations 与 OpenAI Web Search/file_search 的引用结果应如何统一展示 A 把引用归一化为"原文片段 + 来源 + 范围 + 置信度"的统一模型,再映射对齐到最终文本 ✓ 正确答案 B 直接按各 Provider 原始格式分别渲染 C 引用无法统一,只能各自为政 D 引用无需校验来源可达性
# 34. Prompt 与业务代码应分别做什么 A Prompt 表达语义与柔性约束,业务代码负责校验、权限、副作用等确定性逻辑 ✓ 正确答案 B 安全与校验可以完全交给 Prompt 提示 C 业务代码应尽量模拟 Prompt 的语义理解 D 所有逻辑都写进 Prompt 更灵活
# 35. Chain-of-Density 摘要如何控制迭代轮数,避免摘要“过度浓缩”丢失关键事实 A 轮数越多越好,密度越高 B 一次压缩到最简即可 C 轮数不影响关键事实保留 D 设定合理轮数上限,并以关键事实覆盖率驱动动态停止与验收 ✓ 正确答案
# 36. Tree of Thoughts / Graph of Thoughts 的搜索宽度与深度如何选择,为什么盲目增加分支并不能线性提升质量 A 分支越多,质量必然线性提升 B 宽度与深度应结合任务分叉与步数选择,并用评分与剪枝控制,盲目加分支收益递减 ✓ 正确答案 C 深度无关紧要 D 分支之间完全独立,无冗余
# 37. Reflexion 自反思可能把错误经验固化为长期记忆,如何设置反思门槛与记忆淘汰 A 错误经验也有价值,应无差别保留 B 每次失败都立即写入长期记忆 C 记忆一旦写入永不淘汰 D 设反思门槛,仅在多次一致失败后沉淀,并对记忆做有效性验证与淘汰 ✓ 正确答案
# 38. Step-Back Prompting 与“批判性反思”相比,是否更适合开放式问题,二者在小模型上的差异如何 A Step-Back 更适合开放式问题,且小模型上两者效果差异明显,需回归验证 ✓ 正确答案 B 二者完全等价,可互换 C 批判性反思只适合开放式问题 D 小模型上两者效果与更大模型完全相同
# 39. 如何让 CoT 既能让用户看到推理又防止泄密关键策略(不下发内部推理) A 把完整内部推理原样展示给用户 B 完全隐藏推理,不给任何解释 C 推理透明与否无关紧要 D 使用分层推理摘要,对外展示高层步骤,内部细节与策略仅保留在服务端日志 ✓ 正确答案
# 40. 为什么“请一步一步思考”不能替代任务分解、工具约束和结果验证 A 它已足够保证复杂任务正确完成 B 工具约束是多余的 C 提示词可以替代结果验证 D 它只是软提示,无法替代任务分解、工具约束与结果验证等结构性保障 ✓ 正确答案
# 41. 如何评估一种 Prompt 模式是否真正提升任务成功率,而不是只让回答更长、更像推理 A 新模式只要推理步骤多就更好 B 只要回答更长更像推理就算提升 C 用任务成功率等结果指标,并控制长度变量、检查统计显著性与成本 ✓ 正确答案 D 无需评估,凭直觉判断
# 42. 为什么 CoT 在数学和逻辑上效果好,在简单事实问答上反而会降低准确率 A CoT 适合需逐步推导的数学逻辑任务,在简单事实问答上会因多余步骤而降低准确率 ✓ 正确答案 B CoT 对所有任务都能提升准确率 C CoT 只对简单任务有效 D 是否用 CoT 与任务无关
# 43. Skeleton-of-Thought 的并行骨架生成与串行展开在延迟节省上的实际收益如何评测 A 只看总完成时间是否变短即可 B 并行展开一定提升质量,无需关注 C 延迟与质量无关,只需优化延迟 D 分层测骨架与展开耗时,控制变量对比首 token 与完成时间,并校验并行展开是否影响质量 ✓ 正确答案
# 44. 为什么"提示词模板市场"中的大多数复杂技巧在自家任务上不一定有效,需要哪些对照实验 A 通过基线对照、单技巧与消融实验,在自家任务与指标上验证真实贡献后再采用 ✓ 正确答案 B 无需实验,技巧越多越好 C 技巧在越多的任务上有效越可靠 D 市场热门的技巧直接采用即可
# 45. 经典模式与 Grounding Prompt 在生产环境应采集哪些可观测信号、记录哪些日志、如何排查长链推理中的失败 A 长链失败无法排查 B 只需记录最终输出即可 C 采集延迟/token/校验/引用等信号,记录完整轨迹与配置,用 request_id 关联并回放定位失败环节 ✓ 正确答案 D 日志越少越安全,无需记录输入
# 46. Provider 原生 Structured Outputs 与 JSON Mode、普通“请返回 JSON”有何保证差异 A 三者保证程度完全相同 B 普通"请返回 JSON"也能保证结构正确 C JSON Mode 已能严格保证字段与枚举 D 普通提示 < JSON Mode < 原生 Structured Outputs,后者在生成层强制 Schema 合规 ✓ 正确答案
# 47. 解析失败、Schema 校验失败和业务语义校验失败应如何分层处理,修复与重试如何设置终止条件 A 三类失败都无限重试直到成功 B 所有失败都应直接丢弃 C 解析失败可容错或重试,Schema 失败可回灌修复,语义失败需业务规则,并在达到重试上限后降级 ✓ 正确答案 D 语义失败重试即可解决
# 48. Provider 原生 Structured Outputs(OpenAI strict: true、Anthropic tool use、Gemini responseSchema)与 SDK 后处理(Outline、Guidance、LMQL)应如何取舍 A 原生方案永远优于 SDK 后处理 B 两者完全等价,可任意替换 C 原生方案简单可靠但绑定 Provider 且 Schema 有限制,SDK 方案灵活跨 Provider 但更复杂,应按场景选择 ✓ 正确答案 D SDK 后处理永远更可靠
# 49. Schema 校验失败时模型通常会重写哪里,是修正枚举、补全缺失字段还是直接放弃,哪种可重试性最强 A 重试与错误类型无关 B 所有失败都可无限重试修复 C 模型通常直接放弃,无法修复 D 缺失字段与枚举错误可定位、可回灌定点修复,可重试性最强;放弃或语义矛盾类重试价值低 ✓ 正确答案
# 50. 流式结构化输出中“部分可见”与“最终一致”如何通过事件类型、版本号、partial token 三种方式通知前端 A 用事件类型定语义、版本号定次序、partial token 提供可渲染内容,组合实现部分可见与最终一致 ✓ 正确答案 B 只下发最终结果即可,无需部分可见 C 版本号用于区分不同用户,与顺序无关 D partial token 无需最终校验
# 51. 结构化输出流式增量渲染为表单/组件(generative UI)时,事件契约应如何设计,使前端在半 JSON 状态即可渲染可用字段,并在最终校验失败时平滑回滚 A 前端必须等完整 JSON 才能渲染,无需中间状态 B 校验失败时无需回滚,直接保留错误内容 C 版本号只用于调试,与渲染逻辑无关 D 契约应字段级、带状态与版本号,支持半 JSON 增量渲染,并在 final/validation 失败时按版本回滚 ✓ 正确答案
# 52. system prompt 泄露的应用层防护(指令与数据分离、凭证不入 Prompt、泄露探测)应如何组合,为什么在 Prompt 里写保密字样无效 A 在 Prompt 中写"保密"字样即可防止泄露 B 只要不放 API Key 就绝对安全 C 应组合指令与数据分离、凭证不入 Prompt、泄露探测,而"保密"字样只是可被绕过的软约束 ✓ 正确答案 D Prompt 里的指令永远不会被泄露
# 53. Schema 增删字段或收紧枚举时,如何兼容旧客户端、历史记录和回放数据 A 历史记录无需兼容,直接作废 B 直接删字段即可,无需兼容 C 枚举收紧无需考虑旧值 D 增字段向后兼容,破坏性变更走双版本并行,回放数据按存储时的 schema_version 解析 ✓ 正确答案
# 54. 为什么结构化输出仍是不可信输入,Bean Validation、运行时类型校验和授权检查应放在哪里 A 结构化输出仍应视为不可信输入,服务端做 Bean Validation/类型校验,并在副作用执行前做授权检查 ✓ 正确答案 B 结构合法即内容可信,无需校验 C 结构化输出无需授权检查 D 校验只在前端做即可
# 55. 温度、Top-P、最大输出、停止条件和随机种子支持为何因模型而异,怎样按评估选参 A 采样参数语义因 Provider 而异,应固定回归集在评估集上搜索最优组合,seed 仅作可复现倾向 ✓ 正确答案 B seed 保证完全确定性,无需验证 C temperature/top_p/seed 在所有模型上语义完全一致 D 参数随意设置即可,无需评估
# 56. 不同模型对同一 JSON Schema 的解读差异(如 additionalProperties: false、oneOf 与 anyOf),应如何做最小跨模型测试矩阵 A 用"高风险特性 × 代表性模型"的最小矩阵,固定样例断言输出合规,暴露差异并适配 ✓ 正确答案 B oneOf 与 anyOf 在所有模型上等价 C additionalProperties 在所有模型上都严格生效 D 所有模型对同一 Schema 解读一致,无需测试
# 57. 模型返回“几乎合法”的 JSON(如尾随逗号、单引号、注释)时,解析器应如何容错修复,修复边界与安全风险如何界定? A 修复过程无需记录 B 应修复一切错误,包括自动猜测缺失字段 C 容错修复后无需再校验 D 只修复无歧义的语法错误(尾逗号、注释等),不猜语义,修复后仍需完整校验并记录修复过程 ✓ 正确答案
# 58. JSON Schema 表达枚举时,超长枚举(>100 项)会如何影响生成质量与延迟,应改用提示词约束还是服务端校验? A 把上百项枚举全部塞进 Schema 提示词 B 枚举用提示词约束一定比服务端校验准确 C 枚举越长越利于模型选择 D 超长枚举应放服务端校验,模型生成候选后用确定性映射精确匹配,避免拖累生成 ✓ 正确答案
# 59. Schema 中嵌套对象、多态(oneOf 判别字段)与循环引用在不同 Provider 上的支持差异如何测试 A 所有 Provider 都完整支持嵌套、多态与循环引用 B 用最小用例矩阵逐个验证各特性支持度,不支持的降级为普通模式 + 服务端校验 ✓ 正确答案 C 循环引用在所有 Provider 都支持 D 无需测试,直接假设支持
# 60. Schema 版本演进(加字段、改枚举)如何不破坏历史会话的解析,是向前兼容还是双版本并行 A 任何改枚举都必须双版本并行,无需考虑向后兼容 B 枚举删值不需要任何迁移 C 历史会话直接用新 Schema 解析即可 D 加字段向后兼容,破坏性变更双版本并行,历史会话按 schema_version 用旧版解析 ✓ 正确答案
# 61. Few-shot 示例的选择策略(难度/多样性/分布)如何影响效果? A 示例越多越相似越好 B 应兼顾难度(覆盖边界与易错)、多样性与线上分布,必要时按输入动态检索最相似示例 ✓ 正确答案 C 只要示例格式正确就足够 D 示例分布与线上输入无关
# 62. 如何把长 Prompt 拆分为"系统提示+任务提示+数据上下文"并控制 token 预算? A 把全部内容塞进 system 提示即可 B 拆分为系统/任务/数据三段并分配合预算,超限时按"系统>任务>数据"优先级裁剪并预留输出空间 ✓ 正确答案 C 数据上下文永远最重要,优先保留 D 预算按字符数统计即可
# 63. Prompt 中的动态上下文(时间、用户信息)应放前缀还是后缀,如何兼顾输出质量与 Provider 前缀缓存命中? A 动态内容必须放前缀,即使破坏缓存 B 静态内容放前缀以命中缓存,动态上下文放后缀贴近任务,兼顾质量与缓存命中 ✓ 正确答案 C 前缀缓存与内容位置无关 D 动态关键约束放中间最合适
# 64. system prompt 泄露发生后,影响面(暴露的业务规则、示例、工具意图)应如何评估,哪些内容需要立即轮换或重写 A 泄露后所有内容都无需处理 B 示例泄露一定比规则泄露严重 C 只有 API Key 需要处理 D 按机密性与可利用性分级,凭证与可被利用的守卫规则立即轮换,低敏感内容可保留 ✓ 正确答案
# 65. 如何记录模型快照、Prompt、参数、工具 Schema、数据版本和请求 ID,以复现概率性故障 A 概率性故障无法复现,无需记录 B 只需记录模型名即可 C 用 request_id 关联模型快照、Prompt、参数、Schema、数据版本与输入输出,回放时加载相同配置多次采样 ✓ 正确答案 D 参数无需记录,不影响结果
# 66. 如何比较简化 Schema、分步生成和确定性后处理 A 三者完全等价,选哪个都行 B 简化 Schema 永远最可靠 C 确定性后处理永远最优 D 应从可靠性、成本、表达力与复杂度对比,按结构复杂度选择或组合(简化/分步/后处理) ✓ 正确答案
# 67. 结构化输出的拒绝率与业务中断率如何挂钩,应设置哪些硬性上限并触发告警 A 拒绝率与业务无关,无需监控 B 拒绝率决定业务中断率,应设重试与失败容忍上限、全局拒绝率阈值并触发告警与降级 ✓ 正确答案 C 重试可以无限进行,永不拒绝 D 拒绝率超标无需降级,直接重试
# 68. 为什么“temperature=0 即可复现”是错觉,Provider 后端升级、硬件差异、批处理都会带来随机性 A temperature=0 保证每次输出完全一致 B 后端升级、硬件差异与批处理都会引入随机性,复现应靠固定配置快照与结果校验而非逐字节一致 ✓ 正确答案 C 只要 temperature=0 就与硬件无关 D 批处理不影响输出确定性
# 69. 当模型两次返回同一 JSON 但语义不同时(如枚举值写错但结构合法),业务语义校验应如何设计以捕获这类漂移? A 在结构校验之上增加业务规则断言、枚举词典、字段关联与语义指纹检测,捕获取值漂移 ✓ 正确答案 B 结构合法即语义正确,无需额外校验 C 两次输出结构相同就必然语义相同 D 枚举值错误属于结构问题,无需语义校验
# 70. A/B 测试多个 Prompt 版本时应保持哪些不变因素(模型快照、参数、用户分层) A 只要随机分配流量即可,模型参数可变 B 用户可以在不同组间切换,更公平 C 应锁定模型快照、采样参数、用户分层与数据版本,只让 Prompt 版本变化,才能干净归因 ✓ 正确答案 D 评估指标无需预先定义
# 71. 如何用 JSON Schema 表达必填、枚举、联合类型、嵌套对象与附加字段禁用,并映射到 Java DTO 和 TypeScript 类型 A 手写 DTO 与 TS 类型即可,无需与 Schema 对齐 B additionalProperties 在 TypeScript 中无法表达 C 用 Schema 作单一事实来源,required/enum/oneOf/嵌套/additionalProperties 分别映射,并用代码生成保证一致 ✓ 正确答案 D oneOf 在 Java 中无法映射为多态
# 72. Prompt 与代码的解耦,如何用配置文件/DSL 管理复杂 Prompt? A 把 Prompt 硬编码在代码中更简单 B Prompt 配置变更必须重发代码 C DSL 越复杂越好,功能越全 D 用配置/DSL 把 Prompt 与代码解耦,代码只负责渲染调用,并配合版本化、校验与 CI ✓ 正确答案
# 73. 否定指令(不要做什么)为何在不同模型上不稳定,如何用肯定指令与护栏替代? A 护栏无法替代否定指令 B 否定指令在所有模型上都稳定可靠 C 否定指令越多越好,模型更清楚边界 D 否定指令易不稳定,应改写成肯定指令,并用运行时护栏强制拦截禁止项 ✓ 正确答案