# 1. temperature、top_p、top_k 的作用机理与联合调参,不同任务(代码生成/创意写作/结构化抽取)的推荐配置? A temperature 越高越确定 B 所有任务都该用最高 temperature C 三个参数互不影响,单独调即可 D temperature 控随机性、top_p 去长尾、top_k 硬截断,代码/结构化用低值、创意用高值,联合调参 ✓ 正确答案
# 2. max_tokens、stop 序列与截断处理,输出被截断的检测与续写策略? A 用 finish_reason 区分截断(length)与正常结束(stop),length 截断用续写回填上下文处理并设轮次上限 ✓ 正确答案 B max_tokens 绝不截断,只会正常结束 C stop 序列会导致截断需续写 D 无法检测截断
# 3. repetition_penalty 与 frequency_penalty 的机制差异,前者对已出现 token 施加固定惩罚,后者按出现次数累加惩罚——各自适合什么场景?过度惩罚会导致什么退化? A 两种惩罚机制相同 B repetition_penalty 固定惩罚适合抑制机械重复,frequency_penalty 累加惩罚适合控高频重复,过度惩罚会致词穷与表达异常 ✓ 正确答案 C 频率惩罚不累加 D 惩罚越强越好
# 4. min_p 采样策略的原理,相比 top_p 的动态阈值,min_p 设定基于最高概率 token 的绝对下限比例,为何在某些模型上效果优于 top_p? A top_p 与 min_p 机制完全相同 B min_p 阈值与最高概率无关 C min_p 效果总是差于 top_p D top_p 按累计比例动态截断、min_p 按相对最高概率的绝对下限截断,min_p 在稳定排除低概率 token 上更稳健 ✓ 正确答案
# 5. 结构化输出的约束解码(grammar-based sampling,如 GBNF/JSON Schema)与 Provider 原生 Structured Outputs 在格式保证、延迟与成本上有何差异,如何选型 A 约束解码与原生 Structured Outputs 完全相同 B 约束解码无法保证格式 C 约束解码自建可控适合自部署,原生 Structured Outputs 省事内置依赖 Provider,按部署形态与成本选型 ✓ 正确答案 D 原生 Structured Outputs 总是免费
# 6. 结构化输出(JSON Mode/Function Calling)与解码约束如何结合减少格式错误? A 约束解码无法与 JSON Mode 结合 B 约束解码在解码阶段强制 schema 合法,JSON Mode/Function Calling 定义结构,结合后格式错误被消除,只留语义校验 ✓ 正确答案 C 约束解码会破坏 JSON 结构 D 格式错误只能靠重试
# 7. 流式输出与解码参数的交互,不同参数组合下流式增量输出的稳定性如何评估(半截 token、重复段、截断恢复) A 流式增量一定是完整 token B 流式需处理半截 token(缓冲拼接)、重复段(采样控制)、截断恢复(回填续写),并评估参数组合下的稳定性 ✓ 正确答案 C 高 temperature 不会引起流式重复 D 流式截断无法恢复
# 8. 结构化任务(抽取、分类、JSON 生成)中 temperature/top_p 的推荐区间应如何用评估集确定,而不是凭经验 A 参数凭经验即可,无需评估 B 用评估集做参数网格搜索,测结构化任务指标,选准确率高且稳定的 temperature/top_p 区间 ✓ 正确答案 C 所有结构化任务都用 temperature=1 D 评估集无法用于调参
# 9. temperature 设为 0 是否保证完全确定性输出,为什么同一请求仍可能返回不同结果,如何用 seed 与固定参数提升可复现性? A temperature=0 不保证确定(实现/版本/后端引入差异),用 seed+固定参数+版本+缓存提升可复现性 ✓ 正确答案 B 固定 seed 即可绝对复现 C 后端升级不影响输出 D temperature=0 保证完全确定
# 10. logit_bias 的工程应用,如何用 token 级偏置修正模型在特定符号/格式上的输出习惯,其限制与风险? A logit_bias 是语义级约束 B logit_bias 按 token 加偏置修正格式/术语,但限制在 token 级、需维护 token id 映射、过度偏置伤流畅性 ✓ 正确答案 C logit_bias 无任何风险 D 一个词总是单个 token,无需维护映射
# 11. max_tokens 与输出长度的成本关系,输出 token 计费与缓存的影响,如何用 max_completion_tokens 控制成本与延迟? A 输出越长成本越高,用 max_tokens/max_completion_tokens 限制输出上限(含思考 token)控制成本与延迟 ✓ 正确答案 B max_completion_tokens 不含思考 token C 输出长度不影响成本 D 输出超长无任何影响
# 12. 解码参数与评测的配合,为什么回归评测必须固定 seed/参数/模型版本,参数漂移如何污染对比实验? A 评测无需固定参数,只看结果 B 回归评测必须固定 seed/参数/模型版本,否则参数漂移使输出差异无法归因,污染对比实验 ✓ 正确答案 C 评测只需固定 seed D 参数漂移不影响评测
# 13. logprobs 的应用场景,置信度评估与分类任务的软标签输出? A logprobs 只能用于展示 B logprobs 用于置信度评估(拒答/复核/升级)与分类软标签(概率分布),但作为置信信号而非正确性指标 ✓ 正确答案 C logprobs 恒等于正确率 D 软标签只能硬选一个
# 14. beam search 与采样为何很少同时暴露在商用 API 中,自部署场景下两者的实现成本与适用场景有何差异? A 商用 API 会同时暴露 beam search 与采样 B beam search 计算最轻 C 采样必然重复 D beam search 确定但计算重、采样多样但随机,API 多只暴露采样,自部署可按任务选 ✓ 正确答案
# 15. seed 参数如何用于可复现生成与回归测试? A seed 与版本无关,任意环境可复现 B seed 只在生成时有效,与回归无关 C 固定 seed 即绝对复现 D seed 固定随机源使同请求(同版本+同参数)可复现,用于可复现生成与回归测试,但跨版本不保证 ✓ 正确答案
# 16. 流式输出(stream)下如何结合解码参数做前端增量渲染与中断恢复? A 解码参数与流式无关 B 流式前端必须整段渲染,无需增量 C 流式中断无法恢复 D 流式前端做缓冲拼接与增量渲染,结合低温度稳采样,中断时用已生成内容回填续写恢复 ✓ 正确答案
# 17. 多模态生成(图像/语音)的解码参数(采样步数、引导系数、温度)与文本参数应如何分别治理与回归 A 图像与文本用同一套解码参数 B 采样步数不影响图像质量 C 多模态参数(步数/引导/温度)与文本参数分开治理,各自 schema 与评估集,单独回归 ✓ 正确答案 D 多模态无需回归
# 18. 解码参数如何随模型版本演进重新校准,参数失效导致的质量漂移应如何监控 A 模型升级后参数可能失效,需用评估集重新校准,并监控质量指标漂移 ✓ 正确答案 B 旧参数在新版本永远有效 C 参数不随模型版本变化 D 参数无需监控
# 19. 同一参数在不同 Provider/API 上的语义差异(如 temperature 的默认值与作用范围)应如何通过契约测试对齐 A 同一参数在所有 Provider 语义相同 B 契约测试无法处理参数差异 C temperature 默认值各处相同 D 参数跨 Provider 的默认值/作用范围不同,用契约测试锁定"统一参数到各 Provider 参数"的映射与语义 ✓ 正确答案
# 20. 批量与离线推理的解码参数,批处理场景下如何统一参数、处理截断与重试,与在线推理的差异? A 批量不能重试 B 离线与在线推理参数与策略完全相同 C 批处理统一参数、延迟不敏感可扩展重试与折扣;在线即时响应、参数按实时预算,两者策略不同 ✓ 正确答案 D 离线也需极低延迟