推理参数与解码策略

共 20 题
#

1. temperature、top_p、top_k 的作用机理与联合调参,不同任务(代码生成/创意写作/结构化抽取)的推荐配置?

A temperature 越高越确定
B 所有任务都该用最高 temperature
C 三个参数互不影响,单独调即可
D temperature 控随机性、top_p 去长尾、top_k 硬截断,代码/结构化用低值、创意用高值,联合调参 ✓ 正确答案
#

2. max_tokens、stop 序列与截断处理,输出被截断的检测与续写策略?

A 用 finish_reason 区分截断(length)与正常结束(stop),length 截断用续写回填上下文处理并设轮次上限 ✓ 正确答案
B max_tokens 绝不截断,只会正常结束
C stop 序列会导致截断需续写
D 无法检测截断
#

3. repetition_penalty 与 frequency_penalty 的机制差异,前者对已出现 token 施加固定惩罚,后者按出现次数累加惩罚——各自适合什么场景?过度惩罚会导致什么退化?

A 两种惩罚机制相同
B repetition_penalty 固定惩罚适合抑制机械重复,frequency_penalty 累加惩罚适合控高频重复,过度惩罚会致词穷与表达异常 ✓ 正确答案
C 频率惩罚不累加
D 惩罚越强越好
#

4. min_p 采样策略的原理,相比 top_p 的动态阈值,min_p 设定基于最高概率 token 的绝对下限比例,为何在某些模型上效果优于 top_p?

A top_p 与 min_p 机制完全相同
B min_p 阈值与最高概率无关
C min_p 效果总是差于 top_p
D top_p 按累计比例动态截断、min_p 按相对最高概率的绝对下限截断,min_p 在稳定排除低概率 token 上更稳健 ✓ 正确答案
#

5. 结构化输出的约束解码(grammar-based sampling,如 GBNF/JSON Schema)与 Provider 原生 Structured Outputs 在格式保证、延迟与成本上有何差异,如何选型

A 约束解码与原生 Structured Outputs 完全相同
B 约束解码无法保证格式
C 约束解码自建可控适合自部署,原生 Structured Outputs 省事内置依赖 Provider,按部署形态与成本选型 ✓ 正确答案
D 原生 Structured Outputs 总是免费
#

6. 结构化输出(JSON Mode/Function Calling)与解码约束如何结合减少格式错误?

A 约束解码无法与 JSON Mode 结合
B 约束解码在解码阶段强制 schema 合法,JSON Mode/Function Calling 定义结构,结合后格式错误被消除,只留语义校验 ✓ 正确答案
C 约束解码会破坏 JSON 结构
D 格式错误只能靠重试
#

7. 流式输出与解码参数的交互,不同参数组合下流式增量输出的稳定性如何评估(半截 token、重复段、截断恢复)

A 流式增量一定是完整 token
B 流式需处理半截 token(缓冲拼接)、重复段(采样控制)、截断恢复(回填续写),并评估参数组合下的稳定性 ✓ 正确答案
C 高 temperature 不会引起流式重复
D 流式截断无法恢复
#

8. 结构化任务(抽取、分类、JSON 生成)中 temperature/top_p 的推荐区间应如何用评估集确定,而不是凭经验

A 参数凭经验即可,无需评估
B 用评估集做参数网格搜索,测结构化任务指标,选准确率高且稳定的 temperature/top_p 区间 ✓ 正确答案
C 所有结构化任务都用 temperature=1
D 评估集无法用于调参
#

9. temperature 设为 0 是否保证完全确定性输出,为什么同一请求仍可能返回不同结果,如何用 seed 与固定参数提升可复现性?

A temperature=0 不保证确定(实现/版本/后端引入差异),用 seed+固定参数+版本+缓存提升可复现性 ✓ 正确答案
B 固定 seed 即可绝对复现
C 后端升级不影响输出
D temperature=0 保证完全确定
#

10. logit_bias 的工程应用,如何用 token 级偏置修正模型在特定符号/格式上的输出习惯,其限制与风险?

A logit_bias 是语义级约束
B logit_bias 按 token 加偏置修正格式/术语,但限制在 token 级、需维护 token id 映射、过度偏置伤流畅性 ✓ 正确答案
C logit_bias 无任何风险
D 一个词总是单个 token,无需维护映射
#

11. max_tokens 与输出长度的成本关系,输出 token 计费与缓存的影响,如何用 max_completion_tokens 控制成本与延迟?

A 输出越长成本越高,用 max_tokens/max_completion_tokens 限制输出上限(含思考 token)控制成本与延迟 ✓ 正确答案
B max_completion_tokens 不含思考 token
C 输出长度不影响成本
D 输出超长无任何影响
#

12. 解码参数与评测的配合,为什么回归评测必须固定 seed/参数/模型版本,参数漂移如何污染对比实验?

A 评测无需固定参数,只看结果
B 回归评测必须固定 seed/参数/模型版本,否则参数漂移使输出差异无法归因,污染对比实验 ✓ 正确答案
C 评测只需固定 seed
D 参数漂移不影响评测
#

13. logprobs 的应用场景,置信度评估与分类任务的软标签输出?

A logprobs 只能用于展示
B logprobs 用于置信度评估(拒答/复核/升级)与分类软标签(概率分布),但作为置信信号而非正确性指标 ✓ 正确答案
C logprobs 恒等于正确率
D 软标签只能硬选一个
#

14. beam search 与采样为何很少同时暴露在商用 API 中,自部署场景下两者的实现成本与适用场景有何差异?

A 商用 API 会同时暴露 beam search 与采样
B beam search 计算最轻
C 采样必然重复
D beam search 确定但计算重、采样多样但随机,API 多只暴露采样,自部署可按任务选 ✓ 正确答案
#

15. seed 参数如何用于可复现生成与回归测试?

A seed 与版本无关,任意环境可复现
B seed 只在生成时有效,与回归无关
C 固定 seed 即绝对复现
D seed 固定随机源使同请求(同版本+同参数)可复现,用于可复现生成与回归测试,但跨版本不保证 ✓ 正确答案
#

16. 流式输出(stream)下如何结合解码参数做前端增量渲染与中断恢复?

A 解码参数与流式无关
B 流式前端必须整段渲染,无需增量
C 流式中断无法恢复
D 流式前端做缓冲拼接与增量渲染,结合低温度稳采样,中断时用已生成内容回填续写恢复 ✓ 正确答案
#

17. 多模态生成(图像/语音)的解码参数(采样步数、引导系数、温度)与文本参数应如何分别治理与回归

A 图像与文本用同一套解码参数
B 采样步数不影响图像质量
C 多模态参数(步数/引导/温度)与文本参数分开治理,各自 schema 与评估集,单独回归 ✓ 正确答案
D 多模态无需回归
#

18. 解码参数如何随模型版本演进重新校准,参数失效导致的质量漂移应如何监控

A 模型升级后参数可能失效,需用评估集重新校准,并监控质量指标漂移 ✓ 正确答案
B 旧参数在新版本永远有效
C 参数不随模型版本变化
D 参数无需监控
#

19. 同一参数在不同 Provider/API 上的语义差异(如 temperature 的默认值与作用范围)应如何通过契约测试对齐

A 同一参数在所有 Provider 语义相同
B 契约测试无法处理参数差异
C temperature 默认值各处相同
D 参数跨 Provider 的默认值/作用范围不同,用契约测试锁定"统一参数到各 Provider 参数"的映射与语义 ✓ 正确答案
#

20. 批量与离线推理的解码参数,批处理场景下如何统一参数、处理截断与重试,与在线推理的差异?

A 批量不能重试
B 离线与在线推理参数与策略完全相同
C 批处理统一参数、延迟不敏感可扩展重试与折扣;在线即时响应、参数按实时预算,两者策略不同 ✓ 正确答案
D 离线也需极低延迟