# 1. Reasoning/Thinking Model(o1/o3、Claude 3.7 Sonnet Extended Thinking、DeepSeek-R1)的工程影响,推理计算(test-time compute)增大、链式思考(CoT)可观测、复杂任务质变与延迟预算冲突? A 推理模型通过增大测试时计算提升复杂任务质量,但会增加延迟与成本,需按任务复杂度路由 ✓ 正确答案 B 推理模型对所有任务都优于标准模型,应一律使用 C 推理模型不会产生任何额外 token,成本与标准模型相同 D 推理模型的 CoT 思考过程不可观测,无法用于调试
# 2. 推理模型(Reasoning)的 CoT 与测试时计算,长思考的代价与收益? A 思考越长,正确率一定越高,无副作用 B 长思考不消耗额外 token,成本为零 C 长思考收益呈边际递减,且带来延迟与成本上升,需控制思考预算 ✓ 正确答案 D 简单任务也应使用最长思考级别以获得最佳效果
# 3. 思考循环与失败模式,推理模型陷入重复思考或循环时如何检测与终止? A 循环无需处理,模型自己会恢复 B 循环思考只浪费时间不消耗 token,无需在意 C 检测到循环后继续生成并等待更长时间即可 D 应设置步数上限并监测思考内容的重复度与进展信号,触发后停止并降级兜底 ✓ 正确答案
# 4. 长思考场景对推理服务的吞吐与延迟提出了什么新要求?选择托管 API 与自部署推理服务时应分别评估哪些服务级指标(吞吐、首字延迟、并发、成本)? A 只需关注总 token 数,无需关注并发与吞吐 B 应评估首字延迟、吞吐、并发与成本,托管 API 与自部署的评估重点不同 ✓ 正确答案 C 自部署推理服务无需关注显存与批处理策略 D 托管 API 可完全控制并发与吞吐
# 5. Hybrid Model(统一对话/推理/工具调用)的出现(如 Claude 3.7、GPT-4.5、Qwen3)对 Prompt 工程与工具调用的影响? A 混合模型消除了思考与直答的差异,无需任何配置 B 混合模型仍必须通过更换模型才能切换思考模式 C 混合模型无法调用工具 D 混合模型把模式选择从"架构层"下沉到"参数/提示层",简化了多模型拼接 ✓ 正确答案
# 6. 开源 Reasoning Model(DeepSeek-R1、QwQ、Phi-4-Reasoning)与闭源旗舰的能力差距收敛,私有化部署推理模型的工程决策? A 应实测质量差距并核算 TCO 与合规收益,再决定私有化或托管 API ✓ 正确答案 B 开源推理模型永远无法与闭源相比,不应部署 C 私有化部署无需考虑硬件与运维成本 D 闭源 API 永远更便宜
# 7. 测试时计算的代价,推理 token 翻倍的成本控制? A 推理 token 不计费,无需控制 B 所有任务都应使用高 effort 以最大化质量 C 只有关闭推理模型才能节省成本 D 应按任务难度设置 effort 档位,并配合缓存、超时与监控控制成本 ✓ 正确答案
# 8. 推理模型的长 CoT 与预算控制,reasoning effort 参数? A effort 越高,速度越快 B effort 控制思考预算,需按任务难度映射档位并对高价值任务用高档,同时设硬上限 ✓ 正确答案 C effort 与 token 成本无关 D 所有模型都支持统一 effort 语义,无需测试
# 9. 推理模型的评测,数学/代码/规划基准、思考质量(冗余、错误中间步骤)与成本效率如何度量? A 只需看最终正确率即可 B 成本与评测无关 C 思考过程无需评测,无意义 D 应同时度量正确率、思考冗余度/错误中间步骤与成本效率(正确率/成本) ✓ 正确答案
# 10. 新一代推理模型对应用设计的重塑,思考型模型在延迟、成本与任务可靠性上的新权衡如何评估,什么任务值得引入推理模型而什么任务应保持快模型直答? A 所有任务都应用推理模型以保证可靠性 B 应把深度思考作为按需能力,对复杂任务用推理模型、简单任务直答,并建立路由与降级机制 ✓ 正确答案 C 推理模型只能用于离线任务 D 应用设计无需考虑推理模型的延迟与成本
# 11. Small Language Model(SLM, 1B-7B)在端侧 + 云侧混合架构的角色,意图分类、路由、本地 PII 处理? A SLM 应取代所有云侧大模型 B SLM 适合做意图分类、路由与本地 PII 处理,形成"端侧快、云侧强"的分层架构 ✓ 正确答案 C SLM 无法进行任何推理,只能做文案 D SLM 的延迟比云端大模型更高
# 12. 端到端多模态模型 API(视觉+语音+文本+工具,如 GPT-4o、Qwen2.5-Omni)与传统 STT/TTS 拼接方案在延迟、质量、成本与可控性上如何取舍? A 拼接方案延迟更低、语义更连贯 B 端到端方案无法处理语音 C 端到端方案延迟低、上下文连贯但可控性较弱,拼接方案环节可控但错误会传播,需按场景取舍 ✓ 正确答案 D 拼接方案成本必然最高
# 13. 下一代模型的工程适配,API 变化与能力边界? A 模型升级后应用无需任何改动 B 应通过统一网关抽象 API、版本快照支持回滚、用自有评测界定能力边界并灰度放量 ✓ 正确答案 C 新模型能力一定覆盖旧模型,无需降级 D API 变化无法提前规避,只能被动应对
# 14. 推理模型的 API 差异,reasoning_effort 等参数? A 所有厂商的思考参数完全相同 B 切换模型无需回归测试思考行为 C 思考参数不影响计费 D 不同厂商参数语义与结构不同,应在网关层归一化思考强度并统一解析思考字段 ✓ 正确答案
# 15. 推理模型的评测,正确率 vs 效率的平衡? A 只需关注正确率,效率无关紧要 B 应分场景设定正确率门槛与延迟/成本上限,并用综合指标比较模型的性价比 ✓ 正确答案 C 效率完全由模型决定,无法优化 D 正确率与效率不存在任何关联
# 16. 推理模型的 UX 适配,思考阶段的可视化、进度提示、超时取消与用户等待预期管理? A 思考阶段应保持静默,避免干扰用户 B 应通过思考动效、进度提示、超时取消与预期管理降低等待焦虑,并支持取消降级 ✓ 正确答案 C 用户不应看到任何思考进程 D 长思考无需任何 UX 处理
# 17. 应用如何根据任务类型路由到推理模型、标准模型与小模型,以平衡质量与成本? A 所有请求都应发给最强的推理模型 B 路由策略一次配置即可,无需校准 C 应按任务价值分级,用 SLM 分类路由、置信度门控,低质量升级、高成本降级 ✓ 正确答案 D 小模型无法处理任何任务
# 18. 推理模型返回的思考过程(thinking)如何与最终答案分离、存储与计费归集? A 应分离思考与答案字段,思考独立脱敏存储供审计,并按 token 分别归集计费 ✓ 正确答案 B 思考与答案无需区分,直接拼接展示 C 思考 token 不计费 D 思考过程不应存储,以免占用空间
# 19. 推理模型的长输出对超时、重试与流式中断处理提出了哪些新要求? A 应采用分阶段超时、区分可重试错误、限制重试次数并支持中断恢复与降级 ✓ 正确答案 B 固定超时即可,无需调整 C 思考中断不影响答案质量,无需处理 D 重试次数越多越好,无需限制
# 20. 思维链安全,CoT 可能泄露隐藏推理或敏感信息时,展示、存储与日志脱敏如何取舍? A 应默认不向用户展示原始思考,思考内容脱敏存储、受控访问,日志只记录元数据 ✓ 正确答案 B CoT 应直接展示给所有用户 C 思考内容与普通答案一样随意记录即可 D CoT 不存在任何泄露风险