# 1. 如何基于质量、首 Token 延迟、总延迟与成本选择通用模型或推理模型 A 推理模型在任何任务上都优于通用模型,应无条件优先使用 B 推理模型通过消耗更多思考 token 换取复杂任务准确率,但 TTFT 与成本更高,应结合任务类型与预算路由 ✓ 正确答案 C 通用模型延迟低、成本低,适合复杂多步推理任务 D 首 Token 延迟只影响成本,不影响用户体验
# 2. 如何设计 Provider 适配层,同时保留 OpenAI Responses、Anthropic Messages 与 Gemini generateContent 的差异化能力 A 能力矩阵只用于文档描述,不参与运行时决策 B 适配层应只保留所有 Provider 共有的字段,保证最低公分母 C 私有能力无法与统一抽象共存,必须全部丢弃 D 统一抽象负责可移植性,扩展透传通道保留私有能力,能力矩阵用于运行时协商与降级 ✓ 正确答案
# 3. 一条包含 system、user、assistant、tool 消息的请求从前端到模型再返回,完整生命周期和责任边界是什么 A 工具调用是"assistant 请求 -> 业务执行 -> tool 回填 -> 再次调用"的循环,每层职责分明,网关负责路由与限流 ✓ 正确答案 B system 消息由前端提供,user 消息由业务服务注入 C 工具调用只需一次请求即可完成,无需循环 D 审计责任应交给前端,负责展示 prompt
# 4. OpenAI Responses API、Anthropic Messages 与 Gemini generateContent 在多轮对话状态、缓存键和工具调用上下文上有什么不兼容设计,跨 Provider 抽象如何避免双计费与状态错位 A 三个 Provider 的工具调用消息格式完全一致,可直接复用 B 统一会话视图 + 幂等逻辑 id 可避免 Failover 时状态错位与重复计费,各 Provider 工具 id 由适配器映射 ✓ 正确答案 C 缓存键在不同 Provider 之间天然互通,可直接复用 D 工具调用没有 id 概念,无需映射
# 5. 同步、流式、异步任务与批处理分别适合哪些业务,取消和结果领取协议应如何设计 A 所有业务都应使用同步调用,保证简单 B 流式模式适合离线批量任务 C 异步任务用 task_id + 状态轮询/Webhook 领取结果,取消需幂等并向 Provider 发真正的中止请求 ✓ 正确答案 D 异步任务取消后无需停掉 Provider 侧生成
# 6. 如何通过模型网关、能力矩阵和契约测试实现 Provider 可替换,而不是只做“最低公分母”封装 A 网关统一入口 + 能力矩阵协商 + 契约测试锁定转换,可在不丢私有能力的前提下实现 Provider 可替换 ✓ 正确答案 B 可替换性要求所有 Provider 能力完全一致 C 契约测试只用于前端 UI,不作用于 Provider 适配 D 能力矩阵是运行时唯一依据,无需网关
# 7. 模型调用中的超时、重试、幂等、断路器、隔离与降级如何协作,哪些错误绝不能盲目重试 A 401/403/400 等业务 4xx 错误不应盲目重试,重试应区分可重试(限流、5xx)与不可重试,并与幂等、断路器、降级协作 ✓ 正确答案 B 所有错误都应无条件重试,直到成功 C 断路器与隔离是相互替代的,只用其一即可 D 重试不需要幂等支持
# 8. 模型快照弃用(snapshot deprecation)与下线(shutdown)时,应用应如何提前迁移并平滑过渡到新快照? A 应用应引用模型别名并建立弃用监控,在弃用窗口内用影子流量与灰度验证后平滑迁移到新快照 ✓ 正确答案 B 写死快照 ID 最安全,弃用后可临时改代码 C 弃用任何时间原地切换即可,无需验证 D 快照弃用对应用无影响,无需处理
# 9. 私有部署、开源权重与商用 API 在 SLA、合规、可观测性、可控参数和故障责任上如何做选型矩阵 A 商用 API 在可控参数上最强,可调一切参数 B 三种形态的可观测性无差异 C 私有部署无需考虑 SLA 与高可用 D 私有部署在合规、可观测性、可控参数上最强,但 SLA 与故障责任需自担 ✓ 正确答案
# 10. Function Calling 中并行调用与顺序依赖在 Responses、Anthropic、Gemini 上是否被同等支持,如何在抽象层表达依赖图 A 三个 Provider 都支持同一轮返回多个工具调用(并行),但顺序依赖需应用层用多轮消息回填结果来表达 ✓ 正确答案 B 顺序依赖是 Provider 原生特性,应用无需处理 C 并行调用在所有 Provider 上都不支持 D 工具结果无需回填,模型能自己记住
# 11. 如何在启动期和运行期探测视觉、工具调用、结构化输出等能力,并应对 API 版本漂移 A 启动期探测一次即可,运行期无需再校验 B 能力探测应结合启动期声明与运行期校验,并对能力缓存带版本号,漂移时降级兜底 ✓ 正确答案 C 能力漂移无法处理,只能人工介入 D 结构化输出失败时无需降级
# 12. 多 Provider Failover 切换时,在途会话状态(消息序列、工具调用上下文)应如何转换为目标 Provider 的消息格式,防止状态错位与重复计费 A Failover 时应把 Provider A 的原始消息原样发给 Provider B B Failover 必然导致重复计费,无法避免 C 工具调用上下文无需保留,直接丢弃 D 统一会话视图 + 目标适配器重序列化 + 幂等键,可防止状态错位与重复计费 ✓ 正确答案
# 13. 模型 API 配额(RPM/TPM/并发)的容量规划应如何从业务峰值推算,并为重试与流式长连接预留余量 A 并发数等于每秒请求数,无需考虑流式时长 B 容量规划应从业务峰值推算 RPM/TPM/并发,并为重试、流式长连接与突发预留余量 ✓ 正确答案 C 峰值流量与配额规划无关 D 流式长连接不占用连接资源
# 14. Qwen3 Hybrid Thinking、Anthropic Extended Thinking、OpenAI reasoning effort 等思考控制为何不能使用统一固定参数 A 各 Provider 思考控制是不同维度(开关/预算/档位),应抽象"思考强度语义"再由适配器映射到原生参数 ✓ 正确答案 B 思考控制不影响计费与输出 C 所有 Provider 的思考控制都是同一参数,可用统一固定值 D 思考档位只影响延迟,不影响成本
# 15. 为何在 spec 文件中写死带日期后缀的模型快照 ID(如 gpt-4o 的旧快照、preview 版本)是危险做法,模型别名加版本范围策略应如何设计 A 写死带日期快照 ID 最安全,弃用后改代码即可 B 业务应引用语义别名,由平台维护别名到快照的映射并设版本范围,弃用后平滑迁移 ✓ 正确答案 C preview 版本与稳定版完全等价 D 版本范围策略无必要
# 16. 如何建立"模型能力评估卡",推理、指令遵循、多轮一致性、幻觉率如何量化对比? A 评估卡只需测试一个维度 B 能力评估可以凭印象打分,无需固定评估集 C 幻觉率无法量化,只能定性 D 评估卡用固定评估集 + 固定评测脚本量化准确率、指令遵循率、一致性、幻觉率,用于对比与漂移跟踪 ✓ 正确答案
# 17. 账单核对与单任务成本归集应如何补偿 A 重试无需归并到同一任务 B 成本归集按单次请求即可,无需聚合 C 缓存命中不影响成本归集 D 成本归集应提升到任务级,并对缓存命中、重试等差异做对账与补偿归因 ✓ 正确答案
# 18. Provider 区域实例(region/data residency)如何与可用区、Tier、价格、速率限制相关联,应用层是否需要做实例选择 A region 只影响延迟,与价格、限流、合规无关 B 应用层必须硬编码具体实例 C region 关联数据驻留、价格、限流与延迟,应用层应声明约束(如 region 白名单)而由网关做实例选择 ✓ 正确答案 D region 与合规无关
# 19. 当多种消息类型组合处理时,应用层应怎样设计优先级与防"p99 突增"机制 A 所有消息类型共用同一队列最公平 B p99 突增无法避免 C 按类型/租户建优先级队列 + 并发池隔离 + 显式超时,并把低优先级与实时隔离,才能防 p99 突增 ✓ 正确答案 D 低优先级应优先于实时请求
# 20. 如何在路由层抽象不同推理深度参数,避免下游业务硬编码 A 档位映射与业务耦合才最灵活 B 业务应直接硬编码 temperature 等参数 C 推理深度参数不集中也无需管理 D 路由层抽象"质量/思考/速度"语义档位并映射到具体模型与参数,业务只声明档位,避免硬编码 ✓ 正确答案
# 21. 如何把 system、user、assistant、tool 四类消息的拼接顺序固化为契约,防止跨版本回归 A 契约测试只用于前端 B 消息顺序随意,只需保证存在即可 C 顺序不影响缓存与质量 D 用统一构造器 + 契约测试把四类消息顺序固化为不变量,防止跨版本回归 ✓ 正确答案
# 22. 推理模型隐藏 thinking 字段时,应用层怎样反向估算真实成本并按租户透明分摊 A 思考成本无需分摊 B 隐藏 thinking 字段时无法估算,只能按输入输出计费 C 用总 usage 与可见 token 差额结合采样校准估算思考成本,并按租户分摊且透明标注为估算值 ✓ 正确答案 D 估算值可直接当精确值披露
# 23. Provider 快照弃用公告应如何自动捕获并触发内部影子流量验证,避免上线即崩 A 新快照上线无需验证 B 弃用公告人工关注即可,无需自动化 C 影子流量验证无必要 D 自动捕获弃用公告并触发影子流量验证,设置质量阈值门禁,验证通过才灰度切换 ✓ 正确答案
# 24. Region 实例与可用区差异如何影响跨区域灾备,应用应缓存何种元数据 A region 与可用区与灾备无关 B region 决定数据驻留与合规,可用区是 region 内容错单元;应用应缓存 region 可用性、配额、价格、驻留约束等元数据并处理失效 ✓ 正确答案 C 元数据缓存无需失效策略 D 灾备只需切换 DNS,无需关心数据驻留
# 25. Failover 后原 Provider 的缓存键失效与未出账用量应如何补偿核算,并在租户账单中透明呈现 A Failover 需按逻辑任务归并成本,区分缓存失效成本与未出账用量,并在租户账单中透明披露 ✓ 正确答案 B 未出账用量无需记录 C 缓存失效成本无法核算 D Failover 不影响缓存与成本核算
# 26. 突发流量逼近配额上限时,请求排队与直接降级小模型的优先级、队列长度上限和用户告知应如何设计 A 突发时所有请求都排队最公平 B 按优先级分流:低优先级降级、高优先级有限排队(设长度与超时上限),并透明告知用户降级或等待 ✓ 正确答案 C 队列无限长最安全 D 降级无需告知用户
# 27. 异步任务取消协议应设计哪些幂等字段,避免 Provider 重复计费 A 取消无需幂等,直接发请求即可 B 取消后 Provider 仍会继续计费,无法停止 C 取消协议应含 task_id、幂等键与状态机,保证重复取消结果一致,并确认 Provider 真正停止计费 ✓ 正确答案 D 幂等字段只用于账单,不用于取消
# 28. Provider 引入新的 reasoning effort 时,老业务路由规则如何自动重新校验 A 新 reasoning effort 出现后老路由规则自动失效,无需处理 B 新档位应触发路由表重校验,经契约测试、回归、影子流量与灰度门禁验证后才允许引用 ✓ 正确答案 C 新档位无需验证即可直接使用 D 路由规则一经定义永不变化
# 29. 跨 Provider 抽象层如何保留 OpenAI Web Search 与 Anthropic Citations 私有能力 A 用扩展透传通道 + 能力矩阵保留 OpenAI Web Search、Anthropic Citations 等私有能力,不支持的 Provider 降级 ✓ 正确答案 B 私有能力只影响前端,后端无需处理 C 能力矩阵与透传无关 D 私有能力无法在统一抽象中保留,必须丢弃
# 30. 推理参数 temperature 和 seed 如何联合控制,避免“看似复现其实漂移” A 固定 temperature 即可保证复现 B 复现只由 seed 决定,与 temperature 无关 C seed 不依赖模型版本 D temperature 与 seed 需联合固定并绑定模型版本,用重复采样验证一致性,才能避免看似复现其实漂移 ✓ 正确答案
# 31. 多模态内容块的压缩策略如何区分图像质量与音频采样率,避免资费放大 A 图像与音频都用同一压缩规则即可 B 多模态 token 与内容尺寸无关 C 压缩只会损失质量,没有收益 D 图像按分辨率/任务细节压缩、音频按采样率/时长处理,按能力需求降采样以避免 token 放大 ✓ 正确答案
# 32. Provider 健康检查应做成被动还是主动,如何避免给 Provider 增加额外压力 A 应高频主动探测所有 Provider B 主动探活不会消耗任何资源 C 以被动健康检查(真实请求统计)为主,低频轻量主动探测为辅,避免给 Provider 增加压力 ✓ 正确答案 D 健康检查只用于展示,不影响路由
# 33. 多模型供应商接入时如何做统一的协议抽象与灰度切换? A 接入新供应商只需改业务代码 B 灰度切换无需监控 C 统一协议抽象(适配器+能力矩阵+契约测试)保证可切换,灰度分流+监控+自动回滚保证切换安全 ✓ 正确答案 D 切换不可回滚
# 34. 模型 API 的限流、配额与超时重试策略如何设计,如何区分可重试与不可重试错误? A 所有错误都重试,直到成功 B 429 应无限重试 C 超时无需设置 D 限流配额+分层超时+指数退避重试,只重试瞬时错误(429/5xx/网络),401/400 等业务错误不可重试 ✓ 正确答案
# 35. 多模态输入的内容引用方式(base64 data URI 与远程 URL)在计费、隐私与 SSRF 风险上的差异,以及大文件上传的工程取舍? A base64 与 URL 在隐私与安全上完全等价 B URL 无任何安全风险 C 大文件应无条件用 base64,体积无所谓 D base64 内嵌保隐私但请求体大,URL 省体积但引入 SSRF 与隐私风险,大文件需按隐私与大小权衡(分段上传或私有存储 URL) ✓ 正确答案
# 36. Provider 调整计费字段或账单格式时,账单核对脚本应如何同步升级并回归验证 A 账单格式变更无需处理,脚本自动兼容 B 账单解析与对账应版本化,用新旧格式 golden 用例回归,并感知 Provider 变更公告,避免静默对账错误 ✓ 正确答案 C 字段缺失时静默忽略即可 D 账单格式不会变
# 37. 模型能力快照如何抽象为版本化契约文件,让 CI 持续校验 Provider 公告 A 能力快照只用文档描述,无需版本化 B CI 无法校验能力公告 C 能力快照抽象为版本化契约文件,CI 拉取 Provider 公告比对并校验,处理能力变更与弃用 ✓ 正确答案 D 契约文件与业务代码无关
# 38. 多模态(图像、音频、视频、文件)调用如何统一抽象为消息内容块,并控制不同 Provider 的尺寸、压缩与计费策略 A 各模态应各自独立建模,不做统一抽象 B 多模态无法统一抽象 C 统一抽象为 ContentBlock,由适配器按各 Provider 的尺寸/压缩/计费规则处理,任务所需最小资源避免成本放大 ✓ 正确答案 D 计费与尺寸无关
# 39. 如何验证 stream 选项是否在所有端点上对称支持,尤其是 Files、Batches、Realtime 与异步任务入口 A 用端点能力矩阵 + 契约测试 + 运行时校验,显式验证各端点(Files/Batches/Realtime/异步)对 stream 的支持粒度 ✓ 正确答案 B 所有端点都天然支持 stream C stream 只与文本端点相关 D 批量任务支持逐 token 流式
# 40. 如何评估国产模型与国际模型在中文场景下的性价比与生态差异? A 合规与部署不影响选型 B 只看单价即可判断性价比 C 中文场景与英文场景无差异 D 用统一中文评估集计算"单位质量成本",并结合生态、合规、数据驻留、延迟做综合评估 ✓ 正确答案
# 41. Embedding 接口的接入细节,dimensions 参数、批量上限、输入截断与向量归一化对检索质量与成本的影响? A 归一化与相似度比较无关 B dimensions 越大越好,无需考虑成本 C 输入截断不影响检索质量 D Embedding 接入需考虑维度匹配、批量上限、语义分段(避免硬截断)与向量归一化,兼顾检索质量与成本 ✓ 正确答案