# 1. DeepSeek-V3/R1、Qwen3、Llama 4 等开源模型在自部署场景的选型维度,许可证、显存预算、输出质量与运行成本、生态工具链与运维门槛如何评估? A 开源模型选型只看质量,其他无关 B 所有开源模型许可证都允许任意商用 C 显存与选型无关 D 需综合许可证、显存预算、质量与成本、生态工具链、运维门槛多维评估,结合业务约束选型 ✓ 正确答案
# 2. 私有化部署与调用商业 API 的 TCO(总拥有成本)对比模型,什么流量规模下自建推理更划算? A API 一定比自建便宜 B 自建一定比 API 便宜 C 自建高固定成本低单位成本,API 零固定高单位;流量大且稳定自建划算,低流量 API 划算,按总成本/总 token 找平衡点 ✓ 正确答案 D 流量与 TCO 无关
# 3. Ollama/llama.cpp 在开发与边缘场景的定位与生产化差距? A Ollama 可直接用于生产高并发 B Ollama 支持完整生产级可观测 C Ollama/llama.cpp 适合开发与边缘,生产化缺并发吞吐、高可用、可观测与治理,需迁移或补齐 ✓ 正确答案 D 开发工具与生产无缝
# 4. 开源模型许可证(Apache/Llama/MIT)与商用限制(如 Meta 用户规模条款)如何审查? A 所有开源模型都允许无限商用 B Llama 与 Apache 限制完全相同 C 许可证无需审查 D 需逐条审查商用许可、规模上限、用途限制、分发与训练条款,Apache/MIT 宽松、Llama 有限制,并设合规门禁 ✓ 正确答案
# 5. 本地推理的框架选择,vLLM/SGLang/llama.cpp 的吞吐与显存差异? A 三个框架吞吐与显存完全相同 B vLLM/SGLang 面向高吞吐生产(PagedAttention/RadixAttention、continuous batching),llama.cpp 面向轻量边缘,按场景选择 ✓ 正确答案 C llama.cpp 吞吐最高 D SGLang 不支持前缀复用
# 6. 开源模型的内网离线分发,Hugging Face 镜像、模型文件完整性校验(sha256/签名)与私有 registry 在隔离网络的部署流程? A 离线部署无需校验模型文件 B 私有 registry 无法管理版本 C 用镜像获取 + sha256/签名校验完整性 + 上传私有 registry + 内网拉取,全程版本管理保证可追溯 ✓ 正确答案 D 模型文件无需校验即可分发
# 7. 自部署推理服务的容量规划,按 QPS、输入/输出 Token 与并发要求如何推算所需 GPU 卡数与显存,弹性扩容与缩容策略如何设计 A 按权重+KV Cache+余量算显存、按吞吐需求算卡数,用利用率/队列/延迟信号做弹性扩缩容 ✓ 正确答案 B 只需算显存,吞吐无关 C 卡数只由参数量决定 D 弹性扩容无需信号
# 8. 模型量化与显存/吞吐,FP16/INT8/INT4 与 AWQ/GPTQ/GGUF 量化对显存占用、生成质量与吞吐的影响,量化误差在长上下文下如何放大? A 量化越低显存越小吞吐越高但质量下降,AWQ/GPTQ 感知量化优于裸 INT4,长上下文下量化误差会放大 ✓ 正确答案 B 量化越低质量越差,但显存越高 C INT4 质量与 FP16 相同 D 长上下文不受量化影响
# 9. 推理服务的并发与延迟指标,TTFT、TPOT、首 token 与尾 token 延迟如何测量与优化,并发度与 GPU 利用率的关系? A TTFT 管首 token 延迟(prefill),TPOT 管每 token 生成(decode),用分位数监控并平衡并发与 GPU 利用率 ✓ 正确答案 B TTFT 反映 decode 速度 C 并发越高越好,无需上限 D 总延迟与 TTFT 无关
# 10. 多卡部署与并行策略,张量并行(TP)与数据并行(DP)在推理场景的取舍,流水线并行何时引入? A 所有情况都用数据并行 B 单卡放不下用张量并行,吞吐不足用数据并行,模型极大且 TP 通信受限时引入流水线并行 ✓ 正确答案 C 流水线并行只用于小模型 D 张量并行无通信开销
# 11. 自部署模型的输入输出治理,内容安全过滤(moderation)、敏感词与越狱防护在本地推理链路上如何实现,与云端 API 的差异? A 本地部署无需内容治理 B 本地用词表、规则、本地审核模型自建输入输出治理,可控可定制但需维护;云端 moderation 内置但不可定制 ✓ 正确答案 C 本地治理与云端完全相同 D 越狱防护只在云端有效
# 12. 端侧/边缘 vs 云侧推理的分流策略,延迟、隐私与成本如何权衡? A 所有任务都用云侧最强 B 端侧模型能力与云侧相同 C 按任务/隐私/成本分流:端侧保延迟隐私、云侧保能力,混合架构让端侧轻任务、云侧复杂任务 ✓ 正确答案 D 隐私与分流无关
# 13. 开源模型与闭源 API 的混合架构,本地敏感数据 + 云端强模型? A 脱敏后仍无法保隐私 B 混合架构必须把原始敏感数据上传云端 C 云端强模型无法与本地数据结合 D 本地敏感数据先脱敏/预处理,只把脱敏结果发云端强模型,云端不可用时本地降级 ✓ 正确答案
# 14. 单卡多模型共存与冷热加载,多模型常驻显存 vs 按需加载对延迟、显存碎片与命中率的取舍? A 所有模型常驻显存最优 B 热模型常驻保延迟命中、冷模型按需加载省显存,用热冷池 + 淘汰策略并处理显存碎片 ✓ 正确答案 C 按需加载无冷启动延迟 D 常驻不影响显存
# 15. 自部署模型的 API 兼容层(OpenAI 兼容接口)如何设计,让应用可无感切换本地与云端模型? A 本地模型必须用自定义接口,应用需改代码 B 兼容层无法处理能力差异 C 暴露 OpenAI 兼容接口 + 模型别名映射 + 能力协商 + 统一网关路由,实现本地/云端无感切换 ✓ 正确答案 D 切换必须改应用代码
# 16. 开源模型的上下文长度与工具调用(Function Calling)能力差异如何影响应用的功能设计? A 所有开源模型工具调用能力相同 B 按模型实际上下文窗口与工具调用能力设计功能,能力弱则压缩上下文或降级为文本工具协议 ✓ 正确答案 C 开源模型都支持稳定 Function Calling D 上下文长度不影响功能设计
# 17. 本地模型的 Chat Template(ChatML 等)与提示词格式差异如何适配? A 按模型选择 chat_template 并用 tokenizer 序列化多轮消息,避免手拼格式,做契约验证 ✓ 正确答案 B Chat Template 不影响模型理解 C 手拼提示词格式最稳妥 D 所有模型用同一 Chat Template
# 18. 自部署模型的版本锁定与回归测试,模型权重、分词器与推理框架如何一起纳入版本管理? A 权重、分词器、推理框架作为整体版本锁定,任一升级都用同一评估集回归测试 ✓ 正确答案 B 权重与分词器版本相互独立,无需一起管理 C 框架升级不影响模型行为 D 回归测试只需测权重
# 19. 本地推理服务的可观测性与版本回归,TTFT、TPOT、GPU 利用率、队列深度与错误率如何采集,模型权重与推理框架升级如何做质量回归 A 采集 TTFT/TPOT/GPU 利用率/队列深度/错误率,升级时用同评估集做质量与性能回归并灰度回滚 ✓ 正确答案 B 本地推理只需监控延迟 C 框架升级无需质量回归 D 队列深度与性能无关
# 20. 本地模型的流式与批处理,continuous batching 如何提升吞吐,离线批量推理与在线流式推理的资源配置差异? A continuous batching 动态合并请求提升吞吐;在线流式按延迟预算配资源,离线批量按吞吐最大化配资源 ✓ 正确答案 B 在线与离线资源配置相同 C continuous batching 降低吞吐 D 批处理必须等整批完成才返回