开源模型与本地推理部署

共 20 题
#

1. DeepSeek-V3/R1、Qwen3、Llama 4 等开源模型在自部署场景的选型维度,许可证、显存预算、输出质量与运行成本、生态工具链与运维门槛如何评估?

A 开源模型选型只看质量,其他无关
B 所有开源模型许可证都允许任意商用
C 显存与选型无关
D 需综合许可证、显存预算、质量与成本、生态工具链、运维门槛多维评估,结合业务约束选型 ✓ 正确答案
#

2. 私有化部署与调用商业 API 的 TCO(总拥有成本)对比模型,什么流量规模下自建推理更划算?

A API 一定比自建便宜
B 自建一定比 API 便宜
C 自建高固定成本低单位成本,API 零固定高单位;流量大且稳定自建划算,低流量 API 划算,按总成本/总 token 找平衡点 ✓ 正确答案
D 流量与 TCO 无关
#

3. Ollama/llama.cpp 在开发与边缘场景的定位与生产化差距?

A Ollama 可直接用于生产高并发
B Ollama 支持完整生产级可观测
C Ollama/llama.cpp 适合开发与边缘,生产化缺并发吞吐、高可用、可观测与治理,需迁移或补齐 ✓ 正确答案
D 开发工具与生产无缝
#

4. 开源模型许可证(Apache/Llama/MIT)与商用限制(如 Meta 用户规模条款)如何审查?

A 所有开源模型都允许无限商用
B Llama 与 Apache 限制完全相同
C 许可证无需审查
D 需逐条审查商用许可、规模上限、用途限制、分发与训练条款,Apache/MIT 宽松、Llama 有限制,并设合规门禁 ✓ 正确答案
#

5. 本地推理的框架选择,vLLM/SGLang/llama.cpp 的吞吐与显存差异?

A 三个框架吞吐与显存完全相同
B vLLM/SGLang 面向高吞吐生产(PagedAttention/RadixAttention、continuous batching),llama.cpp 面向轻量边缘,按场景选择 ✓ 正确答案
C llama.cpp 吞吐最高
D SGLang 不支持前缀复用
#

6. 开源模型的内网离线分发,Hugging Face 镜像、模型文件完整性校验(sha256/签名)与私有 registry 在隔离网络的部署流程?

A 离线部署无需校验模型文件
B 私有 registry 无法管理版本
C 用镜像获取 + sha256/签名校验完整性 + 上传私有 registry + 内网拉取,全程版本管理保证可追溯 ✓ 正确答案
D 模型文件无需校验即可分发
#

7. 自部署推理服务的容量规划,按 QPS、输入/输出 Token 与并发要求如何推算所需 GPU 卡数与显存,弹性扩容与缩容策略如何设计

A 按权重+KV Cache+余量算显存、按吞吐需求算卡数,用利用率/队列/延迟信号做弹性扩缩容 ✓ 正确答案
B 只需算显存,吞吐无关
C 卡数只由参数量决定
D 弹性扩容无需信号
#

8. 模型量化与显存/吞吐,FP16/INT8/INT4 与 AWQ/GPTQ/GGUF 量化对显存占用、生成质量与吞吐的影响,量化误差在长上下文下如何放大?

A 量化越低显存越小吞吐越高但质量下降,AWQ/GPTQ 感知量化优于裸 INT4,长上下文下量化误差会放大 ✓ 正确答案
B 量化越低质量越差,但显存越高
C INT4 质量与 FP16 相同
D 长上下文不受量化影响
#

9. 推理服务的并发与延迟指标,TTFT、TPOT、首 token 与尾 token 延迟如何测量与优化,并发度与 GPU 利用率的关系?

A TTFT 管首 token 延迟(prefill),TPOT 管每 token 生成(decode),用分位数监控并平衡并发与 GPU 利用率 ✓ 正确答案
B TTFT 反映 decode 速度
C 并发越高越好,无需上限
D 总延迟与 TTFT 无关
#

10. 多卡部署与并行策略,张量并行(TP)与数据并行(DP)在推理场景的取舍,流水线并行何时引入?

A 所有情况都用数据并行
B 单卡放不下用张量并行,吞吐不足用数据并行,模型极大且 TP 通信受限时引入流水线并行 ✓ 正确答案
C 流水线并行只用于小模型
D 张量并行无通信开销
#

11. 自部署模型的输入输出治理,内容安全过滤(moderation)、敏感词与越狱防护在本地推理链路上如何实现,与云端 API 的差异?

A 本地部署无需内容治理
B 本地用词表、规则、本地审核模型自建输入输出治理,可控可定制但需维护;云端 moderation 内置但不可定制 ✓ 正确答案
C 本地治理与云端完全相同
D 越狱防护只在云端有效
#

12. 端侧/边缘 vs 云侧推理的分流策略,延迟、隐私与成本如何权衡?

A 所有任务都用云侧最强
B 端侧模型能力与云侧相同
C 按任务/隐私/成本分流:端侧保延迟隐私、云侧保能力,混合架构让端侧轻任务、云侧复杂任务 ✓ 正确答案
D 隐私与分流无关
#

13. 开源模型与闭源 API 的混合架构,本地敏感数据 + 云端强模型?

A 脱敏后仍无法保隐私
B 混合架构必须把原始敏感数据上传云端
C 云端强模型无法与本地数据结合
D 本地敏感数据先脱敏/预处理,只把脱敏结果发云端强模型,云端不可用时本地降级 ✓ 正确答案
#

14. 单卡多模型共存与冷热加载,多模型常驻显存 vs 按需加载对延迟、显存碎片与命中率的取舍?

A 所有模型常驻显存最优
B 热模型常驻保延迟命中、冷模型按需加载省显存,用热冷池 + 淘汰策略并处理显存碎片 ✓ 正确答案
C 按需加载无冷启动延迟
D 常驻不影响显存
#

15. 自部署模型的 API 兼容层(OpenAI 兼容接口)如何设计,让应用可无感切换本地与云端模型?

A 本地模型必须用自定义接口,应用需改代码
B 兼容层无法处理能力差异
C 暴露 OpenAI 兼容接口 + 模型别名映射 + 能力协商 + 统一网关路由,实现本地/云端无感切换 ✓ 正确答案
D 切换必须改应用代码
#

16. 开源模型的上下文长度与工具调用(Function Calling)能力差异如何影响应用的功能设计?

A 所有开源模型工具调用能力相同
B 按模型实际上下文窗口与工具调用能力设计功能,能力弱则压缩上下文或降级为文本工具协议 ✓ 正确答案
C 开源模型都支持稳定 Function Calling
D 上下文长度不影响功能设计
#

17. 本地模型的 Chat Template(ChatML 等)与提示词格式差异如何适配?

A 按模型选择 chat_template 并用 tokenizer 序列化多轮消息,避免手拼格式,做契约验证 ✓ 正确答案
B Chat Template 不影响模型理解
C 手拼提示词格式最稳妥
D 所有模型用同一 Chat Template
#

18. 自部署模型的版本锁定与回归测试,模型权重、分词器与推理框架如何一起纳入版本管理?

A 权重、分词器、推理框架作为整体版本锁定,任一升级都用同一评估集回归测试 ✓ 正确答案
B 权重与分词器版本相互独立,无需一起管理
C 框架升级不影响模型行为
D 回归测试只需测权重
#

19. 本地推理服务的可观测性与版本回归,TTFT、TPOT、GPU 利用率、队列深度与错误率如何采集,模型权重与推理框架升级如何做质量回归

A 采集 TTFT/TPOT/GPU 利用率/队列深度/错误率,升级时用同评估集做质量与性能回归并灰度回滚 ✓ 正确答案
B 本地推理只需监控延迟
C 框架升级无需质量回归
D 队列深度与性能无关
#

20. 本地模型的流式与批处理,continuous batching 如何提升吞吐,离线批量推理与在线流式推理的资源配置差异?

A continuous batching 动态合并请求提升吞吐;在线流式按延迟预算配资源,离线批量按吞吐最大化配资源 ✓ 正确答案
B 在线与离线资源配置相同
C continuous batching 降低吞吐
D 批处理必须等整批完成才返回