容量、SLA 与架构演进

共 19 题
#

1. AI 应用 QPS 与 Token 吞吐的容量估算,从业务峰值、平均/尾部延迟与 Provider 配额如何推算网关与实例规模

A 并发数等于 QPS,与调用耗时无关
B 并发 = 峰值 QPS × 平均耗时,Token 吞吐 = QPS × Token 数,结合 Provider 配额估算实例规模并预留缓冲 ✓ 正确答案
C 只需按平均 QPS 计算,无需考虑峰值
D Provider 配额不影响实例规模规划
#

2. AI 应用的 SLA 定义,可用性、P95 延迟、任务成功率与成本上限应如何设定,SLO 与错误预算如何分配

A 只关注可用性与延迟即可,与成本无关
B SLA 含可用性、P95 延迟、任务成功率与成本上限,SLO 可测量,错误预算耗尽则停止发布优先稳定性 ✓ 正确答案
C 错误预算只是统计数字,不影响决策
D 任务成功率与可用性等价,无需单独定义
#

3. 从 PoC 到生产,原型系统与生产系统的差距(评测、安全、成本、可观测)应如何逐项补齐,评审关卡如何设计

A PoC 通过后即可直接全量上线
B 逐项补齐评测、安全、成本、可观测,设计阶段门禁(评测/安全/容量/灰度),每关有退出条件 ✓ 正确答案
C 评测只需要在 PoC 阶段做一次
D 成本与可观测是上线后的事,无需提前评审
#

4. AI 应用架构演进,从单 Prompt 直连到引入 RAG、Agent、网关,各阶段的触发信号与重构边界是什么

A 演进由痛点触发:质量不足引入 RAG,记忆/工具需求引入 Agent,成本/多 Provider 引入网关,避免过度设计 ✓ 正确答案
B 单 Prompt 直连无法演进,必须一开始就全套
C 重构边界没有标准,随意演进即可
D 一上来就应完整引入 RAG、Agent、网关
#

5. AI 应用的故障演练,模型超时、限流、向量库故障、工具失败分别演练哪些降级路径,如何验证

A 模型超时/限流/向量库故障/工具失败各有降级路径,通过故障注入验证触发正确、无雪崩与恢复 ✓ 正确答案
B 故障演练只需验证模型超时一个场景
C 降级路径只需文档化,无需实测
D 向量库故障时无需降级,直接报错即可
#

6. AI 应用的成本演进,随流量增长成本结构如何变化,什么阶段应引入缓存、模型路由与小模型

A 流量增长致推理成本上升,按阶段引入缓存、模型路由与小模型,用成本占预算比例决定优化优先级 ✓ 正确答案
B 一开始就应引入所有成本优化手段
C 缓存与模型路由作用相同,选其一即可
D 小模型只能用于测试,无法承担生产任务
#

7. 多区域部署,AI 应用出海的数据驻留、模型可用性与延迟优化如何权衡,路由如何设计

A 数据驻留是硬约束,按区域路由请求与数据,模型就近可用,在合规内优化延迟 ✓ 正确答案
B 延迟优化优先于数据驻留,可忽略合规
C 所有数据统一存一个区域,便于管理
D 区域路由只影响性能,不影响数据合规
#

8. AI 应用与现有系统集成,旧系统(工单、CRM、ERP)如何通过工具封装接入 Agent,改造边界如何控制

A 应重构旧系统以适配 Agent,保证一致性
B 工具封装无需鉴权,Agent 调用即可
C 把旧系统能力封装为工具供 Agent 调用,旧系统本体少改,只加工具适配层并统一权限与审计 ✓ 正确答案
D 旧系统无 API 的能力无法接入,应放弃
#

9. AI 应用的后端容量模型,流式连接数、并发模型调用、线程/连接池与 Provider 配额如何联合规划

A 线程池越大越好,可处理更多并发
B 以 Provider 配额为顶,联合规划流式连接数、线程池(阻塞/IO 分离)、连接池,并预留缓冲 ✓ 正确答案
C 流式连接不占用资源,无需规划
D 线程池与 Provider 配额无关,独立规划即可
#

10. AI 应用的发布风险,模型/Prompt 变更导致质量波动时,如何用灰度与回滚控制爆炸半径

A 模型变更可直接全量发布,风险可控
B 只有模型变更需要灰度,Prompt 变更无需
C 回滚需要重新部署,无法快速完成
D 按分桶灰度放量并监控指标,版本化支持快速回滚,新旧对比控制爆炸半径 ✓ 正确答案
#

11. AI 应用的数据架构,会话、记忆、缓存、向量与日志的存储选型(Redis、关系库、向量库、对象存储)如何划分

A 会话/缓存用 Redis,结构化持久用关系库,向量检索用向量库,日志用对象存储,按读写率/一致性/成本选型 ✓ 正确答案
B 向量数据也可存关系库,无需专用向量库
C 所有数据统一用一个存储,便于维护
D 日志应存 Redis 保证实时查询
#

12. AI 应用的评测基础设施,评估集、评测流水线、回归门禁与人工标注平台如何建设,成本如何控制

A 评测集一次性建设即可,无需持续扩充
B 回归门禁会拖慢发布,应取消
C 搭建评估集、评测流水线、回归门禁与标注平台,变更触发评测并设基线门禁,用分层评测与抽样控制成本 ✓ 正确答案
D 评测成本无法控制,只能全量跑
#

13. AI 应用的容量压测,如何构造覆盖 Prompt 长度、并发数与输出长度的压测负载,衡量网关/模型/向量库的瓶颈与退化行为?

A 输出长度与压测无关,无需构造
B 只需压测一个并发数即可评估容量
C 构造覆盖 Prompt 长度、并发数、输出长度的负载,监控网关/模型/向量库定位瓶颈,验证过载优雅降级而非雪崩 ✓ 正确答案
D 过载时出现重试风暴是正常现象,无需关注
#

14. Provider 配额与多 Provider 冗余,同一业务如何按比例分配到多家模型厂商规避单点,配额耗尽时的降级与切换策略?

A 单一 Provider 足够,无需冗余
B 按比例+健康探测把流量分配到多家厂商,配额耗尽时平滑切换备用 Provider,网关抽象隔离差异 ✓ 正确答案
C 配额耗尽时应等待重试,不切换
D 切换应一次性全量,快速生效
#

15. 成本预算与 FinOps,Token 成本、缓存命中率与模型路由节省如何纳入月度预算与看板,异常成本(爬虫/重试风暴)如何告警?

A 把 Token 成本、缓存命中率、路由节省纳入月度预算与看板,异常成本(爬虫/重试风暴)实时告警并限流阻断 ✓ 正确答案
B 缓存命中率与成本无关
C 只需统计总 Token 消耗,无需细分
D 重试风暴产生的成本可忽略不计
#

16. 架构演进的组织信号,什么业务指标(调用量、错误率、成本占比)达到阈值时应启动下一阶段架构改造,评审与责任如何界定?

A 架构演进由技术团队主观决定,无需指标
B 指标阈值一旦设定就固定不变
C 成本占比与架构演进无关
D 调用量/错误率/成本占比等指标超阈值触发评审,明确演进目标、预算与责任,演进后回滚与观测 ✓ 正确答案
#

17. AI 应用的技术选型框架,框架(LangChain/LangGraph/自研)、网关、向量库与观测平台如何按团队能力与业务规模选型

A 自研框架一定优于开源框架
B 所有项目都应选用最成熟的框架
C 按团队能力与业务规模取舍:小团队/快速用开源框架,复杂可控用自研/抽象,关键能力(网关/评测)避免锁死 ✓ 正确答案
D 向量库选型与数据量无关
#

18. AI 应用的退出与迁移,更换 Provider、向量库或框架时,数据迁移、契约测试与灰度切换如何设计

A 迁移只需替换实现,无需测试
B 向量库迁移无需重建索引,直接复用
C 数据迁移保证一致性、契约测试保证兼容、灰度切换保证安全,并保留旧实现可回滚 ✓ 正确答案
D 灰度切换会拖慢迁移,应直接全量切换
#

19. AI 系统设计的答辩技巧,如何把一次请求讲成“入口→编排→上下文→模型→校验→观测”的完整故事,并用数据支撑取舍

A 答辩只需说明用了哪些框架,体现技术
B 报出框架名即可,无需展开数据
C 约束与数据支撑无关紧要,可省略
D 把一次请求讲成入口→编排→上下文→模型→校验→观测的完整链路,并用量化数据支撑每个架构取舍 ✓ 正确答案