# 1. 从 Prompt Demo 到生产系统最大的差距是什么,完整架构应包含哪些层次(入口、编排、上下文、RAG/Memory/Tool、网关、评测观测) A 生产级 AI 应用只需把 Prompt 写得更精细即可,无需额外架构设施 B 生产架构应包含入口、编排、上下文、能力、网关、评测观测等分层,且各层职责清晰、可独立演进 ✓ 正确答案 C 模型网关层负责业务逻辑与任务编排,与 BFF 职责重叠 D 评测观测层只在上线前做一次,上线后无需持续观测
# 2. 一次 AI 请求从入口到模型返回的完整链路应如何拆解,鉴权、租户隔离、任务分类、上下文组装、模型调用、输出校验与 Trace 记录各由谁负责 A 任务分类由编排层负责,鉴权与租户隔离由入口网关负责,各环节共享 TraceId 实现端到端追踪 ✓ 正确答案 B 鉴权与租户隔离应放在模型调用之后,因为模型输出才需要安全 C 输出校验属于可选项,只有高合规场景才需要 D Trace 记录只在请求结束时采样一次即可
# 3. 设计 AI 应用时,如何先明确业务目标与约束(用户规模、延迟、成本、数据、权限、质量目标),再决定架构取舍 A 架构取舍应优先基于框架成熟度,而非业务约束 B 成本敏感场景应优先选择强模型以保证质量,忽略成本 C 先量化用户规模、延迟、成本、数据、权限、质量目标等约束,再据此推导缓存、路由、部署等架构取舍 ✓ 正确答案 D 权限需求只影响前端展示,不影响检索与生成架构
# 4. 同步、流式、异步三种响应模式在对话、报表、批处理等场景如何选型,各自的状态管理与取消传播如何设计 A 所有场景都应使用流式,因为流式体验最好 B 异步模式无需持久化任务状态,因为 client 会等待 C 同步模式无法支持取消,因为 HTTP 请求不可中断 D 对话选流式以降低首字延迟,报表/批处理选异步并持久化任务状态,三者都需设计取消传播 ✓ 正确答案
# 5. RAG、Memory 与 Tool 在系统设计中为何必须分开治理,混在一起会带来哪些质量、权限与成本问题 A 三者本质相同,混在一起可简化架构 B 三者数据来源、权限边界与生命周期不同,必须分开治理以避免质量、权限与成本问题 ✓ 正确答案 C 工具调用与知识检索权限可以完全一致,无需区分 D 记忆与检索合并管理可减少上下文冲突
# 6. AI 应用的可观测性设计,需要采集哪些指标(质量、延迟、成本、安全)与执行轨迹,如何支撑事后回放与归因 A 只需采集延迟与错误率即可,与普通系统一致 B Trace 只需记录模型输出,无需记录输入与参数 C Token 成本统计属于成本部门职责,无需接入观测 D 需采集质量、延迟、成本、安全四类指标,并记录完整执行轨迹(Prompt/模型/检索/工具)以支持回放与归因 ✓ 正确答案
# 7. AI 应用的成本结构如何预估(推理、向量库、人工审核、重试),上线前如何做容量与预算规划 A 成本可近似只算推理成本,向量库与人工审核可忽略 B 成本由推理、向量库、人工审核、重试等构成,预算按 QPS 与 Token 量推算并设定上限告警 ✓ 正确答案 C 重试只会增加延迟,不会产生成本 D 缓存命中率与成本无关
# 8. AI 应用的发布流程,离线评测、影子流量、灰度放量、自动回滚如何串联成发布门禁 A 发布流程与普通发布一致,无需评测环节 B 影子流量会把新版本结果直接返回给线上用户 C 链路为离线评测→影子流量→灰度放量→自动回滚,每阶段有可验证退出条件,指标超阈值即回滚 ✓ 正确答案 D 自动回滚只能在人工触发下进行,无法自动化
# 9. 模型网关在架构中的位置与职责,业务代码为何不应直连 Provider,网关与 BFF 的边界如何划分 A 网关统一 Provider 接入、路由、重试、限流与成本统计,BFF 面向客户端做业务编排,BFF 调用网关而非直连 Provider ✓ 正确答案 B 业务代码直连 Provider 更简单,重试与限流由 Provider 保证 C 网关与 BFF 职责重叠,可合并为一个组件 D 模型网关只负责转发,不负责限流与成本
# 10. Prompt 与上下文版本管理,如何保证一次线上输出可追溯到 Prompt、模型、参数、检索与工具版本 A 只有 Prompt 需要版本,模型参数无需记录 B 版本信息只在发布时记录一次,无需随请求落库 C 每次请求在 Trace 中记录 Prompt、模型、参数、检索与工具版本的完整快照,保证输出可追溯与归因 ✓ 正确答案 D 检索索引版本与输出质量无关,无需记录
# 11. AI 应用的安全设计,Prompt 注入、越权工具调用、敏感数据泄露在架构层面如何用代码强制而非提示词防御 A 在提示词中写"不要泄露信息"即可保证安全 B 敏感数据脱敏只需在前端做,后端无需处理 C 只要用了高权限模型,就不会有越权工具调用 D 用代码在入口/输出/工具执行层强制校验:注入靠双向校验、越权靠工具权限、泄露靠检索过滤与脱敏,不依赖提示词 ✓ 正确答案
# 12. AI 应用的容量与限流设计,模型并发与 QPS 峰值的关系,网关层的令牌桶/排队如何设计,过载时如何优雅降级? A 并发数等于 QPS,与单次调用耗时无关 B 过载时应直接拒绝所有请求,便于快速恢复 C 令牌桶只能限流,无法处理排队,需另建队列 D 并发 = QPS × 平均耗时,网关用令牌桶限流 + 排队吸收峰值,过载时分级降级保护高价值任务 ✓ 正确答案
# 13. AI 应用的高可用设计,模型 Provider 故障、限流与降级时,用户体验如何保持(降级模板、排队、转人工) A 降级只影响体验,不影响系统可用性,无需设计 B Provider 故障时直接返回 5xx 即可,用户自行处理 C 采用故障转移、降级模板、排队、转人工等多级兜底,配合熔断与指数退避,并支持自动回切 ✓ 正确答案 D Provider 故障时应持续重试直到恢复,无需熔断
# 14. 多租户 AI 应用的隔离设计,上下文、缓存、记忆、检索与成本的租户隔离分别在哪些层实现 A 上下文/缓存/记忆/检索/成本分别在请求组装、缓存、会话、索引、网关层实现租户隔离,租户 ID 贯穿全链路 ✓ 正确答案 B 只需在前端按租户过滤显示即可,后端无需隔离 C 缓存可跨租户共享以提升命中率,无需隔离 D 检索索引无需租户过滤,模型会自动忽略其他租户数据
# 15. AI 应用的需求评审,哪些功能适合 AI、哪些应走规则或数据库,如何用“确定性优先”原则划分边界 A 所有功能都应优先用 AI 实现,越智能越好 B 规则与 AI 是互斥的,一个功能只能二选一 C 能用规则、数据库与确定性算法可靠实现的功能优先走确定性方案,AI 只用于需要开放理解与生成的场景,高风险功能加兜底 ✓ 正确答案 D AI 一定比规则更准确,所以应全部用 AI
# 16. AI 应用的错误处理与重试策略,超时、限流(429)、内容审查拦截等错误如何分类,重试的幂等与指数退避如何设计? A 所有错误都应重试,直到成功为止 B 按可重试性分类:超时/限流/瞬时网络可重试,内容审查/参数错误/上下文超长不可重试,重试用指数退避+抖动并保证幂等 ✓ 正确答案 C 内容审查拦截错误应反复重试直到通过 D 429 限流错误重试即可,无需退避
# 17. 有状态对话与无状态设计的取舍,会话状态存储(内存/Redis/DB)如何选择,上下文窗口限制下长会话的状态裁剪与超时回收? A 会话状态超时无需回收,保留越久越好 B 生产环境把会话状态存内存即可,简单高效 C 上下文窗口足够大,无需裁剪长会话 D 有状态需外部存储,生产用 Redis(带 TTL 自动回收),长会话用滑动窗口/摘要压缩裁剪,需审计再落 DB ✓ 正确答案
# 18. 模型路由与分级,如何按任务复杂度、成本与质量把请求路由到不同模型(快模型/强模型),路由策略如何用评估数据校准? A 按任务复杂度/成本/质量把请求路由到快模型或强模型,并用评估集数据校准路由阈值,可做级联兜底 ✓ 正确答案 B 所有请求固定用最强模型,保证质量 C 路由阈值一旦设定就无需调整 D 快模型只用于免费用户,付费用户全用强模型
# 19. AI 系统设计常见扣分点,上来就报框架名、不定义约束、不画数据流、不聊治理,应如何避免 A 先报框架名体现技术熟练度,是加分项 B 约束与治理是次要话题,可留到最后简单带过 C 数据流只需描述一次请求的入口,无需展开到模型调用 D 用"场景与约束→架构与数据流→关键设计→治理与演进"的结构回答,避免只堆框架、不定义约束、不聊治理 ✓ 正确答案
# 20. AI 应用架构的答题框架,如何用"场景-约束-架构-验证"四段式组织系统设计回答,避免只罗列框架名? A 用"场景-约束-架构-验证"四段组织回答,约束驱动架构、验证形成闭环,框架名只作为实现细节出现 ✓ 正确答案 B 四段式中"验证"可省略,因为架构已体现质量 C 约束段只需列出用户规模,其他维度可忽略 D 先报框架名再解释,最能体现技术深度