# 1. LLM Gateway(Portkey、Lunary、OpenRouter、Higress AI 网关)的定位,鉴权、限流、路由、缓存、审计的统一接入层? A 网关是业务应用与模型供应商之间的统一接入层,负责鉴权、限流、路由、缓存与审计等横切能力 ✓ 正确答案 B 网关主要负责把 Prompt 写得更好,提升生成质量 C 网关只做模型推理计算,不涉及网络与鉴权 D 网关替代了向量数据库的全部功能
# 2. 多模型路由策略,按任务类型(生成/分类/embedding)选择模型、按 SLA 选择供应商、failover 与灾备切换的实现? A 故障时无需熔断,直接无限重试即可恢复 B 每个供应商只能硬编码一个,不能动态切换 C failover 只与模型大小有关,与供应商无关 D failover 应配合熔断与健康检查,避免对故障源持续放大请求 ✓ 正确答案
# 3. LLM 网关的语义缓存(Semantic Cache)与精确缓存,如何用 embedding 相似度做 hit/miss 判定?命中率优化与误命中代价? A 语义缓存用字符串完全相等判断命中 B 语义缓存通过 embedding 相似度与阈值比较判定命中,阈值越低误命中风险越高 ✓ 正确答案 C 语义缓存不需要向量索引,直接哈希即可 D 阈值越高命中率越高
# 4. LLM 网关的路由策略,按模型能力、成本、租户与地域如何多维度路由? A 路由只按模型参数大小决定,与租户和地域无关 B 成本路由与能力路由必然冲突,无法同时约束 C 所有租户必须走同一供应商,不能差异化 D 应先按硬约束(能力、地域、合规)过滤候选,再按成本/延迟/租户优先级加权选择 ✓ 正确答案
# 5. 供应商账单对账,网关计量与供应商 usage 的差异(缓存、重试、舍入)如何核对,防止计费误差? A 缓存命中和重试是账目差异的主要来源之一,需在计量中标记并解释差异 ✓ 正确答案 B 网关计量与供应商 usage 必然完全一致,无需对账 C 对账只看请求总数,不看 token 与缓存 D 容差设置越严越好,无需考虑误报
# 6. 流式协议适配,不同供应商的 SSE/流式格式与中断语义差异,网关如何统一输出给上层? A 网关把各供应商流式事件归一化为统一事件模型,并统一错误码与取消语义 ✓ 正确答案 B 所有供应商的 SSE 格式完全相同,无需适配 C 流式数据无法做缓存或脱敏,只能原样透传 D 中断语义在各供应商间完全一致
# 7. 供应商负载均衡(Multi-vendor LB),按价格/延迟/可用性权重轮询与熔断? A 熔断器在供应商失败率超阈值时摘除该供应商,恢复后重新分配流量 ✓ 正确答案 B 权重一旦设置就固定不变,无需动态更新 C 负载均衡与熔断是互斥的,只能二选一 D 权重只与价格有关,与延迟和可用性无关
# 8. API Key 管理、密钥轮换(Key Rotation)与租户隔离在网关层的实现? A 密钥应明文硬编码在业务代码中,便于调用 B 密钥一旦创建不可轮换更换 C 所有租户共享同一把 Key,无需隔离 D 密钥轮换可采用双密钥灰度,先灰度再全量、最后下线旧密钥 ✓ 正确答案
# 9. 请求/响应日志脱敏(PII/凭证)与审计合规(GDPR/SOC2)的网关级策略? A 日志应完整记录原始 Prompt 和响应,便于排查 B 脱敏只在前端做,与网关无关 C 采用数据最小化原则,默认只记录元数据,必须记录的内容脱敏 ✓ 正确答案 D 合规日志可以无限制永久留存
# 10. 网关层的缓存(Prompt/响应缓存)与流式透传如何兼容? A 缓存命中时无法流式返回,只能转为非流式 B 网关缓存命中时把缓存完整响应按统一事件格式回放成流式,并标记 cache-hit ✓ 正确答案 C 流式请求无法做任何缓存 D 缓存命中时仍需按真实调用计费
# 11. 多租户场景下如何做用量计量、成本归因与配额管理? A 配额只做硬拒绝,不做软告警 B 成本归因只需按总请求数,不需按 token C 计量维度应包含租户、模型、场景与供应商,配额分硬配额与软配额 ✓ 正确答案 D 多租户共享同一个配额池,无需隔离
# 12. LLM 网关的职责,多 Provider 接入、鉴权与配额? A 网关负责执行业务逻辑,如 Prompt 优化和结果校验 B 网关只转发请求,不做鉴权与配额 C 网关负责多 Provider 统一接入、鉴权与配额管理,业务逻辑留在上层 ✓ 正确答案 D 网关必须绑定单一供应商,不能多接入
# 13. LLM 网关的可观测性,OpenTelemetry GenAI 语义约定、usage 指标(input/output/cache/reasoning token)与 trace 的成本关联? A 只需要统计请求总数,无需细分 token 类型 B trace 与成本无法关联 C OTel GenAI 语义约定提供统一 span 属性,usage 细分 input/output/cache/reasoning token 可支撑成本关联 ✓ 正确答案 D cache token 无需单独统计
# 14. 网关高可用,多活部署下路由规则、缓存与限流状态的分布化一致性如何设计? A 路由规则、缓存、限流状态都必须每次请求强一致 B 路由规则走配置中心版本化,缓存用 TTL+失效,限流可用本地近似+集中校准 ✓ 正确答案 C 限流状态只能存在单机内存,无法分布式 D 多活部署无需考虑状态一致性
# 15. 私有化部署场景(VPC/VPN)下 LLM 网关的网络边界与加密通信? A 网关在 VPC/VPN 内缩小暴露面,业务与网关之间用 mTLS 双向认证,全程加密 ✓ 正确答案 B 网关应直接暴露公网方便外部调用 C 内网服务间无需加密 D 私有化部署不需要考虑网络隔离
# 16. 网关故障时如何优雅降级(模型切换/降级模板/排队)? A 通过模型切换、降级模板与排队限流三层策略,尽量保住可用性并避免雪崩 ✓ 正确答案 B 故障时应直接把错误抛给用户,不掩盖问题 C 降级后应继续提供与正常情况下完全相同的功能质量 D 降级策略无需可观测,只要恢复即可
# 17. 网关的流控,令牌桶、并发限制、退避与排队应如何组合,突发与公平如何平衡 A 令牌桶管速率、并发限制管在途、排队缓冲突发、退避控重试,并按租户配额保证公平 ✓ 正确答案 B 只需令牌桶即可,无需并发限制与排队 C 所有请求都必须立刻拒绝,不能排队 D 退避会让客户端无限重试,无需设计
# 18. 网关的可观测,token 计费、延迟与错误率? A 只需看请求总数,不需看 token 与延迟 B 错误率无需分供应商统计 C token 计费、延迟(TTFT/P95)与错误率是核心指标,需按维度下钻并设告警 ✓ 正确答案 D 延迟只看平均值即可,无需分位数
# 19. 网关的多租户密钥管理,租户级 Provider 凭证、配额映射与密钥轮换的隔离设计? A 所有租户共用同一套凭证,便于管理 B 密钥轮换必然影响所有租户 C 凭证按租户隔离并加密存储,配额与路由按租户映射,轮换仅影响对应租户 ✓ 正确答案 D 凭证可以明文存储
# 20. 路由规则热更新,配置变更如何灰度生效,避免切换瞬间结果不一致与审计断档? A 规则变更应一次性全量生效,无需灰度 B 热更新应版本化、按比例/租户灰度、原子切换并留审计,保证可回滚可追溯 ✓ 正确答案 C 规则变更无需版本管理,直接覆盖即可 D 灰度期间新旧规则可以任意并存,无需标记