LLM 网关与统一接入

共 20 题
#

1. LLM Gateway(Portkey、Lunary、OpenRouter、Higress AI 网关)的定位,鉴权、限流、路由、缓存、审计的统一接入层?

A 网关是业务应用与模型供应商之间的统一接入层,负责鉴权、限流、路由、缓存与审计等横切能力 ✓ 正确答案
B 网关主要负责把 Prompt 写得更好,提升生成质量
C 网关只做模型推理计算,不涉及网络与鉴权
D 网关替代了向量数据库的全部功能
#

2. 多模型路由策略,按任务类型(生成/分类/embedding)选择模型、按 SLA 选择供应商、failover 与灾备切换的实现?

A 故障时无需熔断,直接无限重试即可恢复
B 每个供应商只能硬编码一个,不能动态切换
C failover 只与模型大小有关,与供应商无关
D failover 应配合熔断与健康检查,避免对故障源持续放大请求 ✓ 正确答案
#

3. LLM 网关的语义缓存(Semantic Cache)与精确缓存,如何用 embedding 相似度做 hit/miss 判定?命中率优化与误命中代价?

A 语义缓存用字符串完全相等判断命中
B 语义缓存通过 embedding 相似度与阈值比较判定命中,阈值越低误命中风险越高 ✓ 正确答案
C 语义缓存不需要向量索引,直接哈希即可
D 阈值越高命中率越高
#

4. LLM 网关的路由策略,按模型能力、成本、租户与地域如何多维度路由?

A 路由只按模型参数大小决定,与租户和地域无关
B 成本路由与能力路由必然冲突,无法同时约束
C 所有租户必须走同一供应商,不能差异化
D 应先按硬约束(能力、地域、合规)过滤候选,再按成本/延迟/租户优先级加权选择 ✓ 正确答案
#

5. 供应商账单对账,网关计量与供应商 usage 的差异(缓存、重试、舍入)如何核对,防止计费误差?

A 缓存命中和重试是账目差异的主要来源之一,需在计量中标记并解释差异 ✓ 正确答案
B 网关计量与供应商 usage 必然完全一致,无需对账
C 对账只看请求总数,不看 token 与缓存
D 容差设置越严越好,无需考虑误报
#

6. 流式协议适配,不同供应商的 SSE/流式格式与中断语义差异,网关如何统一输出给上层?

A 网关把各供应商流式事件归一化为统一事件模型,并统一错误码与取消语义 ✓ 正确答案
B 所有供应商的 SSE 格式完全相同,无需适配
C 流式数据无法做缓存或脱敏,只能原样透传
D 中断语义在各供应商间完全一致
#

7. 供应商负载均衡(Multi-vendor LB),按价格/延迟/可用性权重轮询与熔断?

A 熔断器在供应商失败率超阈值时摘除该供应商,恢复后重新分配流量 ✓ 正确答案
B 权重一旦设置就固定不变,无需动态更新
C 负载均衡与熔断是互斥的,只能二选一
D 权重只与价格有关,与延迟和可用性无关
#

8. API Key 管理、密钥轮换(Key Rotation)与租户隔离在网关层的实现?

A 密钥应明文硬编码在业务代码中,便于调用
B 密钥一旦创建不可轮换更换
C 所有租户共享同一把 Key,无需隔离
D 密钥轮换可采用双密钥灰度,先灰度再全量、最后下线旧密钥 ✓ 正确答案
#

9. 请求/响应日志脱敏(PII/凭证)与审计合规(GDPR/SOC2)的网关级策略?

A 日志应完整记录原始 Prompt 和响应,便于排查
B 脱敏只在前端做,与网关无关
C 采用数据最小化原则,默认只记录元数据,必须记录的内容脱敏 ✓ 正确答案
D 合规日志可以无限制永久留存
#

10. 网关层的缓存(Prompt/响应缓存)与流式透传如何兼容?

A 缓存命中时无法流式返回,只能转为非流式
B 网关缓存命中时把缓存完整响应按统一事件格式回放成流式,并标记 cache-hit ✓ 正确答案
C 流式请求无法做任何缓存
D 缓存命中时仍需按真实调用计费
#

11. 多租户场景下如何做用量计量、成本归因与配额管理?

A 配额只做硬拒绝,不做软告警
B 成本归因只需按总请求数,不需按 token
C 计量维度应包含租户、模型、场景与供应商,配额分硬配额与软配额 ✓ 正确答案
D 多租户共享同一个配额池,无需隔离
#

12. LLM 网关的职责,多 Provider 接入、鉴权与配额?

A 网关负责执行业务逻辑,如 Prompt 优化和结果校验
B 网关只转发请求,不做鉴权与配额
C 网关负责多 Provider 统一接入、鉴权与配额管理,业务逻辑留在上层 ✓ 正确答案
D 网关必须绑定单一供应商,不能多接入
#

13. LLM 网关的可观测性,OpenTelemetry GenAI 语义约定、usage 指标(input/output/cache/reasoning token)与 trace 的成本关联?

A 只需要统计请求总数,无需细分 token 类型
B trace 与成本无法关联
C OTel GenAI 语义约定提供统一 span 属性,usage 细分 input/output/cache/reasoning token 可支撑成本关联 ✓ 正确答案
D cache token 无需单独统计
#

14. 网关高可用,多活部署下路由规则、缓存与限流状态的分布化一致性如何设计?

A 路由规则、缓存、限流状态都必须每次请求强一致
B 路由规则走配置中心版本化,缓存用 TTL+失效,限流可用本地近似+集中校准 ✓ 正确答案
C 限流状态只能存在单机内存,无法分布式
D 多活部署无需考虑状态一致性
#

15. 私有化部署场景(VPC/VPN)下 LLM 网关的网络边界与加密通信?

A 网关在 VPC/VPN 内缩小暴露面,业务与网关之间用 mTLS 双向认证,全程加密 ✓ 正确答案
B 网关应直接暴露公网方便外部调用
C 内网服务间无需加密
D 私有化部署不需要考虑网络隔离
#

16. 网关故障时如何优雅降级(模型切换/降级模板/排队)?

A 通过模型切换、降级模板与排队限流三层策略,尽量保住可用性并避免雪崩 ✓ 正确答案
B 故障时应直接把错误抛给用户,不掩盖问题
C 降级后应继续提供与正常情况下完全相同的功能质量
D 降级策略无需可观测,只要恢复即可
#

17. 网关的流控,令牌桶、并发限制、退避与排队应如何组合,突发与公平如何平衡

A 令牌桶管速率、并发限制管在途、排队缓冲突发、退避控重试,并按租户配额保证公平 ✓ 正确答案
B 只需令牌桶即可,无需并发限制与排队
C 所有请求都必须立刻拒绝,不能排队
D 退避会让客户端无限重试,无需设计
#

18. 网关的可观测,token 计费、延迟与错误率?

A 只需看请求总数,不需看 token 与延迟
B 错误率无需分供应商统计
C token 计费、延迟(TTFT/P95)与错误率是核心指标,需按维度下钻并设告警 ✓ 正确答案
D 延迟只看平均值即可,无需分位数
#

19. 网关的多租户密钥管理,租户级 Provider 凭证、配额映射与密钥轮换的隔离设计?

A 所有租户共用同一套凭证,便于管理
B 密钥轮换必然影响所有租户
C 凭证按租户隔离并加密存储,配额与路由按租户映射,轮换仅影响对应租户 ✓ 正确答案
D 凭证可以明文存储
#

20. 路由规则热更新,配置变更如何灰度生效,避免切换瞬间结果不一致与审计断档?

A 规则变更应一次性全量生效,无需灰度
B 热更新应版本化、按比例/租户灰度、原子切换并留审计,保证可回滚可追溯 ✓ 正确答案
C 规则变更无需版本管理,直接覆盖即可
D 灰度期间新旧规则可以任意并存,无需标记