1. AI 应用 QPS 与 Token 吞吐的容量估算,从业务峰值、平均/尾部延迟与 Provider 配额如何推算网关与实例规模
AI 应用 QPS 与 Token 吞吐的容量估算,从业务峰值、平均/尾部延迟与 Provider 配额如何推算网关与实例规模?
- 理解 QPS、并发与延迟的关系
- 能否从 Token 吞吐推算模型调用容量
- 能否结合 Provider 配额推算实例规模
容量估算从业务峰值出发:先预估峰值 QPS(如大促 5000 QPS),结合单次模型调用的平均与尾部延迟(如平均 2s、P95 5s)推算并发数(并发 = QPS × 平均耗时,约 10000 并发);Token 吞吐 = QPS × 平均输入/输出 Token 数,估算每秒 Token 消耗,据此推算模型调用量与成本。实例规模:网关按并发与 QPS 规划实例数(结合单实例吞吐),模型调用受 Provider 配额约束(每秒 Token/并发上限),需按峰值预留配额或采用多 Provider 分摊。关键是用"峰值 QPS × 耗时 = 并发"与"QPS × Token = 吞吐"两个公式,并预留缓冲(如 1.5~2 倍),同时考虑尾部延迟对排队的放大。
面试官考察"从业务指标推算资源"的数学能力。核心公式是并发 = QPS × 平均耗时,以及 Token 吞吐 = QPS × Token 数。回答强调"峰值 + 尾部延迟 + Provider 配额"汇总量,并预留缓冲。