1. 大模型推理的核心指标(TTFT/TPOT/吞吐/token 成本)如何采集与告警?
大模型推理的核心指标 TTFT、TPOT、吞吐与 token 成本如何采集与告警?
- 核心指标的定义与采集方式
- 告警阈值的设定
- 指标与成本/质量的联动
TTFT(首 token 延迟)与 TPOT(每输出 token 时间)由推理引擎(vLLM/TGI)在请求粒度埋点,经 Prometheus 聚合为直方图(P50/P95/P99);吞吐(tokens/s)与请求速率由引擎 metrics 或网关统计;token 成本在网关侧按输入/输出 token 数计量并归属业务。告警:TTFT 超阈值(如 P99 > 3s)告警,TPOT 反映生成速度(如 P99 > 100ms/token),吞吐与 GPU 利用率设下限避免浪费,token 成本设配额与环比告警。
推理指标强调 token 维度,且 TTFT 与 TPOT 需分开监控,因为前者反映首帧体验、后者反映生成流畅度。告警要分层:性能类(延迟/吞吐)、资源类(GPU利用率/显存)、成本类(token 配额)。采集需标注模型版本与业务线标签,才能做质量与成本归因。