1. 语音 Agent 的"ASR→LLM→TTS"链路延迟预算如何分配(如 800ms 内)?
语音 Agent 的"ASR→LLM→TTS"链路延迟预算如何分配,例如总延迟如何控制在 800ms 内?
- 链路延迟构成
- 预算分配
- 优化手段
语音 Agent 的链路延迟由 ASR(转写)、LLM(推理)、TTS(合成)三段构成,需为总预算分配:例如 800ms 内可分配 ASR 约 150-250ms(流式部分结果)、LLM 约 300-400ms(首 token)、TTS 约 150-250ms(首包)。关键优化:ASR 用流式与"部分结果"提前下发,LLM 用低延迟推理与提前批处理,TTS 用流式合成与首包预生成,三段可"边转写边生成"流水线化以重叠延迟。工程上需把延迟预算写入 SLA,用链路追踪定位瓶颈,并区分"首包延迟"(用户感知)与"总完成延迟"。预算分配需按实际组件耗时动态调整。
800ms 是"感知即时"的参考预算。核心是流水线重叠(pipeline)而非串行相加,把各段延迟叠加收敛到预算内,并用追踪持续优化。