语音 Agent 与实时对话应用

共 19 题
#

1. 语音 Agent 的"ASR→LLM→TTS"链路延迟预算如何分配(如 800ms 内)?

A 三段串行严格相加
B 忽略首包延迟
C 只优化 LLM
D 流式 ASR/TTS 与 LLM 流水线重叠,按 SLA 分配预算并追踪 ✓ 正确答案
#

2. 端到端语音模型 vs 级联管线,延迟、打断、口音鲁棒性与可控性的取舍,何时保留级联?

A 延迟更低、打断更自然 ✓ 正确答案
B 可控性更强
C 易于集成工具
D 调试更方便
#

3. 自动化评测闭环,用 TTS 合成测试语音回环驱动语音 Agent,端到端任务成功率如何自动度量?

A 以任务完成状态与语义一致性判定 ✓ 正确答案
B 仅文本匹配
C 随机判断
D 只测 ASR
#

4. 实时语音交互的打断检测、半双工/全双工切换如何实现?

A 提高音量
B 降低延迟
C 关闭麦克风
D 回声消除(AEC) ✓ 正确答案
#

5. 语音场景的上下文管理,多轮对话与 VAD 边界如何对齐?

A 需把 VAD 切出的语音段与该轮语义正确绑定,避免误切轮 ✓ 正确答案
B 完全无关
C VAD 只用于音量
D 忽略语义完整性
#

6. 语音 Agent 中"工具调用"与语音流的编排,转写→意图→工具→TTS 的链路延迟如何压缩?

A 放弃工具调用
B 严格串行
C 只优化 TTS
D 流水线重叠与预测性并行 ✓ 正确答案
#

7. 多语言/口音/背景噪声下的语音鲁棒性如何测试与增强(数据增广、ASR 兜底)?

A 仅靠模型
B 忽略噪声
C 提高音量
D 声学前端降噪加数据增广加 ASR 兜底 ✓ 正确答案
#

8. 语音 Agent 的前端音频处理,回声消除(AEC)、降噪(NS)与自动增益(AGC)在浏览器/App 的接入与质量影响?

A 消除自身扬声器回声,保证双工对话 ✓ 正确答案
B 增大音量
C 压缩音频
D 提高采样率
#

9. 个性化与记忆,声纹、称呼与偏好的持久化如何与隐私合规平衡?

A 无需授权直接存储
B 永久留存
C 单独授权、加密存储、最小化使用并支持删除 ✓ 正确答案
D 与普通偏好同等对待
#

10. 电话机器人/客服语音的意图识别与转人工策略如何设计?

A 仅用户明确要求
B 永不转人工
C 置信度低、情绪激动、多轮未解决、用户要求及高危事项 ✓ 正确答案
D 只按音量大
#

11. 语音仿冒与越权风险,声纹验证、语音克隆滥用检测如何接入语音应用?

A 仅声纹
B 任意
C 声纹验证、活体检测与克隆伪造检测等多层防护 ✓ 正确答案
D 仅录音回放
#

12. 语音助手的打断与多轮指代("刚才那个")如何维护会话状态?

A 仅当前轮
B 会话状态中保存的实体与历史 ✓ 正确答案
C 随机猜测
D 音量
#

13. 语音合成的情感与口音,TTS 在情感控制、口音支持与多语言上的选型标准是什么,如何评测自然度

A 仅延迟
B 仅采样率
C 情感表现力与自然度 ✓ 正确答案
D 仅音色单一
#

14. 语音隐私与合规,录音留存、转写文本脱敏与用户同意应如何设计,满足 GDPR/PIPL 与生物特征合规

A 原样无限留存
B 脱敏 PII、最小化用途、限期限留存并支持删除 ✓ 正确答案
C 无需同意
D 只存录音
#

15. 语音 Agent 的评测,意图理解率、任务完成率、语音自然度与打断处理质量应如何分别度量

A 任务完成率,并配合各分层指标定位瓶颈 ✓ 正确答案
B 仅 WER
C 仅 MOS
D 仅延迟
#

16. 语音 Agent 的并发与会话管理,多设备、多会话与状态冲突应如何处理,会话迁移如何实现

A 会话状态序列化并同步到新设备 ✓ 正确答案
B 每设备独立状态
C 丢弃历史
D 无 session_id
#

17. 语音的打断处理,barge-in 检测、半双工/全双工状态机与打断后的上下文恢复应如何设计

A 丢弃原有上下文
B 保留并恢复被打断前的对话状态 ✓ 正确答案
C 重新开始
D 忽略打断
#

18. ASR 实时转写的 partial/final 结果处理,延迟与准确率取舍、热词表与即时纠正?

A 与 final 无区别
B 直接提交关键决策
C 永远丢弃
D 低延迟展示与提前编排,关键决策等 final ✓ 正确答案
#

19. 代码切换与混说,中英混杂、方言夹杂的 ASR 与语言理解如何处理?

A 忽略混说
B 多语言 ASR 加支持混说的语言理解 ✓ 正确答案
C 仅单语言 ASR
D 仅方言