ASR、TTS 与多模态质量

共 18 题
#

1. 多语种 code-switching、专有名词和 Speaker Diarization 如何建立带真实噪声的评估集

A 应覆盖 code-switching、专有名词、说话人分离等难例,用真实噪声并按 SNR 分层,按难例子集分别统计指标 ✓ 正确答案
B 用干净合成数据即可评估真实能力
C 评估集只需包含一种语种的数据
D 噪声会污染评估,应完全避免
#

2. Voice Clone / Voice Design 的授权、内容标识、滥用检测和撤销机制如何设计

A 克隆声音无需授权,反正模型自己生成
B 撤销后存量声音仍可继续使用,无需清理
C 声音克隆无法被滥用,无需检测
D 应设计授权确认、不可移除的内容标识、滥用检测与可撤销机制,形成闭环 ✓ 正确答案
#

3. 如何分别观测首转写、首 Token、首音频、打断延迟和整轮完成时间

A 只需观测整体响应时间一个指标
B 分别定义并埋点首转写、首 Token、首音频、打断延迟与整轮完成时间,按分位数对比定位瓶颈 ✓ 正确答案
C 首 Token 与首音频是同一指标,无需分别统计
D 打断延迟与链路性能无关,无需观测
#

4. 多语种 code-switching(中英混说)、方言和口音的 ASR 评测集如何构造,避免“实验室准确率陷阱”

A 只要在干净普通语料上准确率高,就说明真实可用
B 评测集应覆盖混说、方言、口音与真实噪声,难例分层统计并用独立留存集,避免与训练分布偏差 ✓ 正确答案
C 方言与口音不重要,可忽略
D 评测集与训练集重叠反而更能说明泛化能力
#

5. ASR 临时转写与最终转写不一致时,UI 和对话状态怎样修正而不重复触发 Agent

A 临时转写变化时应每次都触发 Agent,保证更新
B 已触发 Agent 后应追加新消息来修正
C 临时与最终转写永远一致,无需处理
D 临时转写仅用于 UI 展示,对话状态以最终转写为准,并用稳定窗口去重避免 Agent 重复触发 ✓ 正确答案
#

6. 语音 Agent 在电话信道(8kHz 窄带、丢包、抖动)下的 ASR 退化如何补偿,窄带噪声评估集如何构造

A 8kHz 窄带对 ASR 无影响,无需处理
B 丢包只影响传输不损害 ASR
C 用带宽扩展、丢包隐藏、抖动平滑与窄带适配模型补偿,并用窄带+丢包+噪声的评估集量化退化 ✓ 正确答案
D 评估集只需宽带数据即可代表电话场景
#

7. TTS 流式首包与 LLM 首 Token 的并行调度(不等整句即可开播)边界条件是什么,句子边界误判导致的卡顿如何处理

A 必须等整句话生成完才能开播
B 句子边界误判无关紧要,无需处理
C 任何一个 Token 都应立即开播,绝不缓冲
D 用语义稳定的分句作为开播边界并进行缓冲,对误判边界用最小等待与平滑填充避免卡顿 ✓ 正确答案
#

8. 端到端 Realtime 与模块化 ASR/LLM/TTS 的错误归因、成本核算和供应商切换如何比较

A 端到端中间产物可观测,错误归因更清晰
B 端到端成本核算更细,优于模块化
C 模块化无法切换供应商,只能整体更换
D 模块化各段有中间产物便于归因、可分别核算成本、可单独切换供应商;端到端黑盒但延迟低集成简单 ✓ 正确答案
#

9. ASR 与 LLM 之间的延迟优化(流式 ASR + 增量 LLM)

A 必须等 ASR 完整转写结束才能启动 LLM
B 增量 LLM 无法降低延迟,反而增加
C partial 结果永远准确,可直接采用
D 用流式 ASR 输出 partial 触发增量 LLM,配合稳定窗口启动与结果确认/回退,重叠三段延迟 ✓ 正确答案
#

10. ASR 的说话人分离(Speaker Diarization)

A 说话人分离只需把音频切分,无需说话人嵌入
B 说话人分离与 ASR 无关,无法结合
C 重叠语音对说话人分离无影响
D 通过 VAD 分段、说话人嵌入与聚类产出带说话人的时间段,并用 DER 等指标评估 ✓ 正确答案
#

11. 音频日志中的生物特征(声纹、情绪)如何做脱敏和访问控制,满足 GDPR/PIPL 要求

A 音频可随意长期保存,无需脱敏
B 声纹不属于生物特征,无需特殊处理
C 默认不保留原始音频、声纹不可逆脱敏或加密、最小权限访问并设保留期,配合同意与删除权满足 GDPR/PIPL ✓ 正确答案
D 访问日志可以不记录,简化管理
#

12. Realtime 会话的可懂度、流畅度和情感自然度如何用 MOS(Mean Opinion Score)

A 分可懂度、流畅度、情感自然度分别由多评测者打分,随机化评测并辅以客观指标交叉验证 ✓ 正确答案
B MOS 只用一个总体分数即可衡量全部质量
C 主观打分不可用于质量评估
D 评测者越少越好,避免意见分歧
#

13. TTS 的个性化声音与默认声音在不同文化和语言下的接受度差异如何测试

A 一个声音在所有语言下接受度一致,无需分市场测试
B 只有音质影响接受度,文化无关
C 应在目标市场用本地评测者、本地语料与文化语境评测个性化与默认声音的接受度,避免一刀切 ✓ 正确答案
D 接受度测试无需本地评测者
#

14. 多模态(音频+视频+文本)的 Realtime 会话如何评估同步性、唇形匹配和场景理解

A 只需评估文本回答是否正确即可
B 分别评估音画同步性(时间偏移分位数)、唇形匹配与场景理解,作为多模态质量的多维基线 ✓ 正确答案
C 唇形匹配与场景理解无关,无需评估
D 同步性只能靠主观感受,无法量化
#

15. ASR 分句边界与 LLM 上下文窗口的耦合如何影响响应质量

A 分句边界不影响 LLM 理解
B 上下文窗口不足时硬截断即可,无需摘要
C 分句边界决定消息完整性,上下文窗口决定历史保留,两者共同影响响应质量,需优化分句与语义摘要 ✓ 正确答案
D 分句错误与响应质量无关
#

16. ASR 终稿→LLM 首 token→TTS 首包的全链路延迟如何分别度量与优化,瓶颈如何定位

A 只需看总延迟,无法定位瓶颈
B 分别度量 ASR 终稿、LLM 首 token、TTS 首包延迟并分解占比,定位瓶颈后针对性优化,可并行化各段 ✓ 正确答案
C 三段延迟不可分割,只能整体优化
D 分位数统计无意义,用均值即可
#

17. Whisper、Deepgram、AssemblyAI、Azure 等 ASR 应按流式延迟、语言、热词和说话人分离如何比较

A 应按流式延迟、语言、热词、说话人分离等维度,用自建评测集在目标语言上实测对比 ✓ 正确答案
B 只看官方准确率即可选型
C 所有 ASR 都支持流式与说话人分离,无需比较
D 热词对 ASR 没有实际作用
#

18. ElevenLabs、Cartesia、OpenAI TTS、CosyVoice 等 TTS 应按音质、首音频延迟、情感与授权如何选型

A 只看音质宣传即可选型
B 所有 TTS 都支持流式与情感控制,无需比较
C 应按音质、首音频延迟、情感与授权条款,用统一评测集实测并核查合规后选型 ✓ 正确答案
D 授权条款不影响选型,可忽略