1. 多语种 code-switching、专有名词和 Speaker Diarization 如何建立带真实噪声的评估集
多语种 code-switching、专有名词和 Speaker Diarization 如何建立带真实噪声的评估集?
- 评估集的地域与语种覆盖
- 真实噪声与混合场景
- 标注一致性与基准
建立带真实噪声的评估集需覆盖三类难例:1) code-switching(中英混说等)样本,取自有真实中英混说的语料,覆盖不同混说比例与切换点;2) 专有名词(人名、地名、商标、产品名)样本,含大小写与多语拼写,作为热词评测;3) Speaker Diarization 样本,含多人轮流与重叠说话。噪声要取自真实环境(环境声、混响、信道噪声、他人说话),而非纯合成噪声,并按信噪比(SNR)分层。每段样本给出精确标注(逐字转写 + 说话人边界 + 语种标签),并对标注一致率做抽样校验。评测指标按难例子集分别计算(如 code-switching 段的 WER、专有名词召回率、说话人错误率),避免被容易样本稀释。
评估集的价值在于"代表真实困难"。实验室干净数据会高估能力,真实噪声与难例分层才能暴露短板。按难例子集分别统计,才能定位问题并指导针对性优化。