跳转至

影响效果的声音

噪声

一般噪声可以分为:参考

  • 环境噪声增广​: 必须立一个车规级的噪声库。将所有干净的训练语音与以下真实噪声按不同信噪比(SNR,从 -5dB 到 20dB)混合:
  • 机械噪声​: 空调风扇(1-4档)、雨刮器(慢/快)、车窗升降。引擎(怠速/加速)。
  • 行驶噪声​: 不同路面(沥青、水泥、石子路)在不同速度(60, 100, 120 km/h)下的胎噪和风噪。过减速带。
  • 场景噪声​:
  • 特殊事件:紧急车辆警笛(救护车、警车、消防车),轮胎急刹声、碰撞声
  • 周边车辆鸣笛
  • 开启车窗后的城市街道声、隧道内的回响
  • 后排儿童哭闹、乘客交谈、咳嗽(使用非目标语言,作为纯背景噪声)
  • 天气引入声音:雨声(雨水与周围物体碰撞声、与车身碰撞声)、雷声

干扰

回声

导航、TTS、媒体播放器、系统提示音

一般导航音、媒体音、助理音回分别作为独立通告给前端算法。

发音

对于中国市场,用户的语言习惯呈现出高度多样性。将方言(Dialect,拥有独立词汇和语法体系,如粤语)与口音(Accent,主要体现在发音上的变化,如川普)混为一谈是常见的第一个错误。我们必须采用不同的策略来应对。

调音

陷阱:时间戳漂移的“幽灵”

  • 症状​: AEC 效果时好时坏,多模态融合模型效果不佳,难以复现。深入分析发现,不同传感器(麦克风、摄像头、CAN)的时间戳存在几十毫秒的随机漂移。

陷阱:音频链路中的“静默丢帧”,导致模型性能随机下降。

  • 现象​:模型性能时好时坏,难以复现。用户抱怨“有时候听得清,有时候听不清”。
  • 调试技巧​:问题根源很可能不在模型,而在音频输入通路上。如果音频采集线程的实时优先级不够高,在系统高负载时,操作系统可能会抢占其 CPU 时间,导致音频缓冲区溢出,部分音频帧被丢弃。模型收到了不连续的音频流,性能自然下降。

测试场景设定

一个总体的平均指标会掩盖系统在特定场景下的短板。必须进行精细化的分桶评测,以发现“性能悬崖”。 优先解决那些“高 WER 且高 TSR 失败率”的 Bad Case。