全时免唤醒¶
为了实现更自然的交互,系统需要摆脱对“你好,XX”这类唤醒词的强依赖。参考
- 免唤醒指令 (Wake-word-free Commands): 通过一个在 DSP 或低功耗核心上运行的、极轻量级的声学模型实现。这个模型通常是基于 CRNN(Convolutional Recurrent Neural Network)的关键词识别(Keyword Spotting, KWS)模型,但其词典扩展为一组高频、低风险的指令(如“打开/关闭空调”、“导航回家”)。
- 挑战: 最大的挑战是控制误触发率(False Acceptance Rate, FAR)。
- 解决方案:
- 级联模型: 轻量级模型检测到可能的指令后,唤醒主 NPU 上的一个更精确的验证模型进行二次确认。
- 多模态融合: 结合唇动(VAD)、手势等视觉信号,可以大幅降低音频误触发。例如,只有在检测到用户嘴部有对应动作时,才接受“打开车窗”的免唤醒指令。
- 环境事件驱动 (Event-driven Triggers): 系统可以主动发起对话,但这必须建立在深刻的场景理解和克制的交互策略之上。
- 交互预算 (Interaction Budget): 为系统设定一个“打扰预算”。例如,在一次行程的前10分钟,最多主动发起1次对话。如果用户回应积极,预算可以略微增加;如果用户忽略或拒绝,预算则在一段时间内清零。