跳转至

语音唤醒

人人都是产品经理-加饭-智能座舱之语音唤醒

从网上收集的新息和项目上不敏感角度出发,引用如下指标,并进行一定的评价:

  • 误唤醒率(单位通常为次 / 小时)下,目前商用误唤醒一般要求1-2次/12h。指标是按高强度压测下进行的,因此一般这个指标不会进行特别的变化。考虑到新需求的引入,这个指标能不增加已经是不易的事情。正如甲方提过的,你要多少,我就能给你测出多少,因此不能抛开用户的实际体验,而大谈特谈误唤醒。csdn-ai360-引用
  • 唤醒率(通常用百分比表示),商用唤醒率一般要求90%以上,尽可能降低漏唤醒率。实际这几年不可能90%这么低的指标,实际场景中,会按快语速、方言vs普通话、噪声、干扰、回声作为影响因素,设置不同的指标。从项目上的迭代速度上看,唤醒优化并不难,难得是客户的预期往往存在偏差,对于相似词过分要求、对普通话口音要关注到什么程度、对日常天天含唤醒词下经常发音不标准,要优化的什么程度,这些问题是很考验一个产品经理的判断能力的。舆情也是对这类问题有很大的影响,一些用户习惯暴力说一些脏话或搞笑的话,处理了对正常效果一般就是有影响,所以也涉及到平衡的艺术。近年来新增的车厂增加,稍不留意,就能用其他厂商的唤醒词来唤醒自己的,虽然无辜,但也是不得不处理的事实。
  • 响应时间:一般设备的唤醒检测模块都是放在本地的,这是为了可以快速响应,本地响应可以将响应时间控制在300-700ms之间。如果进行云端2次确认,这个识别降低唤醒的响应时长,会被延长到900ms~1.2S之间,如果网络环境差,这个时间可能更久。知乎涂鸦卧龙-引用
  • 功耗: 看应用场景,大多数场景下一般是不考虑。
  • 自激:一般不允许出现。
  • 定位率:对于车载场景,基于波束分离技术、模型得分、信号能量等新息实现,定位是用户基础体验的一环,一般指标会定的比较高。

从家用智能音响领域上看,很明显的可以感觉夜间会刻意压误唤醒,而导致唤醒率降低。 近年来,唤醒词还承载了另外一个功能那就是声纹检测,从而提供个性化的服务,对唤醒和声纹的应用也带来了很大的挑战。

技术原理

知乎-语音唤醒技术的原理 知乎-52AI-语音唤醒技术的原理 csdn-嗹国学长-CTC语音唤醒

  • OpenWakeWord — 开源,家居场景,支持多唤醒词
  • MicroWakeWord — 专为 ESP32 等 MCU 设计
  • NanoWakeWord — 11 种架构可选,模型极小(40KB)