从只能认几个数字的模板匹配,到统计模型统治三十年,再到深度学习与端到端大模型。本文按时间线梳理语音识别的四次范式转移,并说明为什么远场、多人、强口音至今仍是难啃的骨头。

核心要点

  • 早期模板匹配对说话人与语速极其敏感,换个嗓音就失效
  • 隐马尔可夫模型加语言模型的统计框架长期是主流方案
  • 深度学习与端到端模型把声学、发音、语言模块合为一体

最早的尝试:认几个数字

语音识别的梦想始于上世纪五十年代。早期系统只能识别孤立的数字或少数几个词,靠的是模板匹配:先把每个词说一遍存成模板,识别时比较波形相似度。它能工作,但对说话人、语速、口音极其敏感,换个嗓音往往就失效。

真正的转折是把统计方法引入语音识别。研究者用隐马尔可夫模型(HMM)描述语音随时间变化的状态,用大量录音估计声学特征的概率分布,再配合词典与语言模型挑选最可能的词序列。这套框架在此后三十多年里长期占据主流。

特征与模型:从 MFCC 到深度学习

语音信号本身信息太密,需要先压缩成有代表性的特征。梅尔频率倒谱系数(MFCC)借鉴人耳对不同频率的敏感度,把声音映射到梅尔刻度上,长期是标准做法;后来又加入一阶、二阶差分特征,用以捕捉声音的动态变化。

2010 年前后,深度学习开始替换传统声学模型。深度神经网络能同时处理更长的上下文窗口,建模能力远强于高斯混合模型。随后循环神经网络、时延神经网络与端到端的 CTC、注意力机制相继登场,识别错误率明显下降。

端到端与预训练时代

传统系统是声学模型、发音词典与语言模型的拼装,任何一环出错都会拖累整体。端到端模型抹掉中间环节:输入声学特征,直接输出文字序列,甚至可以连标点一并生成,训练与部署都因此简化。

近年的做法是先用海量无标注语音做自监督预训练,再用少量标注数据微调。这让小语种与方言的识别门槛大幅下降。同时,流式识别让模型边听边输出,支撑实时字幕与会议记录,延迟被压缩到几乎察觉不到的程度。

还没解决的问题

安静环境下的标准普通话识别已相当成熟,但远场拾音、多人同时说话、强口音与专业术语仍是难点,这类场景常被称为鸡尾酒会问题。说话人分离与语音增强技术正在补上这块短板,这也是语音识别至今依然活跃的原因。

常见问题

为什么嘈杂环境里识别依然容易出错?

因为麦克风收到的是人声与噪声的叠加,模型只能从混合信号里推断原本说了什么。虽然波束成形与语音增强能抑制干扰,但当噪声与语音在频率和时长上高度重叠时,信息已经不可逆地丢失,再强的模型也难以完全恢复。

本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。