从规则到统计再到神经网络,NLP 的目标始终是让计算机处理人类语言。本文讲清语言为什么难、词向量与注意力带来了什么变化,并列出分词、实体识别、情感分析、机器翻译等典型任务。
核心要点
- 语言的歧义、省略与言外之意是 NLP 的核心难点
- 统计方法与词向量让语义可以用数值与距离来表达
- 许多 NLP 任务如今被统一成预测下一个词的语言建模
让计算机处理人类语言
自然语言处理(natural language processing,简称 NLP)研究的是计算机与人类语言之间的桥梁。它既包括让机器读懂文本的理解类任务,也包括写出通顺回复的生成类任务,是人工智能中历史最久、应用最广的分支之一。
语言之所以难,是因为它充满歧义、省略与言外之意。“苹果很好吃”和“苹果发布了新手机”,同一个词指向完全不同的东西;多重否定与反讽也要绕几个弯才能理解。人类靠常识与语境化解歧义,机器则需要显式地学习与建模。
从规则到统计再到神经网络
早期 NLP 靠语言学家手工编写规则与词典,灵活性差。上世纪八九十年代起统计方法兴起:用大规模语料统计词语共现频率,让机器自己估算下一个词最可能是什么,机器翻译与拼写纠错因此取得突破。
进入深度学习时代,词被表示成向量(词向量),语义相近的词在空间中位置接近,甚至能出现“国王减男人加女人约等于女王”这样的向量运算。随后循环神经网络、注意力机制与 Transformer 相继出现,语言建模能力大幅跃升。
典型的 NLP 任务
分词与词性标注是中文处理的基础步骤;命名实体识别负责找出人名、地名、机构名;句法分析刻画词语之间的依存关系;情感分析判断褒贬;文本分类用于垃圾邮件过滤;问答与摘要则要求模型理解语义后重新组织输出。
机器翻译是 NLP 最经典的应用之一,也是检验理解能力的试金石。值得注意的是,很多任务在今天已被统一成语言建模的变体:给定一个前缀,预测接下来最可能出现的词序列,翻译、摘要、问答都可套进这个框架。
今天的位置
大语言模型让 NLP 的能力边界大幅扩展,但挑战仍在:事实性错误、长文本记忆、低资源语言与对隐含意图的理解,都是活跃的研究方向。对使用者而言,理解 NLP 的概率本质,有助于更合理地设定预期并核对结果。
常见问题
计算机真的“理解”语言吗?
这取决于如何理解“理解”二字。模型能捕捉词与词之间的统计规律,并在任务中表现出令人惊讶的能力,但它并不拥有人类的体验与意图。更稳妥的说法是:它学到了语言使用的模式,这种能力在很多场景下足够有用。
本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。