把事实存成实体—关系—实体的三元组,机器就能沿着关系链推理。本文讲清知识图谱的构建与使用方式、知识表示学习如何补全缺失三元组,以及它与大语言模型为何是天然的互补关系。

核心要点

  • 三元组让事实结构化,可查询、可追溯、可编辑
  • 实体消歧与关系抽取是构建图谱时最难的两步
  • 图谱为模型提供可验证事实,模型可补全图谱的稀疏部分

把知识存成一张网

知识图谱(knowledge graph)用实体、关系、实体的三元组把事实组织起来,比如某城市—是首都—某国、水—沸点—一百摄氏度。所有三元组连在一起,就成了一张巨大的语义网络,机器可以沿着关系做推理。

它的思想来源是语义网与本体论,但真正流行起来是因为搜索引擎用它增强结果:搜索某部电影的导演,引擎不是匹配关键词,而是在图谱中找到这部电影,再沿着导演关系取出答案。

怎么建,怎么用

构建知识图谱要从文本中抽取实体与关系,再做实体消歧,把同名的公司与水果区分开,并完成链接。这是自然语言处理的经典难题。图谱还需要持续更新,现实世界的事实会变,静态图谱很快过时。

使用时有两种典型方式。一种是查询与推理:沿着关系链回答多跳问题,比如某人的配偶的母校是哪里。另一种是知识表示学习:把实体和关系嵌入向量空间,让模型预测缺失的三元组,完成图谱补全。

与大模型的关系

大语言模型把知识压缩在参数里,回答流畅但难以核对来源,也容易过时。知识图谱恰好相反:结构清晰、可追溯、可编辑,却覆盖面有限。两者结合的思路因此很自然——用图谱提供可验证的事实,用模型补全图谱的稀疏部分。

这也是检索增强生成的思想来源之一:把结构化知识作为外部记忆接入生成过程。在金融风控、医疗术语、工业故障诊断等要求可解释、可审计的领域,这种组合尤为实用。

局限与前景

知识图谱并非万能。常识难以穷举,关系定义依赖人工设计,维护成本不低。因此它更可能在垂直领域持续发挥价值,而不是成为通用智能的终极答案。把符号化的精确与神经网络的灵活结合起来,仍是一条值得探索的路。

常见问题

有了大语言模型,知识图谱还有必要吗?

有必要,两者互补。模型的知识藏在参数里,难以精确更新和审计;图谱的每条事实都是可编辑、可追溯的记录。在需要准确、可解释、能快速更新的场景中,图谱依然不可替代,也常被用来约束模型的输出。

本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。