本文目录导读:

知识图谱补全(Knowledge Graph Completion,简称KGC)是知识图谱领域中的一个核心任务。
知识图谱是由“实体”和“关系”组成的一个巨大的网状结构(<姚明> - [职业] -> <篮球运动员>;<姚明> - [效力于] -> <休斯顿火箭队>),但由于构建过程的不完整、数据源的限制等原因,这个网里会有很多“洞”,即缺失的关系或实体。
知识图谱补全的目的,就是利用已有的知识,通过算法模型来预测和填补这些缺失的链接,KGC主要解决的是链接预测问题。
核心任务分为两类:
-
实体预测:给定一个头实体、关系和一个尾实体,预测缺失的那一个实体。
- 头实体预测:(?, 职业, 篮球运动员) —> 预测出“姚明”
- 尾实体预测:(姚明, 效力于, ?) —> 预测出“休斯顿火箭队”
-
关系预测:给定两个实体,预测它们之间可能存在的关系。
(姚明, ?, 叶莉) —> 预测出“配偶”
为什么需要知识图谱补全?
- 提升知识覆盖率:大部分知识图谱都是不完整的,补全能大幅提升其可用性。
- 支持下游应用:搜索引擎、推荐系统、智能问答、药物发现等应用都依赖完整、准确的知识,补全后的图谱能提供更精准的答案和推荐。
- 发现新知识:模型预测出的关系有时能揭示数据中隐含的、未被记载的关联。
主要方法和技术
这个问题从早期基于规则的方法,发展到如今以表示学习(Representation Learning) 为主的深度学习时代,主要有以下几大类:
基于平移距离的模型
这类方法将实体和关系映射到低维向量空间中,并将关系视为头实体到尾实体的平移变换。
- TransE:最经典的模型,核心思想是:头实体向量 + 关系向量 ≈ 尾实体向量。
h + r ≈ t,则三元组成立,否则不成立,简单高效,但处理复杂关系(如1-N、N-1、自反关系)时能力有限。 - TransH / TransR / TransD:为了解决TransE的缺陷,在不同向量空间或投影方式上做了改进,例如将实体投影到关系特定的超平面上再平移。
基于语义匹配的模型
这类方法通过计算头实体和尾实体在某个关系下的相似度或匹配度来打分。
- RESCAL:使用张量分解,用一个矩阵来表示每个关系,通过矩阵乘法捕捉实体间的交互。
- DistMult:简化了RESCAL,将关系矩阵限制为对角矩阵,计算简单,但只能处理对称关系。
- ComplEx:引入复数空间建模,能处理非对称关系,比DistMult更强。
- TuckER:使用更高级的张量分解(Tucker分解),表达能力很强。
基于神经网络的模型
利用深度学习的强大学习能力来建模。
- ConvE:使用2D卷积神经网络,将头实体和关系向量拼接成“图像”进行卷积操作,再与尾实体计算得分,效果好,但参数量较大。
- R-GCN (Relational Graph Convolutional Network):图神经网络(GNN)的典型代表,通过将邻居节点的信息聚合来更新当前节点的表示,天然利用了图结构信息,常用于处理多跳推理。
- CompGCN:进一步改进了R-GCN,通过关系节点和实体节点的交互进行消息传递。
基于规则和逻辑的模型
- AMIE+:自动从图谱中挖掘出高频的、置信度高的规则(如:
如果A是B的母亲,且B是C的母亲,则A是C的外祖母),然后用规则去预测新的三元组。 - NeuralLP / DRUM:将规则学习融入到神经网络中,实现可微的、端到端的规则挖掘。
基于大语言模型(LLM)的方法
这是最近几年的热点方向。
- LLM-as-a-Classifier:将三元组预测转化为对LLM的文本提示(Prompt),让LLM基于其内部知识或上下文信息判断关系是否存在。
- LLM as Encoder + KGC Model:利用LLM(如BERT、GPT)强大的文本编码能力,更好地理解实体名称和文本描述,再结合传统KGC模型进行预测,LLM可以生成实体间的复杂关系描述或证据。
- GraphGPT / InstructGLM:将图结构和文本信息统一输入到LLM中,让模型直接生成缺失的实体或关系,这类方法能利用LLM强大的常识和推理能力,但成本高、可解释性可能不如传统模型。
常用数据集和评估指标
- 标准数据集:FB15k-237、WN18RR、YAGO3-10、Nell-995、DBpedia-93,前两个是最常见的基准。
- 评估指标:
- MRR (Mean Reciprocal Rank):对所有测试样本的排名倒数取平均,值越大越好。
- Hits@K:排名前K位中出现了正确答案的比例,常见K=1, 3, 10,Hits@1越高代表模型精准度越高。
- 平均排名:正确答案的平均排名,越小越好(但现在较少单独使用,易受离群值影响)。
当前挑战与未来方向
- 复杂关系建模:如何更好地处理对称、非对称、1-N、N-1、多步推理等复杂关系?
- 少样本与零样本补全:对于长尾实体或从未见过的关系,如何有效补全?
- 动态知识图谱:现实世界知识随时间变化,需要支持增量更新和时序推理。
- 可解释性:光给出预测结果不够,用户希望知道模型为什么这么预测(基于哪条规则或哪组邻居节点)。
- 多模态融合:结合文本描述、图片、音频等多模态信息来增强实体表示,提升补全效果。
- 大规模与效率:工业级知识图谱规模巨大,需要保证补全算法的计算效率和扩展性。
知识图谱补全是一个系统工程:它既需要利用图结构信息(基于GNN的方法),也需要利用实体和关系的语义信息(基于LLM或文本的方法),同时要应对稀疏性、复杂关系、动态变化等现实挑战。
如果你打算深入研究,建议先从 TransE(理解平移思想)、ComplEx(理解语义匹配) 和 ConvE(入门神经网络方法) 这几个基础模型入手,再结合当前热门的 GNN 和 LLM 融合方法。