关系抽取中“远程监督“方法的基本思想和主要问题是什么?

📅 2026/7/27 4:30:16
关系抽取中“远程监督“方法的基本思想和主要问题是什么?
远程监督Distant Supervision方法一、基本思想远程监督由 Mintz 等人2009提出核心动机是解决关系抽取训练数据标注成本高昂的问题。核心假设若知识库中存在实体对(e1, r, e2)的关系r则任何同时包含e1和e2的句子都在表达关系r。工作流程准备知识库从 Freebase、Wikidata、DBpedia 等结构化知识库获取已知三元组(e1, r, e2)。句子对齐在大规模无标注文本语料中检索同时包含e1和e2的句子。自动标注将所有匹配句子标注为关系r的正例构造训练集。训练分类器用自动标注的数据训练关系抽取模型。示例知识库三元组(马云, 创始人, 阿里巴巴) 匹配到的句子 ① 马云创立了阿里巴巴 → 标注为创始人正例 ✓ ② 马云曾担任阿里巴巴CEO → 标注为创始人正例 ✓ ③ 马云与阿里巴巴合作密切 → 标注为创始人正例 ✓二、主要问题1. 错误标签问题Wrong Label Problem最核心远程监督的强假设过于宽松同一实体对在不同句子中可能表达不同关系甚至无关系。知识库(马云, 创始人, 阿里巴巴) 句子 ④ 马云离开阿里巴巴后投身公益 → 实际无创始人语义被错误标为正例 ✗ ⑤ 马云批评阿里巴巴的某项政策 → 表达批评而非创始人 ✗根本原因知识库记录的是实体对之间的一种关系但文本中实体对可能共现于多种语境远程监督将所有共现句子统一标注引入大量噪声。2. 长尾稀疏问题高频实体对如知名人物、大公司匹配句子多训练样本充足。低频实体对匹配句子极少甚至为零导致关系类型分布严重长尾模型对稀疏关系泛化能力差。3. 知识库覆盖不全知识库本身不完整许多真实存在的关系未被收录。这些未收录关系对应的句子会被错误地标注为负例污染负样本集。4. 实体歧义同名实体如李娜可指网球运动员或歌手在句子对齐时可能匹配错误实体对产生噪声标签。三、主要改进方向方法思想代表工作多示例学习MIL将同一实体对的所有句子组成包包级标注预测时聚合包内句子PCNNZeng et al., 2015注意力机制对包内句子加权降低噪声句子权重突出关键句子Att-BLSTM、Selective Attention软标签 / 置信度学习不用硬标签为每个句子学习软标签或置信度Reinforcement Learning 选句对抗训练 / 噪声鲁棒损失提升模型对噪声标签的鲁棒性对抗多示例学习联合实体链接先消歧再对齐减少实体歧义带来的噪声联合 EL RE 模型四、一句话总结远程监督通过知识库 大规模文本对齐自动构造训练数据以噪声换规模解决了标注瓶颈其根本代价是错误标签问题——同一实体对的共现句子未必表达同一关系。后续研究多示例学习、注意力机制、强化学习选句本质上都在如何从噪声包中识别真正表达目标关系的句子这一核心难题上做文章。