远程监督(Distant Supervision)方法
一、基本思想
远程监督由 Mintz 等人(2009)提出,核心动机是解决关系抽取训练数据标注成本高昂的问题。
核心假设:若知识库中存在实体对(e1, r, e2)的关系r,则任何同时包含e1和e2的句子都在表达关系r。
工作流程:
- 准备知识库:从 Freebase、Wikidata、DBpedia 等结构化知识库获取已知三元组
(e1, r, e2)。 - 句子对齐:在大规模无标注文本语料中检索同时包含
e1和e2的句子。 - 自动标注:将所有匹配句子标注为关系
r的正例,构造训练集。 - 训练分类器:用自动标注的数据训练关系抽取模型。
示例:
知识库三元组:(马云, 创始人, 阿里巴巴) 匹配到的句子: ① "马云创立了阿里巴巴" → 标注为"创始人"正例 ✓ ② "马云曾担任阿里巴巴CEO" → 标注为"创始人"正例 ✓ ③ "马云与阿里巴巴合作密切" → 标注为"创始人"正例 ✓二、主要问题
1. 错误标签问题(Wrong Label Problem,最核心)
远程监督的强假设过于宽松:同一实体对在不同句子中可能表达不同关系,甚至无关系。
知识库:(马云, 创始人, 阿里巴巴) 句子: ④ "马云离开阿里巴巴后投身公益" → 实际无"创始人"语义,被错误标为正例 ✗ ⑤ "马云批评阿里巴巴的某项政策" → 表达"批评"而非"创始人" ✗根本原因:知识库记录的是实体对之间的一种关系,但文本中实体对可能共现于多种语境,远程监督将所有共现句子统一标注,引入大量噪声。
2. 长尾稀疏问题
- 高频实体对(如知名人物、大公司)匹配句子多,训练样本充足。
- 低频实体对匹配句子极少甚至为零,导致关系类型分布严重长尾,模型对稀疏关系泛化能力差。
3. 知识库覆盖不全
- 知识库本身不完整,许多真实存在的关系未被收录。
- 这些未收录关系对应的句子会被错误地标注为负例,污染负样本集。
4. 实体歧义
同名实体(如"李娜"可指网球运动员或歌手)在句子对齐时可能匹配错误实体对,产生噪声标签。
三、主要改进方向
| 方法 | 思想 | 代表工作 |
|---|---|---|
| 多示例学习(MIL) | 将同一实体对的所有句子组成"包",包级标注,预测时聚合包内句子 | PCNN(Zeng et al., 2015) |
| 注意力机制 | 对包内句子加权,降低噪声句子权重,突出关键句子 | Att-BLSTM、Selective Attention |
| 软标签 / 置信度学习 | 不用硬标签,为每个句子学习软标签或置信度 | Reinforcement Learning 选句 |
| 对抗训练 / 噪声鲁棒损失 | 提升模型对噪声标签的鲁棒性 | 对抗多示例学习 |
| 联合实体链接 | 先消歧再对齐,减少实体歧义带来的噪声 | 联合 EL + RE 模型 |
四、一句话总结
远程监督通过"知识库 + 大规模文本对齐"自动构造训练数据,以噪声换规模,解决了标注瓶颈;其根本代价是错误标签问题——同一实体对的共现句子未必表达同一关系。后续研究(多示例学习、注意力机制、强化学习选句)本质上都在"如何从噪声包中识别真正表达目标关系的句子"这一核心难题上做文章。