开放词汇目标检测系列论文(3)--GLIP

开放词汇目标检测系列论文(3)--GLIP
1、论文简介

这篇论文的题目是“Grounded Language-Image Pre-training”,发表在CVPR 2022。

这篇论文中的方法,也是大名鼎鼎Grounding DINO的基础。

2、论文动机

论文的核心目的是为了将目标检测(Object detection)任务,和短语定位(Phrase Grounding)任务相统一。该论文为了将目标检测任务转换为短语定位任务,将最后目标分类的head,替换为求取boundingbox的视觉特征和文本特征的相似性。这个是该论文的核心想法和贡献。

现有CLIP模型,可获得图像级的丰富表征,也具有很强的开放词汇能力。然而,在Object detection,我们需要的是目标级的特征。这个也是这篇论文想解决的问题。

在CLIP中,图像和文本通常先编码,后计算相似度,这个就是论文中说的Late Fusion。在这篇论文GLIP中,作者认为应该在特征编码的时候,就交互两者之间的特征,也就是论文中的Deep Fusion。

3、论文做法

上图是GCLIP的主要流程图,具体做法大概如下:

1)模型的输入为Image 和 文本Prompt,分别采用视觉编码器和文本编码器进行编码。Image被编码为,其中N为影像的token个数,d为特征的维度。Prompt被编码为,M是Prompt中的token的个数,d为特征维度。为了让文本和影像特征充分交流,在编码的过程中,作者采用Deep fusion模块,对文本和影像特征进行融合。Deep fusion采用的是交叉注意力,这里就不细说。

融合的目的,是为了让提取的视觉特征,感知到文本特征,可提高模型的开放词汇能力,也让提取的视觉特征本身就和输入的文本相关联。

2)在传统检测器中,当提取到Image的特征后,会再经过一个固定维度的分类器矩阵,得到最终的类别的概率,这样就可以实现闭集的检测。在GCLIP中,不再使用W分类,而是计算O和P之间的相似性,在原文中,公式如下:

显而易见,P代替了W的作用,得到的,表示的是每个区域和每个文本token之间的相似性。

在推理的时候,如果我换了Prompt,则计算得到的S_ground也会发生改变,这个开放词汇的能力不就有了么。作者设计的确实妙呀。

3)在loss中,会约束和真值标签矩阵保持一致,也就是对齐损失。同时也会再加一个常规的定位损失,完成网络的训练。

4、总结

该论文将目标检测任务转换为Pharse grounding的任务,在提取特征的时候,对视觉特征和文本特征进行了充分的交互。通过计算视觉特征和文本特征间的相似性,实现最终的grounding也就是检测。

参考:
[1] Li L H, Zhang P, Zhang H, et al. Grounded language-image pre-training[C]//Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. 2022: 10965-10975.