跳过正文
  1. 日常记录、技术札记与转载收藏。/

Deformable DETR

目录

问题提出
#

原来大DETR有几个缺点:

  1. 收敛慢(问题出在注意力中,通常的QK参数初始化是服从均值为0方差为1)

  2. 对feature map尺寸限制

Deformable DETR做到是:

  • Attention modules只关注参考点周围点一小部分采样点

  • 多尺度特征

结果:

小物体检测好,训练只要原来的1/10

attention的创新:

Image

就是类似cnn的先验知识

模型框架
#

Image

多尺度
#

Image

然后在拼接在一起concat

deformable attention
#

Image

很明显,key的位置坐标,是通过query的位置坐标+偏移位置坐标得到的。其中偏移是来自mlp(query)

Image

位移偏置由 query embedding 通过线性映射预测,作为相对于 reference point 的连续坐标偏移,用于在多尺度特征图上进行稀疏可学习采样;其学习完全由下游检测损失通过反向传播隐式约束,本质上是将 Deformable Convolution 的空间自适应机制迁移到 Transformer Attention 中。

Image

在多尺度上,是在多个特征尺度上的特征,每一层取3个,然后这三个加权融合,每一层的特征最后在组合在一起,映射输出。

相关文章