问题提出#
原来大DETR有几个缺点:
收敛慢(问题出在注意力中,通常的QK参数初始化是服从均值为0方差为1)
对feature map尺寸限制
Deformable DETR做到是:
Attention modules只关注参考点周围点一小部分采样点
多尺度特征
结果:
小物体检测好,训练只要原来的1/10
attention的创新:

就是类似cnn的先验知识
模型框架#

多尺度#

然后在拼接在一起concat
deformable attention#

很明显,key的位置坐标,是通过query的位置坐标+偏移位置坐标得到的。其中偏移是来自mlp(query)

位移偏置由 query embedding 通过线性映射预测,作为相对于 reference point 的连续坐标偏移,用于在多尺度特征图上进行稀疏可学习采样;其学习完全由下游检测损失通过反向传播隐式约束,本质上是将 Deformable Convolution 的空间自适应机制迁移到 Transformer Attention 中。

在多尺度上,是在多个特征尺度上的特征,每一层取3个,然后这三个加权融合,每一层的特征最后在组合在一起,映射输出。