YOLOv13改进策略【注意力机制篇】| CVPR2023 NATTEN 邻域注意力,窗口里的稀疏全局
本文基于YOLOv13 官方仓库(iMoonLab/yolov13,ultralytics 8.3.63 fork)实测整理,Windows/CPU 全程可跑。Neighborhood Attention(Hassani et al.,CVPR 2023《Neighborhood Attention Transformer》,arXiv 2204.07143,官方源码 github.com/SHI-Labs/NATTEN)把自注意力从"全图两两配对"缩到"滑动邻域":每个 query 只对以自己为中心的 k×k 窗口做 softmax 注意力(边界处窗口裁剪)——感受野重叠滑过全图、复杂度 O(N·k²)。本文把官方 NeighborhoodAttention2D(kernel 3、dilation 1、heads=4)插进 v13n 层 8 之后,实测+263,168 参数、GFLOPs 6.54→6.75,与官方模块壳同权重逐位一致(max diff = 0;注意力核按官方 NA 语义用纯 torch unfold 实现,与逐像素暴力循环参考 diff = 4.77e-07),1 轮冒烟训练正常完成。前言窗口注意力的家族谱系是这样的:ViT 全图配对(贵)、Swin 固定不重叠窗口(便宜但边界生硬)、NATTEN 重叠滑动窗口(每个像素都是自己那扇窗的"窗主")——邻域之间天然有信息往来,边界不再是隔离墙,而账本只从 N² 降到 N·k²。官方 NATTEN 包
上一篇/下一篇内容由系统自动关联
返回资讯列表 →