尧图精选

YOLOv13改进策略【卷积层篇】| ICCV2023 SwiftFormer,一层线性注意力就够快

🕒 发布时间:2026/10/2 2:20:09 📁 来源:尧图网络
本文基于YOLOv13 官方仓库(iMoonLab/yolov13,ultralytics 8.3.63 fork)实测整理,Windows/CPU 全程可跑。SwiftFormer(Shao et al., ICCV 2023《SwiftFormer: Efficient Additive Attention for Lightning-fast Vision Transformers》,官方源码 github.com/Amshaker/SwiftFormer)的核心是高效加性注意力:Q/K 线性映射并 L2 归一化后,用可学习向量给 Q 打分,token 维 softmax 得到全局上下文向量 G(B×D),输出Proj(G⊙K)+Q——全程没有 N×N 注意力矩阵,复杂度 O(N)。本文把官方 SwiftFormerEncoder 整块(局部表征 + 加性注意力 + MLP,双 layer-scale 残差)插进 v13n 层 8 之后(P5 出口,256 通道 @20×20),实测+924,928 参数、GFLOPs 6.54→7.28,与官方逐位一致(max diff = 0),1 轮冒烟训练正常完成。前言移动端 ViT 的进化链:MobileViT(第 85 篇)把 Transformer 塞进 CNN、EfficientFormer 砍掉 4D 注意力里的 layouts、SwiftFormer 再进一步——注意力矩阵整个不要了:每个 token 的注意力分数
上一篇/下一篇内容由系统自动关联 返回资讯列表 →