
本文基于YOLOv13 官方仓库(iMoonLab/yolov13,ultralytics 8.3.63 fork)实测整理,Windows/CPU 全程可跑。TransNeXt(CVPR2024)提出聚合注意力(Aggregated Attention):QKV 先经滑动窗口深度卷积做「像素聚焦」,再做多头全局注意力,输出叠一路卷积 GLU 门控。局部精度与长程依赖一网打尽。本文插在 v13n 层 8 之后(20×20)。前言13 篇 BiFormer 管「看哪里」、104 篇 EfficientAttention 管「算多快」,TransNeXt 管「怎么看得自然」:模拟人眼中央凹——近处精细采样、远处粗略聚合。对检测来说,最实惠的是它的两个即插即用组件:DW 聚合的 QKV + 卷积门控输出。专栏目录:YOLOv13改进目录一览专栏地址:YOLOv13改进专栏——持续更新各方向即插即用改进一、插入点分析