VisionHOPE论文深潜(上):嵌套学习与5个耦合记忆——模型如何一边看图一边改自己 VisionHOPE论文深潜(上)嵌套学习与5个耦合记忆——模型如何一边看图一边改自己【免费下载链接】VisionHOPE项目地址: https://ai.gitcode.com/hf_mirrors/PSRben/VisionHOPEVisionHOPE 是一个把视觉骨干网络改造成**自修改学习系统Self-Modifying Learning Systems**的开源视觉模型项目。它不再是一张训练完就冻结的静态网络而是能在推理阶段一边读取图像、一边根据输入微调自身行为的动态系统。本仓库官方发布了 3 个规格Tiny / Small / Base在ImageNet-1K 分类、COCO 检测与实例分割、ADE20K 语义分割三大任务上的全部预训练权重结构参数就写在 config.json 里。本文带你深潜论文上篇先讲透两个核心机制——嵌套学习与5 个耦合记忆再拆解模型结构与权重文件最后手把手教你一键下载。一、为什么骨干网络要自修改传统视觉骨干CNN、ViT一旦训练完成参数就固定了无论输入是猫、卡车还是街景它都用同一套权重、走同一条通路。可真实图像分布极其不均——光照、视角、纹理、物体数量差异巨大静态参数很难一张图一套最优策略。VisionHOPE 的出发点很直接让骨干网络在推理时保留学习能力。看图的同时它会根据这张图的局部统计特性动态调整自己的处理策略这就是自修改Self-Modifying的含义。 打个比方静态骨干像一台参数写死的相机拍什么都用同一档曝光VisionHOPE 更像一台会实时测光、逐张微调参数的智能相机——底子由训练打好细节由当下这张图决定。二、核心机制一嵌套学习Nested Learning嵌套指两个学习循环互相包裹外层·慢学习离线在 ImageNet 等大尺度数据集上做标准反向传播训练出扎实的初始参数。它决定模型底子有多好。内层·快学习在线逐图对每张输入图像模型在骨干内部执行少量适应步adaptation step仅凭当前图像自身的信号做微调不依赖任何数据集。它决定针对这张图还能再好多少。关键点在于内层发生在推理阶段、且步数很少单张图带来的额外开销可控适应完成后参数会回滚到外层状态不会在图与图之间累积污染。于是模型同时拥有了通用底子 逐图定制两种能力在分布偏移、长尾类别、罕见场景下更稳。三、核心机制二5 个耦合记忆Coupled Memories自修改不是乱改而是靠 5 个相互耦合的记忆模块协同完成。可以理解为模型把该怎么改拆成了 5 本账每本账又会影响其他账。① 参数记忆Parameter Memory·长期底座骨干自身的权重是长期记忆。内层适应不直接重写主通路而是叠加一个低秩增量既灵活又不伤根基。② 路由记忆Routing Memory·注意力开关记录现在该关注图像的哪些区域、哪些 token对应结构中的mixertoken 混合分量决定信息流的走向。③ 状态记忆State Memory·跨层接力在 4 个阶段之间传递的隐状态让深层能继承浅层看到的线索越深越有上下文。④ 情景记忆Episodic Memory·短期缓存一个键值缓存存下这张图里已识别出的显著模式供后续层查询复用减少重复计算。⑤ 学习率记忆Meta Memory·元控制控制内层每一步改多少的元参数本身也由外层训练得到——相当于学会如何学习。耦合闭环路由记忆决定情景记忆存取哪些模式 → 情景记忆生成参数记忆的低秩增量 → 状态记忆把增量沿阶段传递下去 → 学习率记忆调节所有记忆的更新幅度。任一环变化都会经耦合回路反馈到其他记忆这正是一边看图一边改自己的完整回路。四、架构一览3 规格 × 4 阶段嵌套结构三个骨干都是4 阶段逐级嵌套分辨率逐段降低、通道逐段加宽阶段内的深度depths即自修改块的数量。完整数值见 config.json骨干嵌入维度embed_dims混合维度mixer_dims阶段深度depthsVisionHOPE-Tiny64 → 128 → 256 → 51232 → 64 → 128 → 2563 / 4 / 18 / 4VisionHOPE-Small64 → 160 → 320 → 51232 → 80 → 160 → 2564 / 8 / 25 / 8VisionHOPE-Base96 → 192 → 448 → 64048 → 96 → 224 → 3204 / 8 / 25 / 8可以看出中间第 3 阶段最深Tiny 18 层、Small/Base 25 层是承载耦合记忆与自修改回路的核心区域通道宽度从 64/96 一路扩张到 512/640典型的先细后粗多尺度设计。五、三大下游任务分类、检测、分割全覆盖VisionHOPE 不只是分类骨干而是作为通用视觉骨干接入不同下游。下表即本仓库提供的全部预训练权重文件任务TinySmallBaseImageNet-1K 分类visionhope_tiny.pthvisionhope_small.pthvisionhope_base.pthCOCO · Mask R-CNN 1×visionhope_tiny_coco_1x.pthvisionhope_small_coco_1x.pthvisionhope_base_coco_1x.pthCOCO · Mask R-CNN 3×visionhope_tiny_coco_3x.pthvisionhope_small_coco_3x.pth—ADE20K · UPerNet 分割visionhope_tiny_ade20k.pthvisionhope_small_ade20k.pthvisionhope_base_ade20k.pthℹ️ 权重文件较大以visionhope_small.pth为例约 200 MB 量级仓库通过 Git LFS 管理这些大文件见 .gitattributes拉取时会自动解析真实权重。六、如何下载 VisionHOPE 预训练权重一键命令安装 Hugging Face 的hf命令行工具后下载单个 checkpointhf download PSRben/VisionHOPE visionhope_small.pth --local-dir weights一次性拉取全部权重hf download PSRben/VisionHOPE --include visionhope_*.pth --local-dir weights命令与文件清单的权威说明见 README.md 的 Download 小节。七、上篇小结模型如何一边看图一边改自己用三句话收束上篇——嵌套学习外层慢学习打底子内层快学习逐图微调推理完即回滚互不污染。5 个耦合记忆参数、路由、状态、情景、学习率五本账相互反馈构成自修改的完整回路。通用骨干同一套 T/S/B 结构横跨分类、检测、分割三大任务。下篇预告将深入内层适应步的具体信号来源、5 个记忆之间的梯度耦合细节以及三个规格在三大任务上的精度/速度权衡与选型建议。【免费下载链接】VisionHOPE项目地址: https://ai.gitcode.com/hf_mirrors/PSRben/VisionHOPE创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考