拆掉视觉编码器和 VAE:商汤这套 8B 多模态模型改了什么 拆掉视觉编码器和 VAE商汤这套 8B 多模态模型改了什么TL;DR 速览事件商汤发布SenseNova U1.5技术报告一个8B-MoT 架构的原生统一多模态模型不需要外部视觉编码器也不需要 VAE即可理解、推理和生成视觉内容接口改法用保持图像块之间空间连贯性的重建方式来改进视觉接口——这是拆掉编码器之后仍能理解图像的关键后训练拆成四路专家视觉美学、双语文字渲染、信息图生成、图像编辑各自优化后再用多专家同策略蒸馏整合训练规模精选生成与编辑数据、改进任务建模、结构化提示增强最高 4K 原生分辨率开源范围监督微调、强化学习、同策略蒸馏的训练代码注意仓库OpenSenseNova/SenseNova-U1创建于 2026-04-17不是新项目商汤发布了 SenseNova U1.5 的技术报告。这是一个 8B-MoT 架构的原生统一多模态模型核心定位是理解、推理和生成视觉内容都用同一套结构完成不依赖外部的视觉编码器也不需要变分自编码器VAE。配套开放的包括监督微调、强化学习和同策略蒸馏在内的训练代码。多模态领域这两年有一条明显的技术分叉一类做法是拼接式——语言模型主干加一个视觉编码器中间再加投影层把视觉特征转成主干能吃的表示另一类做法是追求原生统一从一开始就让视觉和文本在同一个模型结构里表达。SenseNova U1.5 走的是后一条路而这份报告里最值得拆的是它怎么处理没有视觉编码器之后图像表示从哪来这个问题。一、为什么原生统一要拆掉视觉编码器和 VAE先说清这两个组件各自在干什么以及拆掉它们的动机。视觉编码器常见的是 CLIP 或 SigLIP 这类负责把图像转成一组特征向量。它的优点是成熟、稳定、有大量预训练权重可用但它的输出是为理解服务的抽象表示——它被训练来对齐图文而不是为了精确重建像素。VAE负责在像素空间和潜在空间之间来回转换是扩散类生成模型的标准配件。它带来的是压缩效率代价是在编解码过程中丢失细节——这也是为什么很多生成模型需要额外的精修环节。两者组合起来的结果是理解和生成走的是两条不同的表示通道。模型看懂的图像和它能画出的图像中间隔着一层翻译。这在需要精确编辑、或者要求生成结果与参考图严格一致的任务上会出问题。原生统一路线的目标就是让这两条通道合并。报告中的表述是无需外部视觉编码器和 VAE即可理解、推理和生成视觉内容。而要做到这一点必须自己解决图像块该怎么表示这个问题。二、关键的一步保持图像块空间连贯性的重建报告里对视觉接口的说明只有一句但信息量很大通过保持图像块之间空间连贯性的重建方式改进视觉接口。拆开理解这句话图像块意味着模型仍然是把图像切块处理。这一点和主流做法一致——把图像切成 patch 序列和文本 token 一起进模型。空间连贯性是重建时的约束。如果每个图像块被独立地重建块与块之间的边界会出现不连续——视觉上表现为拼接痕迹、纹理突变、网格感。而这些痕迹会直接伤害后续的编辑能力模型学到的表示里每个块是孤立的它就无法理解改这里会影响旁边的区域。重建方式说明接口本身是被训练出来的。没有外部编码器提供现成表示所以视觉接口必须用一个重建目标来自己学——而重建目标里加不加空间连贯性约束决定了学到的表示是能拼回图像还是真正理解图像结构。这一条也解释了为什么报告后面会特意强调保持主体身份特征、几何结构与非编辑区域的一致性。这三个一致性要求本质上都是空间连贯性约束在任务层面的体现。三、后训练四路专家再蒸馏回一个后训练策略是这份报告里工程含量最高的部分。它的结构是先分工、再合并第一分别优化四类专家—— 视觉美学、双语文字渲染、信息图生成、图像编辑。这四类都在标准的多模态训练里容易被平均掉但各自有不同的能力侧重视觉美学偏主观质量双语文字渲染要求字形准确这一点对中文尤其难信息图生成需要把结构化信息转成图形布局图像编辑则要求局部修改不影响其他区域。用通用目标一起训很容易出现每项都及格、没有一项能打的结果。第二用多专家同策略蒸馏把它们整合回一个模型。同策略蒸馏on-policy distillation的要点在于让学生模型生成自己的输出由教师模型对这些学生自己产生的序列给出监督信号而不是只学教师的输出分布。相比离线蒸馏它对学生实际会走到的状态覆盖得更好——对生成类任务这一点尤其重要因为生成过程中任何一步的偏差都会累积。这套分专家 蒸馏合并的路径和前面 MiMo 那篇讲的 RL 工程是同一个思路的两个方向一个是在训练信号上做精细化分工一个是在能力维度上做精细化分工共同点是承认一个通用目标训不出全部能力。我处理这类多能力整合的方案时会记两件事分了几路、用什么方式合回去。分开容易合回去不损失才是难点。墨衍 里我把素材、选题和分发记录攒在一处核对这类方案细节时不用来回翻文件。四、训练配方里的四个变量报告点到的训练侧改动逐个看数据精选的生成与编辑数据。生成和编辑被当成两类数据分别准备这与后训练里的专家拆分是对应的。任务建模官方称改进了任务建模。这一项在报告里没有展开细节但从结果看它对应的是如何把不同类型的视觉任务统一成同一套输入输出契约——统一建模做得不好多专家蒸馏就会失去共同基础。结构化提示增强用结构化的方式增强提示。这对应着信息图生成这类任务的需求——排版、层级、布局信息必须能被精确表达纯自然语言描述容易产生歧义。分辨率最高 4K 原生分辨率训练。分辨率的提升不只是更清晰它改变了模型能处理的信息密度上限——海报、信息图、细粒度文字排版这些场景本质上是高分辨率任务。五、一个值得单独记的泛化现象报告里有一条意外收获式的结论尽管生成训练数据对结构化格式的覆盖有限模型仍然能有效泛化到长而复杂的结构化视觉指令官方据此认为多模态理解能力能够迁移至视觉规划与创作。这个现象的工程意义在于它说明理解和生成共用一个表示空间之后看懂复杂结构和按复杂结构生成变成了同一件事的两个方向。如果两者是分离的编码器 VAE 的拼接式结构这种迁移就不容易发生——因为结构信息在两条通道里被各自压缩过一遍。对使用者的实际影响处理复杂布局要求的提示词时这类原生统一模型的表现可能明显好于拼接式模型而且对提示的结构化程度更宽容。六、怎么用以及该观察什么获取方式模型与代码在 GitHub 的OpenSenseNova/SenseNova-U1Apache 2.0技术报告在 Hugging Face Papers在线体验走商汤小浣熊。需要注意这个仓库创建于 2026 年 4 月U1.5 是在既有项目上的版本推进不是全新开源——引用时不要写成刚发布的新仓库。如果你的场景是这几类值得试需要中文文字准确渲染的图片生成双语文字渲染是四路专家之一、信息图与海报类内容、需要局部编辑且要求非编辑区域不变的任务。观察点有三个第一编辑任务的一致性实测。保持主体身份特征、几何结构与非编辑区域一致性是官方口径这类指标最需要在真实素材上验证——尤其是多轮编辑之后的一致性衰减。第二4K 原生分辨率的实际收益与成本。高分辨率训练带来的推理开销是实打实的要算清哪些任务真的需要 4K。第三蒸馏后的能力保留率。四路专家整合回一个模型时各方向的损失分布是这套方案的关键指标——和前面三值量化那篇的逻辑一样平均分掩盖不了分项差异。最后这份报告最值得学的不是某个数字而是那条路径选择当拼接式架构在编辑和一致性上遇到天花板时回去解决表示从哪来这个更底层的问题。这类决定通常不便宜但它决定了后面的能力上限。