【ICCV 2025】VACE:统一视频创作与编辑的全能框架|从视频生成统一范式视角 摘要本文解读 ICCV 2025 论文《VACE: All-in-One Video Creation and Editing》。该论文提出VACE 统一视频创作与编辑框架通过融合Video Condition UnitVCU统一输入范式、概念解耦Concept Decoupling与可插拔 Context Adapter让一个视频 DiT 模型同时完成参考生成、视频编辑、掩码局部编辑与任务自由组合其特别之处在于把文本、图像、视频、掩码四类输入折叠进同一个接口 $V[T;F;M]$。实验表明I2V 任务归一化平均达 74.38%六类任务全面超越开源专用模型参考生成与商用 Vidu2.0 基本持平为视频生成与编辑的统一建模提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQVACE 能完成哪些视频任务VCUVideo Condition Unit是什么概念解耦解决了什么问题Context Adapter 与全量微调有什么区别VACE 与 Wan2.1 是什么关系VACE 对比 Keling、Pika、Vidu 等商用模型表现如何参考链接论文基本信息项目内容标题英文VACE: All-in-One Video Creation and Editing标题中文VACE统一视频创作与编辑的全能框架作者Zeyinzi Jiang · Zhen Han · Chaojie Mao · Jingfeng Zhang · Yulin Pan · Yu Liu机构Tongyi Lab, Alibaba Group阿里巴巴通义实验室会议ICCV 2025arXivhttps://arxiv.org/abs/2503.07598项目网站https://ali-vilab.github.io/VACE-Page/背景与动机视频生成模型在近两年高速发展Sora 验证了 DiT 架构的规模化能力开源社区相继推出 LTX-Video、CogVideoX、Wan2.1 等文生视频底座。然而下游任务依然各自为政——编辑Video-P2P、MagicEdit、参考生成Phantom、Magic Mirror、可控生成ControlNet、VideoComposer、SCEdit、局部修改DragGAN、MagicBrush都需要单独部署专用模型成本高且难以组合。图像域已经迈出统一这一步ACE、OmniGen、UniControl 等把可控生成与编辑整合进单一模型。但视频域因为时间与空间双重一致性的要求统一一直难以实现。VACE 的切入点是既然大部分视频任务的输入都可以用文本、图像、视频、掩码四种模态表达那么把它们统一成一个输入接口就可以让一个模型学会所有任务——包括现有管线根本做不了的任务组合例如参考图 运动轨迹驱动的 Move Anything。研究主线从问题到结论图 8VACE 研究主线从问题、动机、设计、方法到实验与结论Mermaid 流程图基准/方法设计VACE 的核心思想可以概括为三个关键词VCU 统一输入范式、概念解耦、Context Adapter 微调。Video Condition UnitVCU把所有任务输入折叠为文本、上下文帧序列与掩码序列三元组 $V[T;F;M]$。帧 $F$ 与掩码 $M$ 在空间尺寸 $h \times w$ 与时间长度 $n$ 上严格对齐。四类基本任务的形式化定义见下表任务帧序列 $F$ 与掩码序列 $M$T2V$F{0_{h\times w}}\times n$$M{1_{h\times w}}\times n$R2V$F{r_1,...,r_l}{0_{h\times w}}\times n$$M{0_{h\times w}}\times l{1_{h\times w}}\times n$V2V$F{u_1,...,u_n}$$M{1_{h\times w}}\times n$MV2V$F{u_1,...,u_n}$$M{m_1,...,m_n}$其中空帧 $0_{h\times w}$ 表示待重新生成区域掩码 1 标记将被重绘的像素参考帧 $r_i$ 前插并配全零掩码保持不动。组合任务就是四类基本任务的任意拼接例如参考修复 参考帧序列 局部掩码序列。图 1VACE 基于 Wanx2.1 与 LTX-Video 的跨任务生成效果参考生成、编辑、掩码编辑与组合创作分类全景图 9VACE 任务体系分类全景T2V / R2V / V2V / MV2V 与自由组合Mermaid 流程图方法细节图 2VACE 框架总览概念解耦、隐空间编码与 Context Embedder支持全量微调与 Context Adapter 两种训练策略概念解耦Concept Decoupling编辑任务中要改的内容与要保留的内容服从不同分布混在一起训练难以收敛。VACE 按掩码把帧序列拆成两条通路$F_cF\times M$待修改如控制信号、灰度像素与 $F_kF\times(1-M)$需保留如参考图、未改动区域让模型明确知道改什么、留什么。上下文隐编码Context Latent Encoding$F_c$、$F_k$ 经视频 VAE 编码到与噪声隐变量 $X$ 对齐的隐空间参考图单独编码后沿时间维拼接解码时移除对应部分避免图像与视频混叠掩码 $M$ 直接重塑插值。三者与 $X$ 在 $n \times h \times w$ 上时空对齐。Context Embedder把 $F_c$、$F_k$、$M$ 在通道维拼接后 token 化帧通路权重复制自原视频 embedder掩码通路权重零初始化保证训练初期行为与原模型一致。Context Adapter Tuning以 Res-Tuning 方式从原 DiT 复制若干 Transformer Block组成分布式级联旁路把输出逐层加回主分支基础 DiT 参数完全冻结只训练 Context Embedder 与 Context Blocks。相比全量微调收敛更快且能力可插拔——同一套适配器可以叠加在 LTX-Video-2B 或 Wan-T2V-14B 任意底座上。实验设计与结果VACE-Benchmark作者构建了首个视频多任务评测基准——240 条高质量视频、12 类任务T2V、修复、扩展、灰度、深度、涂鸦、姿态、光流、布局、人脸参考、物体参考等每类约 20 个样本。自动评分采用 VBench 的 8 项指标美学质量、背景一致性、动态度、成像质量、运动平滑度、整体一致性、主体一致性、时序闪烁加归一化平均人工评估采用 1–5 分 MOS覆盖提示遵循、时序一致性、视频质量三个维度。数据构建管线先做镜头切分与分辨率/美学/运动幅度初筛再用 RAM 打标签 Grounding DINO 检测过滤目标过大或过小的视频最后用 SAM2 视频分割获得实例级掩码并按时序有效帧率过滤针对不同任务定制构建修复/扩展/参考数据所有任务随机组合训练。主结果基于 LTX-Video-2B 的统一模型 vs 任务专用模型任务最强基线VACE用户研究 AvgI2V73.66%CogVideoX-I2V74.38%3.24修复Inpaint70.15%ProPainter72.05%3.00扩展Outpaint73.16%M3DDM74.25%3.80深度Depth72.35%Control-A-Video74.99%3.23姿态Pose72.45%ControlVideo76.13%3.18光流Flow74.42%FLATTEN75.90%3.08参考R2V78.81%Keling1.676.76%3.40图 3VACE 任务分类T2V / R2V / V2V / MV2V 四类基本任务及其自由组合图 4VACE 组合创作案例多模态与多任务自由组合产出单模型或级联管线无法生成的结果超参数设置LTX-Video 版 vs Wan-T2V 版配置LTX-Video 版Wan-T2V 版参数量2B28 层14B40 层分辨率~480p~720p训练步数200,000200,000序列长度4,99275,600采样步数 / 引导40 / 3.025 / 4.0生成速度~24sA100×1~260sA100×8设备A100×16AMP/DDPA100×128FSDP/TP消融实验每任务 250 样本验证集观察训练损失① 全量微调与附加参数微调效果相当后者收敛更快作为默认方案② Context Adapter 相同块数下分布式布置优于浅层连续布置块数越多效果越好受训练资源限制采用部分分布式LTX 版 14 层、Wan 版 8 层③概念解耦使训练损失显著更快速下降。图 5基础结构消融全量微调 vs Res-Tuning 附加参数微调的训练损失对比图 6概念解耦消融引入该模块后训练损失显著下降图 7基于 Wan-T2V-14B 的更多定性结果扩展、修复、灰度、深度、涂鸦、姿态、布局与参考任务结果对比总结图 10VACE 结果对比总结6/6 任务超越开源基线R2V 与商用 Vidu2.0 持平Mermaid 流程图关键发现六类任务全面领先I2V74.38%、修复72.05%、扩展74.25%、深度74.99%、姿态76.13%、光流75.90%的归一化平均全部超越开源专用模型部分基线仅 256 分辨率、时长极短、时序不稳。参考生成差距可控面向快速生成的 2B 小模型拿到 76.76%与商用 Vidu2.0 的 76.47% 基本持平落后 Keling1.6 的 78.81% 约 2 个百分点用户研究提示遵循 3.47 分。组合任务独有能力只给一张输入图和一条运动轨迹即可完成 Move Anything精确移动画面角色并保持叙事一致性现有单模型或多模型级联管线无法完成。用户偏好一致扩展任务 MOS 平均 3.80、修复任务时序一致性 4.00 分人工评估与自动指标趋势吻合。可插拔底座验证同一套 Context Adapter 分别验证于 LTX-2B28 层与 Wan-14B40 层消融确认冻结主干 附加参数微调与全量微调效果相当。收敛更快Res-Tuning 式附加参数微调在 250 样本/任务验证集上损失收敛速度优于全量微调且分布式布置优于浅层连续布置。局限性受制于基础模型2B 小模型生成快但质量与时序一致性受限14B 大模型质量好但推理慢~260s/条、资源消耗大128 卡 A100两者之间的平衡是未来工作重点。训练规模不足统一模型尚未经过与文生视频基础模型同量级的数据与算力训练参考生成时身份保持不完全、组合任务控制力有限作者指出统一任务开始应用缩放定律后结果值得期待。使用门槛输入包含时序与多模态信息操作比图像统一模型复杂作者建议用语言模型或 Agent 引导视频生成与编辑以提升生产力。常见问题FAQVACE 能完成哪些视频任务VACE 一个模型覆盖 12 类任务文生视频T2V、参考生成R2V、视频编辑V2V、掩码编辑MV2V以及它们的自由组合例如参考修复、涂鸦驱动的视频扩展、长视频重渲染。VCUVideo Condition Unit是什么VCU 是 VACE 的统一输入接口把所有任务输入折叠成文本、上下文帧序列、掩码序列三元组 $V[T;F;M]$。不同任务只是 $F$ 与 $M$ 的取值不同模型无需为每个任务更换架构。概念解耦解决了什么问题编辑输入中待修改内容与需保留内容分布不同混在一起训练难收敛。概念解耦按掩码把帧拆成 $F_c$待改与 $F_k$保留两条通路分别编码消融显示引入后训练损失显著下降。Context Adapter 与全量微调有什么区别全量微调更新整个 DiT 的所有参数Context Adapter 冻结基础 DiT只训练新增的 Context Embedder 与 Context Blocks以 Res-Tuning 旁路注入。两者效果相当但 Adapter 收敛更快、可插拔叠加在不同底座上。VACE 与 Wan2.1 是什么关系VACE 是通义实验室基于 Wan2.1 生态的统一创作编辑框架论文基于 LTX-Video-2B 与 Wan-T2V-14B 两个底座训练Wan2.1-VACE14B 与 1.3B随后开源并集成进 ComfyUI、ModelScope 等生态。VACE 对比 Keling、Pika、Vidu 等商用模型表现如何在参考生成任务上2B 小模型归一化平均 76.76%与 Vidu2.076.47%基本持平Keling1.678.81%仍领先但考虑到模型规模与推理速度差异这一结果相当有竞争力且 VACE 同时支持编辑与组合任务。参考链接arXiv 论文页https://arxiv.org/abs/2503.07598项目主页https://ali-vilab.github.io/VACE-Page/GitHub 开源仓库https://github.com/ali-vilab/VACEWan2.1 视频基础模型https://arxiv.org/abs/2506.13161ACE 统一图像生成编辑https://arxiv.org/abs/2410.00086SCEdit 跳跃连接编辑https://arxiv.org/abs/2410.01170给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件