图像生成论文精读 一、趋势① 简单介绍CVPR 2026 图像生成方向共收录 447 篇约占全会议生成式视觉的一半整体已从“能否生成”跨入“可控、高保真、可对齐、可溯源”的阶段。扩散模型仍是绝对主干约 50% 论文提及但骨干正从 U-Net 迁移到 DiT/Transformer并出现流匹配Flow Matching、自回归VAR等新范式。② 从“像不像”到“好不好、合不合意图”奖励建模与偏好对齐RL / DPO / GRPO快速成为主流生成开始“听得懂人话”——组合正确性、审美、身份一致性成为可优化目标质量评估从分布相似度转向人类偏好。③ 落地与扩展双线并进采样加速 / 步蒸馏把推理压到数步使端侧实时生成成为可能视频 / 3D / 4D把单图推向动态与立体的“世界模型”同时概念擦除 / 水印 / 溯源回应版权与合规生成进入“可被监管”的阶段。二、方法下面按“提及该方法的论文数”列出全局高频方法族。同一篇论文可能命中多个方法故占比之和大于 100%。方法族论文数占比简单介绍扩散模型226 篇50.6%逐步去噪的生成范式是图像生成的事实标准底座。DiT/Transformer125 篇28.0%以 Transformer 为骨干替换 U-Net成为新主流架构。偏好对齐(RL/DPO/GRPO)123 篇27.5%用奖励/人类偏好把生成对齐到“好且合意图”。采样加速98 篇21.9%少步采样、步蒸馏、缓存等手段直接压低推理成本。视频/动态92 篇20.6%把单图扩展到时间维生成连贯视频或动态场景。图像编辑89 篇19.9%基于指令或参考图修改已有图像的生产力任务。数据集/基准86 篇19.2%新训练数据与评测基准决定能力上限与可复现进步。布局/条件控制63 篇14.1%用布局/位姿/草图/深度等空间条件精确控制构图。架构/合并/剪枝62 篇13.9%新骨干、模型合并/剪枝/调制等决定性价比的根基。压缩/超分/复原56 篇12.5%用生成式方法做超分、压缩、去噪与复原。个性化/身份53 篇11.9%学习并复现特定主体或风格实现定制生成。多模态47 篇10.5%跨文本/图像/音频统一建模衔接 LLM 生态。自回归/VAR36 篇8.1%把图像当作 token 序列按尺度自回归生成。流匹配/Rectified Flow34 篇7.6%学习向量场把噪声直推到数据可近似少步采样。3D/4D33 篇7.4%高斯泼溅/NeRF 等把生成扩展到立体与时空。知识蒸馏30 篇6.7%用大模型监督训练小模型压缩参数量或步数。LoRA22 篇4.9%低秩适配轻量微调主流手段。概念擦除/安全21 篇4.7%概念擦除、水印溯源与后门防护回应版权与合规。三、主题按方法路线把 447 篇分为 13 类。每一类给出简述、研究意义与典型应用场景。A. 可控生成与条件控制简述在文生图基础上引入布局、位姿、草图、深度、边缘等额外条件把“随机创作”变成“按需生产”。意义让生成从“碰运气”变成“可指定”是工业设计与内容生产落地的前提。应用场景广告/海报的可控构图、产品图按布局生成、草图→上色、姿态引导人物生成、室内平面图生成。代表论文精读《SketchDeco: Training-Free Latent Composition for Precise Sketch Colourisation》B. 图像编辑简述对已有图像做局部或全局修改换装、去物、换背景、风格化、修复通常基于指令或参考图。意义比从零生成更贴近日常生产力是设计师与修图工作流的核心环节。应用场景电商换装试穿、老照片修复、物体移除、指令式改图、参考图风格迁移。代表论文精读《Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editing》C. 采样加速与高效推理简述通过少步采样、步蒸馏、特征缓存、可学习调度等手段把扩散模型几十步推理压到数步。意义推理成本是落地最大瓶颈加速决定生成能否在端侧实时运行。应用场景实时对话式生图、移动端 App、视频生成的高吞吐推理、交互式编辑。代表论文精读《TC-Padé: Trajectory-Consistent Padé Approximation for Diffusion Acceleration》D. 奖励建模与偏好对齐简述用奖励模型/人类偏好RL/DPO/GRPO把生成质量从“像不像”升级到“好不好、合不合意图”。意义让生成“听得懂人话”组合正确性、审美、身份一致性成为可优化的目标。应用场景文生图审美提升、指令遵循对齐、品牌一致性、多偏好个性化、安全拒答。代表论文精读《Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models》E. 视频、3D与多模态简述把单图生成扩展到时间维度视频与空间维度3D/4D 高斯泼溅、NeRF并融合文本/音频。意义是通向“动态世界模型”的入口3D/物理一致性决定能否用于仿真与具身。应用场景文/图生视频、数字人/虚拟主播、3D 资产生成、机器人仿真、电影预演。代表论文精读《InstructMix2Mix: Consistent Sparse-View Editing Through Multi-View Model Personalization》F. 概念擦除、溯源与模型安全简述概念擦除让模型遗忘特定概念、水印/指纹溯源、后门与隐私防护。意义回应版权与法规生成进入“可被监管”阶段是合规上线的刚需。应用场景版权风格擦除、AI 生成图溯源打标、防未授权微调、隐私保护生成。代表论文精读《Intra-finger Variability of Diffusion-based Latent Fingerprint Generation》G. 数据集与评测基准简述构建新的训练数据集、评测基准与指标覆盖身份保持、复杂性、安全性等维度。意义数据规模与评测合理性决定生成能力的上限与可复现的进步。应用场景细粒度身份保持评测、复杂性/组合性基准、安全合规评测、训练数据清洗。代表论文精读《Omni IIE Bench: Benchmarking the Practical Capabilities of Image Editing Models》H. 模型架构、合并与训练简述新骨干如 1D 视觉 tokenizer、DiT 变体、模型合并/剪枝/调制、训练范式创新。意义架构是上述所有路线的性价比底座决定“能力”与“成本”的交汇点。应用场景更高效的 tokenizer、多任务模型合并、端侧轻量骨干、训练稳定性优化。代表论文精读《MeanFlow Transformers with Representation Autoencoders》I. 风格迁移与个性化简述把特定艺术风格或特定主体人物/物体迁移或固化到生成中常借助 LoRA/适配器。意义支撑创意设计、品牌一致性与虚拟人是消费级应用的高频需求。应用场景个人头像/形象定制、品牌视觉统一、艺术风格滤镜、虚拟偶像。代表论文精读《Hist2Style: Histogram-Guided Stylization with Bilateral Grids》J. 自回归生成简述把图像当作 token 序列VAR/Next-token与 LLM 生态对齐的下一代架构。意义统一图文生成、便于与语言模型/推理链路融合是架构演进的重要方向。应用场景统一多模态生成、与 LLM 联动的图文创作、可控 token 编辑、流式生成。代表论文精读《Markovian Scale Prediction: A New Era of Visual Autoregressive Generation》K. 图像压缩、重建与复原简述用生成式方法做超分、压缩、去噪、修补、盲复原“生成即重建”。意义补足传统方法细节缺失在受限带宽/低质量输入下恢复高保真结果。应用场景老照片/医学图超分、图像压缩传输、去噪去模糊、文物/监控复原。代表论文精读《NanoSD: Edge Efficient Foundation Model for Real Time Image Restoration》L. 扩散基础理论与新范式简述扩散/流匹配的理论突破路径拉直、Mean Flow、最优传输、谱分析。意义理论突破带来事半功倍——少步、稳定、可控是方法的“放大器”。应用场景少步高质量采样、理论指导的架构设计、流匹配训练稳定、可控生成。代表论文精读《COT-FM: Cluster-wise Optimal Transport Flow Matching》M. 人脸、人体与肖像简述人脸/人体相关的生成、编辑、换脸、虚拟人驱动常结合身份约束。意义虚拟主播、影视预演、数字人等高频商业场景的技术核心。应用场景换脸/换装、虚拟主播驱动、肖像风格化、表情/姿态重演、证件照生成。代表论文精读《High-Fidelity Diffusion Face Swapping with ID-Constrained Facial Conditioning》