
今天展示的案例是一个基于GLIGEN 文本框的 ComfyUI 工作流。通过在画布上添加文本框并设定位置,可以在生成图像时对物体的出现位置进行精确控制。与常规的文本提示词生成方式相比,这种方法为场景布局提供了更高的可控性。例如在生成风景图片时,可以指定山脉在背景中央、太阳位于画面一角,而瓶子等细节元素则被固定在指定区域。结合 GLIGEN 的控制能力,整个流程能够在保持画面风格一致的同时,确保物体出现在理想的构图位置。文章目录工作流介绍核心模型Node节点工作流程大模型应用CLIPTextEncode(正向) 图像生成文本条件核心GLIGENLoader GLIGEN 文本框模型加载器GLIGENTextBoxApply(多次调用) 物体位置精确控制EmptyLatentImage 初始潜变量生成KSampler 图像采样生成VAEDecode 最终图像解码使用方法应用场景开发与应用工作流介绍该工作流以Stable Diffusion v1.5模型为基础,并结合GLIGEN 文本框模型来实现图像局部元素的精准控制。整体设计包含三个核心环节:基础模型加载、GLIGEN 条件约束以及采样与解码生成。Checkpoint 模型提供图像生成的整体语义能力,GLIGEN 模块负责解析文本框及位置信息,从而将提示中的特定元素绑定到画布指定区域。通过这种组合方式,既能发挥稳定扩散模型的绘画能力,也能满足场景构图的个性化需求。核心模型在该工作流中,核心模型由通用的Stable Diffusion v1.5 检查点模型与GLIGEN 文本框模型共同组成。前者负责图像的整体生成能力,确保生成结果具备高质量的细节与风格一致性;后者则承担元素位置约束的任务,允许用户在图像生成过程中设定关键物体的具体位置与尺寸。两者结合,使得生成过程既具备创造性又具备可控性,满足对构图严格要求的任务。模型名称说明v1-5-pruned-emaonly-fp16.safetensors