MiniMax H3短剧工作流:从参考图到批量生成的开源落地指南 MiniMax H3 这套短剧样片工作流核心不是“一键出片”而是在开源工具链里把角色长相、镜头语言、提示词模板、长时长分段这些最容易翻车的地方逐一接住。我最近在 ComfyUI 里做了一轮完整的短剧向测试从单条分镜到批量生成从参考图锁定人脸到把多个场景连成一段叙事除了封面处理用了一点外部工具其余环节基本都走开源方案。整体跑下来我的判断是这套思路值得复制但前提是你得先接受它的边界。先说它适合谁。如果你只是随手生成一条“会动的图”不需要这套流程如果你做短剧向内容需要同一个人物在多个场景里保持相似外形同一套提示词模板能产出风格统一的镜头还要把多个片段接成一段能看得下去的叙事那就值得把“参考图 提示词模板 分段生成 批量管理”这个组合完整搭起来。下面按实际落地顺序拆一遍重点不是展示某一条样片有多好看而是把短剧向制作里真正会卡住人的环节讲清楚。1. 先说明白短剧向 AI 视频的难点不在生成而在“控制”1.1 单条视频很容易好看难的是让人物“不变”短剧和刷短视频最大的区别是它有连续的人物、连续的场景、连续的叙事。观众可以接受单个镜头里有些小瑕疵但绝对不能接受同一个角色换个镜头就变成另一个人。所以短剧向 AI 视频最核心的问题不是“能不能生成视频”而是“能不能在十几条、几十条分镜里保持同一组角色的稳定辨识度”。我见过不少人第一次做短剧向内容时把大量时间花在模型选择上到处找“更清晰”“更电影感”的生成方式。真正跑完一轮之后你会发现模型能力当然重要但决定样片能不能用的是控制能力参考图是否稳定、提示词结构是否统一、分镜之间是否连贯。这些控制能力恰恰是通过工作流设计出来的不是靠某一次抽卡抽出来的。举个例子我在测试时做了一个三镜头连起来的小样片第一个镜头是角色在楼道口回头第二个镜头切到室内走路的背影第三个镜头回到角色正面。前两个镜头看起来都还行但第三个镜头里角色的刘海方向突然变了。原因就是我在第三个镜头的提示词里多写了“头发有点乱”模型把这一句理解成了发型改变。后来删掉这类干扰描述用同样参数重新生成一致性立刻恢复。这类问题很难靠模型升级彻底解决只能靠提示词纪律和参考图约束来控制。我这里说的人脸一致性不是要求像素级克隆。我的判断标准很简单把两个镜头截图放在一起观众能认出是同一个角色。脸型、发色、服装颜色、气质这些关键信息不变表情和动作可以有变化。做到这一点对短剧来说已经够用。1.2 开源的“实现路径”和商业软件的边界标题里写“除封面全部由开源实现”这是很关键的信息。ComfyUI 本身是开源项目MiniMax H3 的社区集成也有对应的自定义节点和整合包工作流编排、节点连接、批量任务、输出管理都能在这一套里完成。封面处理和最终的正式剪辑通常用剪映、Photoshop 这类商业工具这不属于生成链路的范围。社区整合包的好处是快速启动省掉手动配置依赖和模型路径的时间。但整合包也容易让人“知其然不知其所以然”。跑通之后我建议还是把节点结构、模型文件位置、依赖版本都确认一遍。否则换个机器、升级一次 ComfyUI很容易出现“能启动但跑不出结果”的尴尬情况。开源方案的最大优势是可定制但可定制的前提是你知道自己装了什么东西。另外工作流里的节点编排也很重要。ComfyUI 的每个节点都有输入输出一旦某个节点的命名冲突或者类型不匹配整个流程就会卡住。我一般会把参考图加载、视频生成、输出保存分成三个区块区块之间用清晰的节点名连接。这样即使某个区块出错也能快速定位到具体节点而不是在一大张连线图里慢慢找。2. 环境准备先把部署方式、硬件边界和 ComfyUI 状态确认好2.1 本地部署还是在线调用取决于任务规模MiniMax H3 的部署方式社区里讨论最多的就是本地部署和在线接口两条路。本地部署的好处是隐私可控、批量测试时不按次计费代价是硬件要求不低而且首次配置成本高。社区里经常有人问能不能在特定硬件上跑比如 AMD 的 CPU、低显存显卡这类问题没有统一答案要看模型体积、量化方式和推理框架支持情况。我的建议分两种情况。如果只是想验证工作流是否可行先用在线接口或官方示例跑通确定输出质量能接受再考虑本地部署如果要做长期、频繁的批量生成而且本地显存、内存和磁盘条件允许本地部署更划算。显卡方面低显存不是不能试但分辨率、单批次数量、单条视频长度都要降下来。长时长任务尤其吃资源启动前先看好显存占用别让任务跑到一半被系统杀掉。2.2 ComfyUI 环境里必须确认的四件事不管用整合包还是手动安装ComfyUI 环境里至少确认这几项Python 和 torch 版本是否匹配视频生成节点对版本比较敏感。自定义节点是否完整缺节点时启动会提示对应的包名。模型文件路径是否正确很多“生成失败”其实是模型没加载出来。输出目录是否有写入权限批量任务跑到一半写不进去会很难受。如果你是从整合包起步第一次启动报缺包很正常。优先看提示里是哪个节点、哪个依赖缺失再针对性安装。不要一口气把整个 requirements 全装进去版本冲突可能比缺包更麻烦。环境项建议确认方式常见问题Python / torch查看启动日志和依赖列表版本不匹配导致节点无法加载自定义节点用节点管理器查看缺失项启动时提示请安装缺失的包模型路径打开节点确认实际加载路径路径错误导致生成失败或空白输出目录手动运行一条最小任务权限不足时视频写不进去注意先用一条非常短的视频验证整条链路确认能出片再逐步加时长。不要第一步就追求“完整样片”。3. 单条分镜跑通从参考图到可用视频片段的验证链路3.1 先做一张能当“角色锚点”的参考图短剧分镜通常从参考图开始。参考图不需要多精致但必须把角色特征交代清楚正面脸部、完整发型、标志性服装、主要配色。我一般会先用文生图把角色定下来保存成固定文件后续所有镜头都拿这张图作为参考而不是每个镜头重新随机生成一个角色。参考图的质量直接影响视频结果。如果参考图本身五官模糊、头发边缘破损生成视频时这些缺陷会被进一步放大。这里我建议先做一次放大和局部检查确认眼睛、鼻子、嘴唇这些关键区域是清晰的再拿去生成视频。背景越简单越好人物占比越大越好。如果参考图里同时有多个人物、复杂背景或大面积遮挡模型很容易把无关信息也当成参考特征最后生成出来的画面重点不清。3.2 最短链路加载参考图、生成视频、检查输出在 ComfyUI 里搭好“加载参考图 → 送入视频生成节点 → 输出视频”这条最短路程先跑一条 2 到 3 秒的测试片段。这一条的任务不是追求完美而是验证链路本身。验证分为三步。第一参考图能不能被正确识别。输出视频里的人物应该具备跟参考图一致的主要特征如果完全不像先检查参考图是否符合输入要求。第二提示词里的动作描述有没有生效。如果人物站在原地完全不动说明动作提示没有被模型理解先改提示词不要急着调参数。第三输出文件能不能正常保存和预览。很多新手在这里卡住以为是生成失败其实只是输出路径不对或者文件格式不支持本地预览。如果测试片段出现以下现象我会按顺序排查人物不像输入图先看参考图画面全是噪点或黑屏先看模型加载和显存占用动作完全没执行先看提示词输出文件没有生成先看输出路径。一次只排查一个变量不要同时改多个参数。单条任务跑通之后再进入批量阶段。原因是批量测试时所有输入都在同一条链路上如果链路本身有问题你会同时收到几十条错误结果根本没有办法判断先修哪个。先单条、后批量是所有批量化操作的前提。4. 人脸一致性参考图、种子、提示词三条线配合才靠谱4.1 参考模式不是“有图就行”社区里经常提到的参考模式比如“ref2va”这类全能参考模式核心是让模型在生成视频时参考角色图片。但这不是随便传一张图就能保证稳定。我实测的经验是参考图的“纯净度”比清晰度更重要。背景简单、没有过多遮挡、人物正面朝前是最稳定的输入形态。参考权重也需要取舍。权重太高人物会被“定死”动作僵硬表情不自然权重太低人物特征又容易漂移发色、脸型、服装颜色都可能变化。这个参数没有标准答案只能按场景微调。我一般先用中等权重跑一条样片观察脸部是否稳定再以 0.05 的步进上下调整直到找到既像又不僵的值。还要注意参考图只解决“长什么样”的问题不解决“做什么”的问题。一个动作描述很模糊的镜头即使人脸没变画面内容也是不可控的。所以参考模式要跟提示词模板配合使用一个管外观一个管动作。4.2 种子不是保命符但它是排查工具很多人以为固定种子就能保证人脸不变。实际上视频生成任务的输入不止种子一个参考图、提示词、模型版本、采样参数都会影响结果。种子更像是排查工具当同一张参考图、同一段提示词两个镜头结果差异过大时先对比种子和输入图再判断问题出在哪里。批量测试时我建议固定一个种子区间做对照实验。比如同一个提示词、同一张参考图跑 5 到 10 个种子统计人脸稳定率。如果绝大部分结果都保持角色稳定说明链路可靠如果只有一两个好看说明你只是抽中了幸运结果。接下来要回头检查参考图和提示词而不是加大生成数量去拼运气。因子主要作用排查优先级参考图锁定角色外观基础高先确认图本身可用提示词控制动作、场景、镜头、风格高出现动作不生效优先查种子控制随机因素用于重现和对照中排查差异时使用采样参数影响画面质量和稳定性低链路稳定后再调整5. 提示词模板把场景、动作、镜头拆成可复用的部件5.1 为什么不要把所有内容写进一句话短剧工作流里的提示词模板核心价值是复用。把角色描述、动作、镜头、场景、风格写在一句话里每生成一个镜头都重写一次角色描述很容易被无意中改掉一个词比如“深蓝色外套”变成“蓝外套”结果人物外观漂了你还不容易发现。更稳的做法是把提示词拆成部件角色描述作为公共部分每个镜头都复制同样的文本动作状态、场景环境、镜头语言按分镜各自替换风格描述保持固定。这样既保证公共特征一致又能让每个镜头在动作和场景上有所差异。所有镜头共用同一个“角色底座”画面风格和人物外观的漂移概率就会低很多。5.2 一套可以起手的中文提示词模板结构短剧向场景里中文提示词模板很实用。下面是一个通用结构实际使用时按模型能力调整字段顺序和写法角色黑色短发女性25岁左右穿深蓝色牛仔外套白色内搭耳后有银色耳环。 动作站在老旧居民楼楼道口左手扶住门框回头看向镜头表情带着警觉。 镜头中近景平视视角浅景深背景虚化。 场景傍晚楼道暖黄灯光墙壁有旧海报地面有潮湿反光。 风格电影感画面干净面部光线充足无文字无水印。使用模板时每个镜头只改“动作”“镜头”“场景”三个部件角色和风格保持不变。比如下一个镜头改成室内咖啡店直接替换“场景”字段保留“角色”和“风格”出来的结果更接近同一个角色换了个地方而不是重新生成一个人。模板里的关键信息要写具体。颜色写“深蓝色”比“蓝色”稳定材质写“牛仔外套”比“外套”稳定人物位置写“站在门框左侧”比“站在旁边”稳定。提示词越具体随机解释的空间越小。短剧的提示词模板不是一套而是至少分三套人物出场模板、动作推进模板、场景环境模板根据镜头内容组合使用。6. 长时长视频分段生成、转场衔接和节奏把控6.1 分段生成是长视频最现实的解法长时长视频不能指望一次生成至少在普通硬件环境下不现实。短剧短则几分钟长则十几分钟如果按镜头逐条生成再拼接工程量很大所以必须分段管理。我建议以“场景组”为单位一个场景内的多个镜头先归为一组先生成这一组里的人物状态和关键帧再逐条生成视频片段。“全方位把控”长时长视频重点在三个地方画面连续性、人物一致性、节奏合理性。画面连续性靠转场和剪辑人物一致性靠参考图和提示词模板节奏合理性要在分镜脚本阶段就规划好。只盯生成参数、不看素材组织长视频很容易变成一堆好看但拼不起来的碎片。分段还意味着输出管理要提前设计。每个场景组一个文件夹文件夹内按镜头编号排列文件名里带上场景号和镜头号。这样即使中间需要重新生成某一条也能快速定位不会把整个项目推翻重来。6.2 时长预算和转场衔接的实操思路我通常会给每个场景组定一个总时长预算。比如一段 60 秒的短剧片段开场 5 秒交代环境中间 40 秒推进动作和对话最后 15 秒收尾。分镜生成时按这个预算分配每条视频的长度而不是想到哪拍到哪。转场衔接要注意前一个片段结束时的动作、视线方向和后一个片段开始时的状态。AI 视频生成的单条片段是独立的前后两条之间不一定能自然衔接。提前在分镜脚本里标注清楚上一个镜头结束时的动作、下一个镜头开始时的动作能明显减少后期硬切。比如上一个镜头人物看向左侧下一个镜头就安排一个与左侧相关的回应画面观众能顺着视线方向理解场景。如果多个片段拼接后出现人物微变我会回到源头检查而不是在剪辑阶段硬修。因为剪辑阶段能修的只是切法没法修人物外形。这个问题越早发现返工成本越低。7. 批量生成队列、命名、失败重试和资源监控不能省7.1 批量任务不是单条任务的简单复制一句话总结批量任务如果只看“能不能跑”你会在第三步就把自己坑了。批量任务要额外考虑输入列表、输出命名、失败跳过和断点续跑。输入文件建议按固定规则命名比如 scene01_shot01