MiniMax H3 + ref2va:短剧样片人脸一致性与分镜生成实战 这次要拆解的是海螺 MiniMax H3 做短剧样片的一套完整工作流。先说明边界除了视频封面之外人物设定、分镜生成、音频配音、成片剪辑全部走开源方案。MiniMax H3 负责的是最关键的“视频画面生成”这一环同时通过 ref2va 全能参考模式解决短剧最容易翻车的场景人脸一致性问题。整套流程围绕三个核心问题展开第一同一个角色在不同分镜里能不能长得一样第二分镜之间怎么切换才不突兀第三AI 单段生成通常只有几秒到十几秒怎么把多段内容拼成一部有叙事节奏的短剧样片。这三个问题如果能打通短剧样片的生产效率会明显不一样。这篇文章会带你过一遍 MiniMax H3 的本地部署位置认知、场景人脸一致性分镜的提示词模板、ref2va 参考模式的完整使用思路、长时长视频的分段拼接方法以及批量任务和接口调用的扩展方案。适合正在做短剧、AI 视频内容生产、或者想用开源模型搭一套视频生成工作流的读者。1. MiniMax H3 核心能力速览先把关键信息放在前面。MiniMax H3 是视频生成模型社区内已经有本地部署版本和 ComfyUI 整合包出现配合短剧类工作流可以做角色统一的视频片段生成。下面的表格是基于当前可获得的公开信息和社区热词整理的速览实际参数以官方发布为准。能力项说明项目定位视频生成模型可用于短剧样片、分镜制作、角色一致视频生成模型规模社区信息指向 33B 量级开源版本具体参数量以官方发布为准开源情况模型开源可本地部署短剧工作流除封面外可全开源实现核心能力文生视频、图生视频、ref2va 全能参考模式场景优势短剧分镜、角色一致性、长时长视频分段拼接部署方式ComfyUI 工作流加载、整合包一键启动、命令行启动硬件门槛GPU 优先显存需按模型和分辨率评估CPU 可跑但速度较慢接口能力可基于 ComfyUI 的 API 做调用具体以实际方案为准批量任务支持工作流批量队列建议自建输入目录和命名规则提示词模板中文分镜、战斗场景、人物一致性提示词模板可复用从材料看MiniMax H3 在短剧样片方向上的主要优势不是单卡能跑多大分辨率而是 ref2va 参考模式带来了一个比较明确的用法让多段分镜共享同一张角色参考图从根上解决人脸不一致的问题。这个思路对短剧生产非常关键因为短剧观众对“同一个人在不同镜头里是否还是同一个人”极其敏感。2. 短剧样片制作适用场景与合规边界MiniMax H3 这套工作流适合谁适合有四类需求的人短剧创作者需要快速产出样片验证剧本节奏、人设、场景氛围。AI 内容工作室需要批量生成分镜素材再交给后期统一剪辑。独立开发者和 ComfyUI 用户想把视频生成能力接入自己的自动化流程。影视/广告前期团队用 AI 做概念预览和 pitch 片。能解决的问题很明确传统短剧拍摄需要演员、场地、灯光、摄影成本高周期长。用 MiniMax H3 加参考图工作流角色设定图确定之后每个分镜可以分别生成再拼接成样片。省掉的是前期拍摄的人力成本换来的是快速验证故事结构的效率。但也有不适合的场景需要提前说清楚需要极致画质、复杂调度、真实表演细节的正剧目前 AI 视频生成还不适合直接商用。需要精确到每一帧的物理效果、慢动作、流体模拟AI 视频生成不稳定。超过几分钟的长篇内容直接单段生成不现实必须拆分重组。涉及真实人物肖像、艺人脸、他人声音、版权音乐、原创角色的商业用途授权问题必须提前确认。这里必须强调合规边界如果你要生成带人脸的角色确保使用的是自己创作的角色图、已获授权的演员肖像或者纯虚构的 AI 角色。声音克隆和配音素材也要确认来源合法。短剧的剧本、台词、背景音乐、场景元素如果来自他人作品商用前需要获得授权。本地部署的模型输出的视频内容发布前要人工复核确保没有侵权、违规和误导风险。3. MiniMax H3 本地部署环境准备在开始之前建议先检查一遍本机环境。MiniMax H3 的部署通常走 ComfyUI 方案所以环境准备的核心是 Python PyTorch ComfyUI 模型文件。3.1 硬件要求从模型规模和社区讨论看MiniMax H3 是相对重型的视频生成模型运行以 GPU 为佳。下面是通用检查清单具体数值要根据你下载的模型版本和分辨率设置确认操作系统Windows 10/11、Ubuntu 20.04 或更高版本GPUNVIDIA 显卡优先显存越大越稳6G 以下建议先跑低分辨率测试是否能流畅运行需实测CPU支持 CPU 推理但视频生成速度会很慢只建议用 CPU 做功能验证内存建议 32G 以上长视频分段生成和批次任务对内存有要求磁盘预留 30G 以上空间模型文件、输出视频、工作流文件都会占空间3.2 软件依赖Python 3.10 或 3.11GitNVIDIA 显卡驱动版本需支持你的 CUDA 环境PyTorch with CUDAComfyUI 最新版ComfyUI 对应 MiniMax H3 的自定义节点这里有一个很常见的坑ComfyUI 本体和自定义节点是两个不同的更新节奏。如果你下载的是整合包一般会帮你配好如果是手动安装建议先启动一次原始 ComfyUI确认能正常打开页面再安装 MiniMax H3 相关节点。4. ComfyUI 整合包安装与模型加载MiniMax H3 目前最方便的使用方式是 ComfyUI 工作流。社区里已经有“ComfyUI MiniMax H3 整合包”出现整合包的优点是把 Python 环境、依赖、模型放置位置、启动脚本都打包好对新手更友好。4.1 通用安装流程如果你自己手动搭 ComfyUI可以参考下面这个流程路径以实际项目为准。# 克隆 ComfyUI 仓库 git clone https://github.com/comfyanonymous/ComfyUI.git cd ComfyUI # 创建虚拟环境推荐 python -m venv venv source venv/bin/activate # Windows 下为 venv\Scripts\activate # 安装依赖 pip install -r requirements.txt # 启动服务 python main.py --listen 127.0.0.1 --port 8188启动后浏览器访问http://127.0.0.1:8188能看到 ComfyUI 的工作流界面就说明基础环境没有问题。4.2 模型文件放置MiniMax H3 模型文件通常放在 ComfyUI 的models/checkpoints或models/diffusion_models目录具体看工作流要求。下载模型后注意核对文件大小不要只看名称就放进去。如果工作流加载时报文件名不一致可以修改工作流中的模型名也可以直接改本地文件名但要保持后缀一致。4.3 整合包启动说明如果你用的是社区整合包常见的启动方式有两种双击启动.bat或run_nvidia_gpu.bat命令行执行启动脚本例如python main.py整合包的优点是省去了手动配环境的步骤缺点是目录结构是固定的换机器容易找不到模型路径。建议拿到整合包后先打开目录看一遍确认models、custom_nodes、output三个目录的位置这对后面修改工作流和输出路径很有帮助。5. 短剧制作第一步角色设定图与参考图准备在 MiniMax H3 短剧工作流里角色一致性不是靠提示词硬撑的而是靠一张设计好的参考图。这一步如果参考图质量不行后面所有分镜都会跟着崩。5.1 角色设定图规范参考图需要满足以下条件面部清晰不要戴会遮挡五官的装饰光线均匀不要有强烈阴影构图尽量为正面或 3/4 侧面背景简单不要有复杂元素干扰角色服装、发型、标志性特征要和剧本设定一致角色设定图可以用开源绘制工具生成也可以用 Stable Diffusion 加 LoRA 固定画风。重点是画面里这个角色必须“干净、标准、可参考”而不是“好看但没法复用”。5.2 多角度角色参考短剧分镜会有正脸、侧脸、背面、远景等不同角度。只有一个正脸参考图时侧脸和背面镜头的一致性风险较大。建议准备 2 到 4 张同一角色的多角度设定图分镜时按需选择最接近的参考图而不是所有镜头都用同一张。5.3 参考图目录设计建议在项目中建立一个固定的素材目录结构short_drama_project/ ├── reference/ │ ├── character_1_front.png │ ├── character_1_side.png │ ├── character_2_front.png │ └── scene_style.png ├── prompts/ │ ├── scene_1_shot_1.txt │ ├── scene_1_shot_2.txt │ └── templates/ ├── output/ │ ├── scene_1/ │ └── scene_2/ └── audio/这种目录结构的好处是批量任务时可以按文件夹批量处理不用手动区分素材。6. 场景人脸一致性ref2va 全能参考模式实战ref2va 是 MiniMax H3 工作流里出现频率很高的参考模式也是解决“场景人脸一致性”的核心节点。它的思路是给模型一张参考图视频生成过程中模型持续参考这张图中的人物特征让不同分镜里的角色看起来是同一个人。6.1 ref2va 模式操作步骤实际操作时流程如下在 ComfyUI 中加载 MiniMax H3 工作流。找到参考图输入节点接入第 5 步准备好的角色设定图。设置生成模式为 ref2va 或对应的参考模式。在提示词中写明当前分镜的画面内容同时强调角色特征与参考图一致。生成一个短片段抽帧检查人脸是否一致。如果人脸有漂移优先调整参考图清晰度再检查提示词中是否出现了互相冲突的描述。6.2 ref2va 模式提示词规范从社区讨论来看ref2va 模式对提示词的要求更高因为它既要从参考图取人物特征又要理解提示词里的场景、动作和镜头语言。下面给出一个可以复用的中文提示词模板[场景地点]现代都市天台夜晚霓虹灯闪烁 [人物特征]亚洲男性28岁左右黑色短发左眉有一道浅疤穿深灰色长款风衣与参考图保持一致 [动作]站在天台边缘转身看向镜头神情由平静转为凝重 [镜头]中景缓慢推进轻微仰拍浅景深背景灯光虚化 [氛围]冷色调城市夜景隐约有车辆鸣笛声 [画质]电影感35mm胶片质感细节丰富8K超清这个模板有几个关键点人物特征段必须明确写“与参考图保持一致”这是锁定角色的提示词锚点。动作和情绪可以用“由平静转为凝重”这种过程描述而不是只写“面无表情”。镜头段要写景别、运镜、光影这对分镜一致性很有帮助。画质段统一放在末尾固定风格用。6.3 单人镜头的验证方法第一次测试建议只跑一个角色、两个分镜分镜 A角色从门口走进来中景。分镜 B角色坐下近景。分别生成后用截帧工具把两个片段的角色脸部截出来并排对比。如果五官轮廓、发型、服装细节基本一致说明 ref2va 参考模式在这个环境里是可用的。如果出现明显的脸型变化按优先级排查参考图清晰度和角度是否合适提示词里是否有多余的角色描述比如又写了“另一名男子”分辨率是否过低导致人脸细节丢失模型版本和 ref2va 节点版本是否匹配7. 分镜制作提示词模板与运镜控制短剧的分镜和单张 AI 绘画不同AI 视频生成需要的是“镜头语言”的清晰描述而不是一句画面描述。同一个场景运镜方式不同情绪完全不同。7.1 分镜提示词模板库建议把提示词模板分成两类场景模板和镜头模板。场景模板负责固定环境和人物特征可以复用。[场景]废弃工厂内部混凝土墙面昏暗灯光铁锈与灰尘 [人物]一名年轻女性齐肩短发穿深色工装夹克火焰纹身从左手腕延伸到小臂与参考图保持一致 [光线]顶光为主冷色环境光局部暖色点光源 [氛围]压抑、紧张、山雨欲来镜头模板负责控制景别、运镜和节奏。[景别]远景 → 近景 推进 [运镜]缓慢推进镜头轻微晃动模拟手持摄影 [节奏]前 2 秒静止第 3 秒开始推进 [转场]结束后淡出至黑场实际使用时把场景模板和镜头模板拼接再补上当前分镜的动作描述就构成一条完整的分镜提示词。7.2 战斗场景提示词模板“MiniMax H3 AI 超燃战斗打斗提示词中文提示词模板”是热词中出现过的方向。战斗场景比普通对话场景复杂因为要同时描述双方动作、速度、碰撞和镜头节奏。这里给一个通用模板[双方角色]角色A黑色劲装手持短刃与参考图保持一致角色B灰色长袍空手格斗与参考图保持一致 [动作]角色A从左前方斜劈角色B侧身闪避后反击拳风带起地面尘土 [镜头]中景快速横移镜头跟随角色A最后定格在角色B反击的瞬间 [速度]动作快速带残影效果击打瞬间有短暂停顿表现冲击感 [氛围]尘土飞扬冷色调环境刀刃反光冷白 [画质]电影动作片质感高速摄影细节锐利战斗场景的提示词核心是“动作链 速度变化 镜头跟随”。如果只写“两人打斗”生成结果很容易变成两个角色原地挥舞。7.3 分镜列表实践短剧样片建议先列一个分镜表再逐条生成。下面是一个示例分镜表镜号场景景别运镜人物动作时长参考图1城市天台远景→中景推进角色A俯瞰城市4s角色A正面2城市天台近景固定角色A转身看镜头3s角色A侧面3废弃工厂中景手持晃动角色B从阴影走出5s角色B正面4废弃工厂全景横移双方对峙6s角色AB7.4 运镜控制的经验AI 视频生成的运镜控制有一定随机性。比较稳妥的做法是先用一个分镜测试运镜描述是否生效。如果模型对运镜描述不敏感优先减少运镜的复杂度改为“固定镜头”或“缓慢推进”。对镜头运动要求高的场景可以生成后通过视频剪辑软件二次加运动曲线而不是完全依赖模型。分镜切换处建议预留 0.3 到 0.5 秒的缓冲镜头方便后期拼接。8. 长时长视频拼接多段式短剧工作流短剧样片通常不止一个镜头。AI 视频单段生成时长有限长时长视频要靠多段拼接。MiniMax H3 在长视频把控上的核心思路是用一致性参考图保证角色统一用分镜表保证节奏统一用拼接规则保证叙事统一。8.1 分段生成策略把短剧按“场次”拆分每场次内部再按“镜头”拆分。每段生成 3 到 6 秒生成多段后拼接。流程如下写文字剧本按场景切换切成段落。每个段落抽象出 3 到 6 个关键镜头。为每个镜头写提示词格式按第 7 节的模板。用 ref2va 参考模式逐个生成。对生成结果抽帧检查人物一致性和画面质量。用 ffmpeg 或剪辑工具把通过检查的片段拼接。添加转场、音效、背景音乐和字幕。8.2 拼接规则拼接时的几个经验相邻镜头尽量在亮度、色调上保持一致。如果前一个镜头是冷色调下一个镜头突然变暖观众会明显感到跳变。转场不要堆效果。AI 视频本身镜头切换就很快使用淡入淡出、黑场、叠化这类基础转场最安全。人物位置和朝向要连贯。分镜表里要标注角色的朝向例如“面向镜头左侧”避免上一秒面朝左下一秒面朝右。音频是关键。加入配音和背景音乐后很多画面生硬的问题会被掩盖。8.3 长视频音画同步这里提供一个简单方案先生成视频画面再单独生成配音最后用剪辑软件对轨。短剧样片的配音可以用开源 TTS 生成也可以用真人录制。音画对齐的方法以画面中的人物口型和动作节奏为基准。把配音分成短句每句对应一个镜头。使用剪辑软件的音轨对齐功能手动微调 0.1 秒级别的时间差。9. 批量任务与队列设计短剧样片不是只做一两个镜头而是几十个镜头的批量生产。MiniMax H3 如果走 ComfyUI 工作流批量任务主要通过 ComfyUI 的队列机制或 API 接口实现。9.1 批量任务的基础思路批量任务有两种常用方式在 ComfyUI 工作流界面里手动排队切换输入图片或提示词点击“运行”模型一次处理一个任务。通过 API 接口提交任务用 Python 脚本把不同分镜的提示词和参考图组合成任务队列逐个发送到 ComfyUI 服务。第二种方式更适合做流水线因为可以记录日志、处理失败重试、控制并发。9.2 Python 调用 ComfyUI API 示例下面是一个通用模板。ComfyUI 的 API 格式本质上是把你保存的workflow转成 API 格式的 JSON具体字段以你保存的工作流为准。import requests import json # ComfyUI 服务地址 server_addr http://127.0.0.1:8188 # 读取工作流 JSON # 注意这里需要导出的 API 格式 JSON不是在 ComfyUI 中保存的 UI 格式 with open(mini_max_h3_api.json, r, encodingutf-8) as f: workflow json.load(f) # 提交任务到队列 response requests.post(f{server_addr}/prompt, json{prompt: workflow}) if response.status_code 200: print(任务提交成功) task_id response.json().get(prompt_id) print(任务ID:, task_id) else: print(任务提交失败, response.status_code, response.text)9.3 批量目录与命名规则批量任务最容易出问题的地方是输出文件覆盖。建议每个分镜独立输出目录并在提示词中把当前分镜编号写入输出文件名或者通过脚本在输出后立即重命名。import requests import time def submit_batch(tasks, server_addrhttp://127.0.0.1:8188): for idx, task in enumerate(tasks): try: resp requests.post(f{server_addr}/prompt, json{prompt: task}, timeout30) if resp.status_code 200: print(f任务 {idx} 提交成功) else: print(f任务 {idx} 提交失败: {resp.status_code}) except Exception as e: print(f任务 {idx} 出现异常: {e}) time.sleep(1)9.4 失败重试建议AI 视频生成存在随机性部分镜头会崩坏这是正常现象。合理的方式是每次生成后自动检测输出文件是否存在且体积大于阈值。对失败任务重试 2 到 3 次如果仍失败则记录日志人工排查提示词或参考图。避免对同一个死循环重试无限次浪费 GPU 资源。10. 资源占用与性能观察10.1 显存占用观察方法显存占用是 MiniMax H3 本地部署最需要关注的点。可以用 nvidia-smi 实时查看watch -n 1 nvidia-smiWindows 下可以直接打开任务管理器性能页签里选择 GPU查看“专用 GPU 内存”。显存占用需要以实际模型版本和推理参数为准。不同的分辨率、步数、批量大小、是否使用 ref2va 参考模式显存占用差异很大。建议先跑一个低分辨率小步数的测试片段观察显存峰值再逐步调高。10.2 CPU 推理与 GPU 推理的差异CPU 推理不是不行但视频生成本身计算量大CPU 推理速度会明显慢于 GPU。如果你只有 CPU 环境建议不要直接跑多镜头长视频而是先做单镜头功能验证。AMD CPU 能否稳定支撑本地部署需要看 PyTorch 后端对 CPU 指令集的支持和具体项目依赖比较稳妥的判断是先跑一个小模型验证环境。10.3 降低显存占用的手段降低分辨率从 480p 或 720p 开始确认效果后再升到 1080p。减少步数20 步到 30 步先试步数越高显存和耗时越大。单批次只生成一个视频不要同时排多个高分辨率任务。关闭不需要的预览节点和后处理节点。使用 ref2va 模式时参考图分辨率不要过大先压缩到 512 或 768。10.4 端口冲突和进程残留ComfyUI 默认端口是 8188如果被占用# 换端口启动实际端口按你的环境调整 python main.py --listen 127.0.0.1 --port 8189出现“端口被占用”时先检查是否有残留的 Python 进程。Windows 下可以用资源管理器结束 Python 进程或使用命令行查找占用端口的进程。10.5 性能观察清单建议每次跑完一个测试集记录以下字段方便比较参数变化对效果的影响字段记录内容分辨率生成视频的宽高步数采样步数模型版本MiniMax H3 的具体版本号参考图使用的角色参考图文件提示词长度提示词的字符数显存峰值nvidia-smi 记录的最大显存单段耗时从提交到输出的总耗时是否成功成功/失败失败原因显存不足、超时、输出为空等11. 常见问题与排查方法以下排查表基于 ComfyUI 部署 MiniMax H3 的常见问题整理具体现象以你本机会话为准。问题现象可能原因排查方式解决方案启动后页面打不开端口被占用或服务未启动检查日志和端口监听状态更换端口或重启服务模型加载失败模型文件未放对目录或文件损坏检查模型目录核对文件大小重新下载或修正工作流中的模型名生成视频速度极慢使用 CPU 推理或 GPU 未启用查看日志中的设备信息安装匹配的 PyTorch CUDA 版本生成结果画面模糊分辨率过低或步数不足提高分辨率或步数比较输出测试不同的分辨率/步数组合人脸出现漂移参考图不清晰或提示词冲突抽帧对比角色特征换高清参考图精简提示词多镜头角色不一致ref2va 模式未启用或参考图不一致检查工作流节点连接统一使用同一组参考图生成过程中显存不足分辨率/步数设定过高查看 nvidia-smi 显存峰值降低分辨率或单批次任务数输出视频为空文件推理中断或参数不合法检查日志和输出文件大小重置参数重新提交任务API 调用返回 400工作流 JSON 格式不被接受在 ComfyUI 中导出合法 API 格式使用正确的 API 格式 JSON批量任务在某一镜卡住单次生成失败后任务阻塞查看队列状态和日志脚本增加超时和重试机制端口被占用上次服务未正常退出查看端口占用进程结束残留进程或更换端口12. 最佳实践与合规建议12.1 工程化建议第一次先跑最小可运行配置低分辨率、少步数、一个镜头、一张参考图。全流程跑通后再扩展。保留一套“最小可运行工作流”备份参数乱了随时回滚。模型文件、输入素材、输出结果分目录管理不要全堆在一个文件夹。批量任务必须加日志和失败重试否则 GPU 卡住都不知道是哪个镜头出了问题。接口服务要限制访问范围尤其不要直接把 ComfyUI 服务暴露到公网建议监听 127.0.0.1 并配合防火墙。参考图、输出视频、提示词版本之间建立对应关系方便回溯“这个结果是用哪组参数跑的”。生成结果不要直接发布先过一遍人工复核检查人脸、文字、场景是否出错。12.2 合规边界使用 MiniMax H3 生成视频前确认模型使用条款允许你的应用场景。涉及人脸的视频确保角色为虚构形象或已获得肖像授权。涉及声音克隆和配音素材确认音色来源合法。涉及版权音乐、电影片段、明星形象不能无授权使用。短剧剧本和台词如果是改编自他人作品需获得授权并注明来源。商用前先确认模型输出内容的权利范围和发布平台规则。13. 总结与下一步MiniMax H3 这套短剧工作流最值得尝试的点是 ref2va 参考模式带来的人脸一致性能力它让“多镜头共用一张角色脸”从提示词玄学变成了可操作的工作流。最先应该验证的是准备一张高清角色参考图只跑两个分镜一个中景一个近景用 ref2va 模式生成抽帧对比人脸。这个测试成本最低却能直接决定这套工作流适不适合你的项目。最容易踩的坑是第一遍就追求高分辨率长视频结果显存爆掉、输出不稳定、人脸翻车。正确顺序是小参数验证流程再逐步调高分辨率和镜头数。后续可以扩展的方向包括接入开源 TTS 做自动配音用 ffmpeg 做批量转场和字幕压制把每个分镜的输出接入剪辑软件统一调色甚至构建一个从剧本到分镜到成片的半自动流水线。MiniMax H3 只是一个环节但把它的参考模式、提示词模板和批量任务用顺了短剧样片的生产链路就会清晰很多。建议收藏备用动手跑一组小样片验证效果。