
简介本资源是面向AI短剧创作者的开源自动化生成流水线基于ComfyUI构建集成Skills系统实现小说/故事到多集视频剧本的一键转化专为降低提示词试错成本、提升短剧工业化生产效率而设计。资源包共41个文件含10个Python核心脚本如pipeline_generator.py、storyboard_breaker.py、fish_speech_tts.py、14个Markdown文档涵盖分镜规划指南、一致性保障方案、案例实操说明等、12个JSON工作流配置覆盖文生图、图文生视频、分镜拆解等关键节点以及Shell脚本、HTML前端界面与PNG示意图整体仅1.2MB轻量易部署。目前已有124人学习下载适合具备基础ComfyUI使用经验的中阶创作者快速上手——可直接复用完整流水线结构调用模块化Skill组件定制分镜逻辑、语音合成与视频合成流程并参考配套文档理解各环节Prompt设计原理与参数协同机制。 做短剧的人都知道一条60-90秒的短剧素材从选题、文案、分镜到出图、出视频再到配音、字幕、剪辑传统流程跑下来少则一两天多则一周。而AI把这条链路压缩到了分钟级但问题也随之而来——AI能力散落在各个网站、各个脚本、各个模型里今天你要去这里抠图明天去那里配音后天再手动拼字幕流程不仅没有变轻反而更碎。我搭这套“AI短剧生成流水线”就是想把散装的AI能力收拢成一条可视化的生产链路。底层用ComfyUI做节点编排每个节点干一件事节点之间用连线串起来上层用Skills系统做任务封装把整套工作流打包成按剧目类型调用的“技能”最后用zip格式整体分发拿到包的人解压、放模型、启动直接就能跑。这篇就把这套方案的选型逻辑、部署细节、踩坑实录和工程化思路一次讲清楚适合想做AI短剧批量生产、或者在ComfyUI上做工作流分发的朋友参考。1. 为什么我会把短剧生产搭在ComfyUI上而不是纯代码管线先说结论短剧生成这件事本质是一串“模型参数中间产物”的组合调用。写Python脚本也能做但维护成本和调试成本会把你拖垮。ComfyUI的节点式界面天然适合这种多步骤编排这也是我最终锁死它来做流水线底座的原因。1.1 短剧生产不是一个模型调用而是一条多模型链路你回想一下短剧的制作流程生成剧本需要大语言模型生成角色设定图需要文生图模型保持角色一致性需要参考图控制类模型把静态图变成动态视频需要视频生成模型最后还得配音、加字幕。这一套跑下来至少涉及四到六种不同的模型能力。传统做法是每个环节单独用工具环节之间用文件传递。出图保存到本地再用另一个工具读图生成视频中间人对图、改参数来回折腾。ComfyUI的做法是把这些环节全部变成节点一个节点的输出直接作为另一个节点的输入中间不需要手动搬运文件。举个例子我的一条基础流水线长这样LLM节点生成分镜脚本 → 文生图节点生成场景图 → 参考图节点保证角色面容一致 → 视频生成节点把图变成动态片段 → 字幕节点把文案压进画面。所有连线在ComfyUI的界面里一目了然哪个节点出了问题红色报错直接指到那个方块上不用去翻日志猜。1.2 节点化比写代码好在哪可视化、缓存、易分享很多人觉得写Python脚本更“程序员”但真正跑起来你会遇到三个痛点第一是调试困难。脚本跑挂了你得看traceback、查变量、理逻辑ComfyUI里节点报错直接高亮输入输出实时可见改一个参数重新run立刻能看到效果变化。第二是缓存机制。ComfyUI会缓存每个节点的计算结果你只改了最后面的字幕节点前面已经跑过的出图、出视频节点不会重新计算。脚本管线要实现同样的增量计算得自己设计缓存逻辑工作量不小。第三是可分享性。代码发给别人对方要配环境、装依赖、跑demo.json工作流文件发过去对方只要有ComfyUI拖进去就能看到同样的人物、连线、参数。这一点对团队协作和方案分发太重要了。1.3 与WebUI、纯云服务的对比取舍用ComfyUI之前我也试过WebUI。WebUI的交互确实对新手友好但它的问题在于“单任务模式”——一次只能做一件事做完了才能做下一件。短剧生产是流水线不是单点操作WebUI里你要手动切换功能页签自动化程度太低。云服务的问题则是成本和数据隐私。短剧素材可能涉及未公开剧本反复上传到云端让第三方做推理内容和时间成本都不可控。ComfyUI本地部署后模型都在自己机器上跑批量生成不花钱素材不出门这也是很多个人创作者最后回到本地管线的原因。提示如果你完全没接触过ComfyUI建议先把它当成“可视化工作流工具”来理解不要一上来就研究底层框架。它解决的核心问题就是让多个AI模型之间的协作变得可见、可改、可复用。2. 从爆款短剧的固定套路反推流水线需要的节点能力流水线不是凭空设计的我是从短剧内容生产的角度倒推需要哪些能力再去ComfyUI里找对应的节点。你直接照着这个思路搭能少走不少弯路。2.1 剧本、分镜、角色一致性内容前置节点短剧的核心是“人设抓人、剧情上头”所以流水线的第一段是内容生成。LLM节点负责从选题产出剧本再拆成分镜文本。这里要注意不能让LLM直接输出长段落最好要求它输出结构化的分镜表格镜号、景别、画面描述、台词、字幕文本。然后就是角色一致性。做短剧最怕角色“变脸”——上一幕是这个人下一幕换了个脸观众立刻出戏。ComfyUI里通常用IP-Adapter或InstantID这一类节点把角色参考图作为条件输入让后续生成的每一帧都朝参考图靠拢。经验是参考图不要只用一张最好准备正脸、侧脸、半身各一张模型对角色特征的捕捉会更稳。2.2 静态图生成、动态视频生成核心生产节点画面生产节点是整个流水线里算力消耗最大的部分。静态图生成节点属于基础层动态视频生成才是短剧量产的关键。目前主流方案分两类一类是Wan这类从图直接生成视频的模型另一类是AnimateDiff这类基于Stable Diffusion微调的方案。我的建议是短剧场景里优先选前者。原因是短剧需要的是“表演感”——人物要有表情变化、肢体动作而不是单纯的光影流动。Wan类模型对镜头语言和人物运动的建模更完整直接输入分镜图加提示词就能产出带叙事感的动态片段。AnimateDiff更适合做风格化、非写实的短视频当你需要“动态壁纸感”的素材时再切过去。2.3 音频、字幕、封装后处理节点视频跑出来之后声音和字幕是画质的隐形分水岭。很多人的AI短剧“一眼假”问题不出在画质而是没有配音、没有环境音画面在说话但观众听不到。ComfyUI里可以用ChatTTS或GPT-SoVITS节点做配音一个负责合成自然语音一个负责克隆固定音色保证整部剧的旁白是同一个味道。字幕节点我习惯用自定义的Python节点处理读取分镜文本按时间轴烧进画面。这一步用ComfyUI自带的文本处理节点也能做但灵活度不如自己写后面第五节我会展开说。2.4 一个拆好的流水线节点清单我把自己常用的节点清单列出来做短剧流水线基本就是这几类的组合环节核心节点/方案作用算力占用剧本生成Qwen等LLM节点生成剧本、分镜结构化文本低角色设定文生图LoRA/IP-Adapter生成角色定妆照、保证一致性中分镜出图文生图/图生图节点按分镜批量生成场景图中高动态视频Wan/Video生成节点静态图转动态短视频高配音ChatTTS/GPT-SoVITS台词转自然语音中字幕封装自定义Python/FFmpeg节点烧字幕、封装成片低这套清单不是固定的你做的短剧类型不一样节点侧重也不一样。甜宠剧对角色一致性要求高悬疑剧对镜头氛围要求高逆袭剧则更看重节奏和旁白的情绪推动力。流水线的设计逻辑是“换节点不换骨架”骨架就是内容生成 → 图生成 → 视频生成 → 音轨字幕 → 封装输出。3. 部署这套ZIP包的完整过程解压、环境、模型三件事这套方案以zip包形式分发拿到手之后不要急着双击“下一步”。打包分发虽然方便但解压、环境适配、模型放置这三件事没做好后面会连环踩坑。我按实际部署顺序拆开讲。3.1 解压别用系统自带解压别解压到中文路径先说解压。Windows用户经常犯的一个错误是双击zip包用系统自带资源管理器里的“全部提取”来解压。对于大型整合包系统自带工具解压到一半容易报错、断掉而且解压速度偏慢。我一直用7-Zip右键选择“提取到当前文件夹”稳定性和速度都更可靠。如果环境是Linux服务器命令很简单unzip AI短剧生成流水线-ComfyUISkills系统.zip -d /data/ai-drama注意两点解压路径不要有中文和空格。我以前吃过这个亏路径里有中文ComfyUI里的Python有些依赖库读取路径时直接乱码报错排查了半天才发现是路径问题。建议统一用英文目录。解压完先看文件完整性。zip包是分卷压缩的如果有.z01这类分卷文件需要保证和主zip包在同一个目录再对第一个分卷运行解压比如zip -ff修复分卷顺序之后再unzip。整合包如果被网盘拆过分卷这一步尤其重要。3.2 环境准备整合包还是便携包这是个选择题解压之后是环境问题。目前市面上有一键整合包和官方便携版两种路线。我推荐这套流水线用秋叶整合包或官方便携包作为底座原因很实际整合包内置了Python 3.10/3.11等运行环境以及ffmpeg、git这些基础依赖。你不需要自己配环境变量解压出来启动就能用。官方便携包则更接近原版可控性高但你需要自己确认显卡驱动、CUDA版本和PyTorch版本是否匹配。我的建议是如果你只需要跑通流程、出一批素材直接用整合包省心如果你要做二次开发、深度定制用官方便携包自己配环境后面升级才不会被别人的封装限制。启动之前先检查一下显卡驱动。ComfyUI的推理依赖PyTorch调用GPU驱动太老或者CUDA版本不对启动日志里会出现cuda相关报错。NVIDIA用户建议把显卡驱动更新到最新桌面版、Studio版均可。3.3 Models模型目录所有报错的重灾区模型放置是整个部署过程中最容易出错也最不被人重视的环节。ComfyUI读取模型不是让你随便放在哪个文件夹它有固定的目录结构。你必须在ComfyUI/models下找到对应的子目录把模型文件放进去checkpoints/主模型文件比如写实风格的SD/SDXL/DreamShaper等。loras/LoRA微调模型比如某个固定角色的LoRA。ipadapter/IP-Adapter模型角色一致性控制专用。diffusion_models/Wan这类视频扩散模型。vae/VAE模型负责图像解码不配好画面会灰蒙蒙一片。每个子目录里都放对了文件之后启动ComfyUI加载工作流节点上的模型下拉框里才会出现对应项。如果你加载工作流后某个节点报“model not found”不用怀疑九成是模型没放到对应目录或者文件名包含路径没有被正确识别。3.4 Skills系统的安装与配置这套方案里的Skills系统本质是一层工作流封装层。它干的事是把整条流水线封装成一个“技能”调用时输入剧本大纲和风格选项自动选择对应的工作流和参数模板。安装方式一般有两种。一种是解压到你ComfyUI根目录的custom_nodes文件夹下启动时自动加载另一种是放到与工作流同一层级的插件目录里由ComfyUI的插件机制统一管理。具体要看包的说明但无论哪种装完之后都建议重启一次ComfyUI让新节点注册生效。配置阶段你需要指定两样东西一是模型的路径映射告诉Skills系统每个模型放在哪个目录二是工作流模板的路径它是从一个JSON工作流文件读取流程定义的。很多人在这个阶段报错原因就是路径配置用的是压缩包内的相对路径但解压后的实际目录结构变了。建议在配置时全部改成绝对路径或者把解压后的目录保持和包内结构完全一致。4. 典型报错全实录从“could not find EOCD”到“显存不足”的排查链路这套方案分发之后我收到最多的反馈不是“不会用”而是报错看不懂。这里把我见过的所有高频报错和完整排查链路整理出来你照着顺序查能省很多时间。4.1 导入工作流或安装插件时报invalid zip archive: could not find EOCD这是zip包场景里最常见的报错代表解压工具在文件末尾找不到zip结尾标记EOCD。通俗说这个文件要么没下载完整要么被改了扩展名要么在传输过程中损坏了。排查链路是这样走的先看文件大小。去发布页面对应文件的标注大小对比你本地下载的文件大小。如果差了几个MB甚至几十MB基本就是下载中断重新下载。如果大小一致还报错用7-Zip打开这个zip看能不能预览列表。7-Zip能打开但系统解压工具不行就说明zip结构本身没问题换7-Zip解压即可。如果7-Zip也打不开可能是它本来就不是zip文件。有人会把tar.gz或者rar直接改扩展名为zip系统解压工具就会报EOCD错误。用文件头检测工具看一眼zip文件开头通常是PK两个字节不是的话就找发布者要正确格式。整合包场景里还有一种特殊情况网盘下载时把超大的zip分包了你可能只下载了其中一个分卷。这种文件集成起来再解压单独解压任何一部分都会报EOCD不存在。4.2 file is not a zip file为什么偏偏识别不了这个报错和上面那个经常一起出现但它指向的原因更多是“文件头不对”。zip文件的前两个字节是PK0x50 0x4B如果文件开头不是这个标记工具就会拒绝识别。最常见的原因是下载链接实际上指向了一个html页面比如网盘的外链跳转页而不是真实文件浏览器或下载工具保存下来的内容其实是网页代码。你拿到一个看似zip后缀的文件实际打开全是HTML源码。遇到这个情况不要点浏览器里的“打开”回到下载页面右键点击下载链接选择“链接另存为”或者用专门的下载工具接管下载。下载完成后再检查一遍文件大小和文件头。4.3 显存不足5070、8G、12G显卡怎么跑得动这是所有人都会遇到的问题。短剧生成本身就是显存杀手图生成还好视频生成节点一次推理要同时驻留文本编码器、扩散模型、VAE解码器显存直接爆掉。我实测的结论是不优化的话8G显存跑视频生成流程大概率OOM12G能跑但很吃力16G以上体验才比较从容。但这不是说你显卡低就没法用有几个优化手段组合起来效果很明显启动参数加--lowvram或--medvram。ComfyUI会根据显存自动调度模型加载和卸载--lowvram会把模型底层图里的模块拆开用多少加载多少代价是速度变慢--medvram是折中方案适合12G左右的显卡。打开控制台里的“启用模型CPU加载”让部分不参与当前推理的模块在CPU和GPU之间切换。换量化模型。几个社区常见的量化版本比原版体积小30%-50%显存占用同步降低画质损失在短剧这种短视频场景里几乎感知不到。提示如果显存还是不够删减视频节点里的临时中间节点或者降低批量生成数量。一锅煮太多会溢出分开煮就能过关。4.4 插件安装失败git clone失败与目录问题Skills系统或自定义节点安装失败多数是git clone失败或文件目录放错。git clone失败的常见原因是网络问题导致连接超时可以设置代理或改用加速地址也可以手动把压缩包下载下来解压到custom_nodes目录这种方式不依赖git更适合国内网络环境。目录放错的问题更隐蔽。有些节点的代码结构要求固定放置路径你必须把它放到ComfyUI/custom_nodes/这个层级如果多套了一层文件夹节点依然不会被识别。装完插件后看ComfyUI启动日志里有没有出现这个插件的名称这是验证是否加载成功的可靠方法。下面是一个快速排查表报错方向处理方式could not find EOCDzip损坏/分卷缺失检查文件大小、重新下载、合并分卷file is not a zip file文件头错误检查是否为网页下载错误、确认真实格式CUDA out of memory显存不足低显存模式、量化模型、减小批量model not found模型未放对目录按models下子目录分类放置、检查启动日志节点红色报错No such file路径错误配置中改为绝对路径、目录保持包内结构5. 从能跑到能产把单条工作流工程化为“流水线”的实战细节部署成功后工作流能跑但这只是“能跑”离“能产”还有距离。真正让这套方案变成流水线的是下面这些工程化细节。很多人工作流分享出来却没人能用问题就出在这几层。5.1 缓存策略节点不要随便改缓存是你的命ComfyUI的核心优势之一是节点级缓存但这个优势也是双刃剑。当你只修改了某个提示词节点下游的所有节点都会重新计算如果下游是视频生成这种慢节点一次改动就是几分钟到十几分钟的等待。批量生产时要尽量保持上游节点稳定只有必须改的部分才去动。做法是先把角色、环境、镜头风格这些基础节点跑通锁定输出效果然后只改分镜文本或提示词让下游重新生成。这条策略能把整个流水线的单条耗时从十几分钟压到几分钟。5.2 批量处理队列比手动运行靠谱得多短剧一集有几十个分镜手动一个个run不现实。ComfyUI的队列机制支持批量提交你可以把分镜脚本一次性加载让所有分镜图依次生成不用人工干预。批量跑的时候注意两点先跑两三个不同风格的分镜样张确认画面风格一致后再全量提交。不要在风格未稳定时就批量跑完几十个分镜返工成本太高。批量跑完不要中途关机或休眠。我遇到过机器休眠导致队列中断的情况这会造成部分分镜生成了、部分没生成还得自己手动找哪些漏了。批量任务开始前建议在系统设置里关掉休眠。5.3 Skills系统如何封装“技能”Skills系统在这个流水线里的角色是把一条完整的工作流变成“一键调用”的模块。比如你封装了一个“甜宠风短剧”技能那么输入一个简单的故事梗概它就能自动调用对应的工作流模板、参数组合和提示词策略。封装时最重要的是明确输入输出接口。输入接口通常定义角色描述、场景关键词、分镜数量、风格类型。输出接口定义成片视频路径、分镜图目录、字幕文件。把这个接口定清楚你就能让不同技能共用同一套流水线骨架只是调换中间的模型和提示词策略。我的做法是每一种短剧类型对应一个skill目录目录里放三个文件——工作流JSON、参数配置文件、提示词模板。Skills系统读取这三个文件动态加载对应参数并启动工作流。这样内容团队的新人不需要理解ComfyUI节点只需要在界面里选择技能、输入文案就能出片。5.4 与LLM节点联动让文本变量自动进入工作流只要让LLM节点和出图出视频节点联动起来流水线才算真正全链路自动化。LLM节点负责做的事是根据输入的故事大纲补全分镜细节生成每个分镜的画面提示词、镜头要求、字幕内容然后以结构化数据的形式传给下游节点。一个容易忽略的细节是LLM输出的提示词质量会直接影响出图效果。所以我在Skills系统里内置了一套提示词增强规则要求LLM输出的每个镜头提示词包含主体、动作、环境、镜头语言、画风五个部分。这套规则可以单独调优它直接影响整条流水线的成品质量值得花时间打磨。6. 这套方案的可扩展空间LLM分离部署、多卡协同与成片后期流水线跑顺之后你会开始考虑规模化问题能不能多卡并行能不能把LLM和ComfyUI分开部署成片后期能不能顺手一起做了这些扩展点我在实际使用中都有验证。6.1 ComfyUI与LLM是否必须在同一台机器上很多人误以为ComfyUI和LLM必须装在同一台电脑上其实完全没必要。ComfyUI负责图像和视频生成LLM负责文本生成两个任务对硬件的要求不同。LLM更吃内存和显存带宽ComfyUI更吃显卡算力。你可以把LLM部署在一台内存大、显存适中的机器上把ComfyUI部署在显卡强的主力机上两台机器通过网络或API连接。这样划分的好处是文本生成不占用显卡推理时间显卡可以把全部算力投入到出图和出视频上。反之如果同机部署LLM推理会和ComfyUI抢显存两个任务都变慢。通信方案用ComfyUI的API接口或SDK桥接都可以。我习惯把LLM服务单独跑成一个APIComfyUI这边通过自定义节点调用用分镜文本作为请求体返回结构化JSON作为出图指令。如果日后使用Quen、MiniMax这类外部模型也只需要替换API地址流水线的骨架完全不用动。6.2 多卡并行不要期待线性加速但要务实分配双卡用户跑这套流水线时一个常见的误区是以为两张卡能让单条视频生成速度翻倍。实际上大多数情况下ComfyUI对单条流程的推理是单卡执行的。多卡的真正价值在于并行处理不同任务卡A跑分镜出图卡B跑视频生成两条任务互不干扰。如果你有两张卡可以这样分配一张负责文生图和图生图这类任务单次耗时短吞吐量要求高另一张负责视频生成单次耗时长需要稳定占用显存。启动两个ComfyUI实例分别绑定一张卡然后在Skills系统里做任务分发这样整个流水线的整体产出效率能提升接近一倍。6.3 语音、字幕与成片封装一次跑完视频节点全部输出之后还需要做配音、加字幕、封装。我这套方案里配音节点在ComfyUI内完成字幕和封装则交给FFmpeg批处理脚本这样避免把工具链铺得太长。FFmpeg处理竖屏短视频的常用命令如下# 合并视频和音轨输出为竖屏MP4 ffmpeg -i video.mp4 -i audio.wav -c:v copy -c:a aac -shortest output_vertical.mp4 # 烧入字幕文件 ffmpeg -i output_vertical.mp4 -vf subtitlessubtitle.srt final.mp4 # 批量处理目录下所有视频和音轨 for f in *.mp4; do ffmpeg -i $f -i ${f%.mp4}.wav -c:v copy -c:a aac -shortest done_$f; done字幕文件由LLM节点生成分镜文本后按时间轴转换成SRT格式。时间轴可以直接按分镜的视频时长来分配比如第1个分镜2.5秒、第2个分镜3.1秒按顺序累加即可生成时间码。这里有个经验字幕不要从第一毫秒就出现留出0.2-0.4秒的入画延迟观感会自然很多。6.4 短剧平台规格适配成片不是能看就行最后别忽略平台规格。短剧平台主流的格式是竖屏9:16分辨率1080x1920时长控制在60秒到120秒之间。生成视频时如果模型输出是横屏成片后只能用裁剪或模糊背景的方法补足观感差很多。我的建议是在视频生成节点就设定输出尺寸为9:16能直接出竖屏就尽量不要在后期靠裁剪解决。这套方案跑通后从输入一个故事梗概到输出一条带配音、带字幕的完整短片我这边实测的耗时大约在二十分钟以内具体取决于分镜数量和显卡性能。如果你也想搭同样一套建议不要一次追求所有环节全部自动化先把出图到生成视频这段核心链路跑通再逐步接入LLM、配音和封装这样每一步都可控出问题也好定位。我个人在实际操作中最深的体会是所有环节里最值得花时间的不是视频生成模型本身而是分镜文本的提示词质量和角色一致性的前期设定。有时候画质看起来“不够好”不是因为模型不行而是上游LLM给出的分镜描述太泛、太模糊。把这两个环节的规则固定下来流水线的整体产出质量会有一个明显的跃升。本文还有配套的精品资源点击获取