
最近半年身边越来越多朋友开始做 AI 视频有人用 AI 做古风短剧有人做动物拟人动画还有人在做产品宣传片。但大多数新手刚开始接触 AI 视频时都会遇到同样的问题网上教程非常多但基本都是碎片化的今天讲提示词明天讲绘图工具后天讲剪辑真正能一条线走通“从文案到成片”的教程很少。结果就是看完了一堆教程自己动手时还是不知道从哪一步开始。这篇文章正好解决这个问题。我会以一条完整的 AI 短剧创作流程为主线从前期构思、分镜脚本到 AI 绘画生成画面、图生视频让画面动起来再到配音配乐和剪辑成片把每个环节需要用到的工具、提示词写法、参数设置和常见坑点都拆开讲清楚。零基础的新手可以按照步骤一步步操作有视频剪辑经验的人也可以直接查阅提示词模板和工作流参数。需要说明的是AI 视频生成工具迭代非常快不同平台的界面和参数可能每个月都在变。本文不会把某个工具的版本号写死而是重点讲清楚底层逻辑和通用方法。你只要掌握这套方法论无论工具怎么更新都能快速迁移。1. AI 视频创作到底是什么为什么现在值得学1.1 从概念说起AI 视频创作的核心逻辑AI 视频创作通俗地说就是用人工智能工具辅助甚至自动完成视频的制作过程。传统的视频制作流程是写脚本 - 实景拍摄 - 后期剪辑。这个流程依赖摄影师、演员、灯光、场地、器材成本高、周期长。而 AI 视频创作的流程变成了写文案 - AI 生成分镜画面 - AI 让画面动起来 - 剪辑配音配乐。这里最关键的一点是AI 不是替代你的创意而是替代“执行层”的工作。你仍然是导演、编剧和剪辑师只是原本需要扛摄影机、布光、找场地的环节现在变成了写提示词、调参数。1.2 AI 视频的主要应用场景目前 AI 视频比较成熟的落地场景主要有这么几类场景典型需求AI 视频的优势短视频 / 短剧古风、都市、悬疑、甜宠等剧情向内容不需要演员和实景制作成本大幅降低产品宣传数码、美妆、食品等产品的动态展示快速出概念图方便多方案比稿知识科普抽象概念的可视化解释把不好拍的场景直接“画”出来个人创作音乐 MV、旅行 Vlog、梦境记录创意表达空间大容易出风格化效果1.3 零基础入门的三个现实优势第一工具门槛在降低。现在很多 AI 视频工具都是网页版或客户端不需要写代码也不需要高配显卡就能用。第二AI 绘画和视频生成的质量已经进入到“可商用”的临界点只要提示词控制得好画面质感已经接近实拍或传统三维渲染。第三AI 短剧的商业化路径已经跑通平台分成、广告植入、账号运营都有真实案例。但也要有心理预期AI 视频并非“输入一句话自动生成一部剧”。它需要你做剧本拆解、分镜设计、提示词调试、素材筛选、剪辑节奏把控。这些能力是可以逐步积累的而且一旦掌握它带来的效率提升非常明显。2. 环境准备与工具选型一条完整的 AI 视频生产线2.1 工具矩阵每个环节选什么工具做 AI 视频不需要在一棵树上吊死。合理的做法是按“脚本 - 绘画 - 视频 - 剪辑”四个环节分别选择趁手的工具。下面是我目前测试下来比较顺手的组合你可以根据自己的设备和预算调整环节可选工具说明文案 / 脚本DeepSeek、ChatGPT、Kimi、通义千问用大模型辅助写故事梗概、分场大纲AI 绘画Midjourney、Stable Diffusion WebUI、ComfyUI、国内聚合平台即梦、可灵生成高质量静态分镜图生视频可灵、即梦、Runway、Pika、ComfyUI 视频节点让静态画面产生运动剪辑合成剪映、Premiere、CapCut完成粗剪、精剪、配音、字幕这里要提醒一点有些工具需要特定网络环境这一点请自行理解本文不展开。国内平台的好处是上手快、生态完整但精细控制能力相对弱一些Stable Diffusion 系的好处是开源、可控性强但需要安装配置对电脑配置有一定要求。2.2 电脑配置与运行环境如果你只在国内在线平台操作那么一台普通能上网的电脑就够用对显卡没有硬性要求。但如果你打算本地部署 Stable Diffusion 或 ComfyUI建议参考以下配置操作系统Windows 10/11 或 Ubuntu 20.04 以上内存16GB 起步32GB 更稳显卡NVIDIA 显卡显存 8GB 以上推荐 12GB 或更高硬盘SSD预留至少 50GB 空间Python3.10.x本地部署时用WebUI 通常自带环境版本这块不要照搬因为 AI 绘画项目更新极快建议去对应开源项目的 GitHub 仓库查看最新的环境要求。2.3 素材规范提前定好效率翻倍在正式开始创作之前建议先统一素材规范避免后面出图比例、时长、分辨率对不上返工成本很高。一个比较通用的规范如下画面比例竖屏 9:161080x1920适合抖音、快手、视频号横屏 16:91920x1080适合 B 站、西瓜。出图分辨率建议按最终视频的 1 倍或 2 倍生成竖屏建议 1080x1920。视频片段时长单段图生视频建议 5 秒左右便于后期剪辑组接。文件命名按“集数_场次_镜头号_画面描述”命名例如S01E03_02_01_女主转身.png。3. AI 视频提示词工程让 AI 听懂你的画面要求3.1 提示词的基本结构很多人第一次用 AI 绘画或 AI 视频工具时只会输入“一个女孩在森林里走路”结果出图效果非常随机原因在于提示词缺少结构化表达。经过大量实践我总结了下面这套提示词结构主体描述 环境场景 光影氛围 镜头语言 风格介质 画质关键词六个要素各司其职主体描述画面主角是谁什么长相、穿着、动作这是提示词的核心。环境场景地点在哪里背景有什么元素光影氛围是清晨还是黄昏是逆光还是顺光情绪是温暖还是阴郁镜头语言是特写、中景、全景是推镜头还是摇镜头风格介质是古风国漫、赛博朋克、写实真人、还是 3D 渲染画质关键词常见的有 8K、ultra-detailed、masterpiece、best quality 等。下面是一个正向提示词示例古风年轻女子面容清秀身穿月白色长裙发髻精致站在烟雨朦胧的江南水乡石桥上手持油纸伞回眸浅笑。黄昏暖光细雨绵绵背景是白墙黛瓦水面有倒影。中景平视视角浅景深。唯美古风国漫风格工笔质感。8K超高清细节电影级光影。3.2 负向提示词告诉 AI 不要画什么负向提示词往往比正向提示词更重要。AI 出图容易出现畸形手指、多余肢体、水印、糊脸等问题通过负向提示词可以大幅降低概率。低分辨率模糊变形的手多手指缺手指肢体比例错误脸部扭曲水印文字logo多余的肢体画质差噪点饱和度异常。在大部分 WebUI 工具里正向提示词和负向提示词是分开填写的。如果你用的是国内在线平台它们通常会自动带一套默认负向提示词新手阶段可以不用自己写。3.3 图生视频提示词与文生视频提示词的区别很多新手容易混淆文生图和图生视频的提示词。文生图AI 是从无到有画一张图而图生视频是让一张已有的图产生运动AI 需要知道的是“画面里什么东西在动、怎么动、镜头怎么动”而不是重新描述一遍画面里有什么。所以图生视频的提示词要聚焦在“运动”上镜头缓慢推进女子发丝和裙摆随风轻柔飘动雨丝下落水面泛起涟漪她缓缓转头嘴角微微上扬。这个提示词里所有描述都是“动态”的这是图生视频和文生图提示词最大的差异。如果你把静态描述原封不动地拿去做图生视频AI 往往会因为不知道该动哪里而生成一个几乎不动的静帧视频。3.4 提示词模板拿来就用的短剧分镜提示词下面是一段适用于古风短剧的“分镜提示词包”包含 5 个连续镜头你可以直接复制到不同的生成任务里镜头1古风男子一袭黑色劲装站在悬崖边风吹起衣角和发丝眼神坚毅看向远方。阴天山雾缭绕冷色调。远景无人机航拍视角宏大苍凉。写实古装剧风格电影感。 镜头2男子面部特写泪痕未干眼神从悲痛转为决然嘴唇微抿。窗外微弱烛光映在脸上明暗对比强烈。浅景深侧面光。写实电影风格皮肤质感真实。 镜头3女子在雨中奔跑长裙湿透脚下溅起水花回头看向身后惊慌与期盼交织。街道灯火通明雨丝在灯光下闪烁。中景跟拍动态模糊手持镜头感。 镜头4两人在庭院中对视距离三步风吹落白色花瓣两人都没说话。午后阳光透过树叶洒落光斑晃动。全景固定机位构图对称情绪克制。 镜头5画面切到一只落在桌案上的玉佩一只手缓缓拿起玉佩指节泛白。暖光烛光特写极浅景深镜头缓慢推近。这套提示词已经按“分镜”拆分好了每句提示词都包含主体、动作、环境、光影、镜头、风格。你可以直接用它测试你手上的 AI 工具看看效果然后再改成自己的故事。3.5 提示词调优与批量测试方法写提示词不是一次就能成功的。我的经验是先写一版完整提示词跑出一批图后再逐个删减或调整关键词看哪个词对画面影响最大。具体操作可以按这个流程来固定基础提示词比如“古风女子江南水乡唯美风格”。每次只调整一个变量比如光影从“黄昏”改为“清晨”其他不变。对比输出图记录哪个关键词带来了你想要的风格。形成几个“风格锚点词”之后所有同类画面都复用它。这个方法也叫“单变量测试法”。它看起来简单但能让你的提示词水平在短时间内明显提升而不是每次都靠碰运气。4. AI 绘画实战从文字到高质量分镜底图4.1 文生图的主要模式与参数打开任意一个 AI 绘画工具后你通常需要设置以下参数宽高比短剧竖屏选 9:16横屏选 16:9。采样步数Steps20-30 是常见区间步数越高细节越多但过高反而不会有明显提升还会拖慢速度。提示词引导系数CFG Scale一般 5-9。数值越高画面越贴合提示词但太高会过曝或锐化过度。生成数量建议一次生成 4 张方便挑选。以 Stable Diffusion WebUI 为例界面上的参数配置大致如下正向提示词古风女子江南水乡黄昏暖光中景唯美古风电影级光影8K 负向提示词低分辨率模糊变形的手多手指脸部扭曲水印 采样步数28 宽高比832x1216约 2:3竖屏 提示词引导系数7 随机种子-1每次生成不同结果如果你用的是国内在线平台参数会简化很多往往只需要选择图片比例和风格模型生成逻辑是类似的。4.2 人物一致性AI 短剧绕不开的核心难题做 AI 短剧与做单张 AI 绘画最大的区别在于故事需要一个长相稳定、服装统一、气质一致的主角。如果男主角每换一个镜头就换了一张脸观众立刻出戏。解决人物一致性的常见方法有四种1. 固定种子Seed在同一个工具里生成图片时固定随机种子并复用同一组提示词可以保持画面风格和人物基本特征稳定。这个方法实施起来最简单但跨场景后效果不稳定。2. 垫图 / 参考图模式国内在线平台即梦、可灵等普遍支持上传参考图。你先生成一张满意的主角正脸图之后每个分镜都上传这张图作为参考让 AI 保持人物特征。适合新手也是目前效率最高的方案。3. ControlNetStable Diffusion 高级玩法。通过 OpenPose、Canny、Depth 等预处理器控制人物姿态、轮廓、景深实现更强的结构控制。学习成本较高但可控性最好。4. LoRA 模型训练在本地 Stable Diffusion 环境中用几十张同一角色的图片训练一个小型 LoRA 模型。训练完成后生成该角色只需调用这个 LoRA效果最稳定但需要时间成本和显卡资源。对零基础新手建议先用“固定种子参考图”方案成本低、见效快。等后面要系统做多集短剧时再考虑 LoRA 训练。4.3 人物三视图与角色设定图如果你想做一个连载短剧强烈建议先做一张角色设定图。角色设定图通常包含人物的正面、侧面、背面三个角度以及服装细节、道具特征。这样后续每一个分镜都可以参考这张图生成保证人物不会“变形”。人物三视图提示词参考古风女子角色设定图三个视角正面、侧面、背面全身像浅灰色干净背景站立姿态身着月白色长裙头戴简单玉簪腰间挂一枚青玉佩。角色设计规范游戏原画风格细节清晰人物表情温和纯色背景网格参考工业设计展示图风格。生成这类图时建议使用偏“角色设计”风格的模型比如二次元或半写实模型比直接写实更容易控制一致性。4.4 出图后的筛选与抠图处理AI 批量出图后不能直接全部扔进视频工具。你需要做一轮筛选和基础处理筛选五官、手部、肢体都没有明显的畸变的图。统一画面明暗和色调避免相邻分镜差距过大。如果画面中有多余元素可以用修图工具PS、美图秀秀、稿定等做简单修复。把每张分镜图按镜头顺序编号方便图生视频时调用。5. 图生视频实战让静态分镜真正动起来5.1 什么是图生视频它的原理是什么图生视频简单来说是上传一张图片作为起始帧AI 根据你的运动提示词生成一段连续运动画面。当前主流工具还支持上传首帧、尾帧AI 会填补中间的运动过程。理解这个原理后你就明白为什么图生视频的提示词要重点写“运动”因为画面中哪些元素动、怎么动、镜头怎么动这些信息是 AI 生成运动的关键。静态描述在视频模型里参考价值不大。5.2 图生视频的基本操作流程以目前主流平台的操作逻辑为例流程通常是选择“图生视频”功能。上传一张分镜底图。填写运动提示词描述画面中的动作和镜头运动。设置运动幅度、画面比例、时长等参数。点击生成等待视频渲染。图生视频的运动提示词建议单独写越具体越好。一个“所有东西都在动”的提示词往往等于没有提示词。5.3 图生视频运动提示词示例下面这条提示词适合古风画面你可以在你自己工具里试一下镜头从男子背影缓慢推近衣袍被风吹起发丝轻轻飘动云雾在群山中缓缓流动画面氛围静谧而深沉。人物表情保持沉静只有细微的眼部变化整体运动舒缓电影级运镜。适合产品展示的提示词则完全不一样产品放置在旋转展示台上逆时针缓慢旋转背景光斑流动微距镜头产品表面光泽随角度变化金属质感明显浅景深。你会发现图生视频提示词写得好不好关键看你能不能区分“主体运动”和“镜头运动”并且把动作节奏说清楚。5.4 运动幅度与控制参数大多数图生视频工具中有一个“运动幅度”或“运动强度”参数。这个参数直接决定画面变化幅度运动幅度低0-3适合人物表情、风吹发丝、细微的眼神变化。运动幅度中4-6适合行走、转身、轻微动作。运动幅度高7-10适合奔跑、打斗、大范围镜头运动但画面变形的风险也会大幅提升。新手建议从低运动幅度开始。低幅度即使翻车画面也不至于完全没法用幅度太高人物脸部经常会产生严重形变等于白做。5.5 ComfyUI 图生视频进阶说明对于有本地部署需求的开发者目前开源社区里比较常见的是 ComfyUI 配合视频生成模型节点来做图生视频。这套方案的好处是完全没有平台限制可以精细控制运动幅度、关键帧和输出格式但配置过程相对繁琐需要拉取多个模型和插件。典型的 ComfyUI 图生视频工作流节点序列为加载模型 - 编码参考图 - 设置文本提示词 - 设置视频长度与帧率 - 设置运动参数 - 批量生成 - 解码输出视频注意ComfyUI 的插件生态更新非常快不同版本的节点名称可能发生变化。如果你在配置时遇到报错优先检查节点版本的兼容性。这里不给出具体模型名称是因为视频生成模型迭代速度太快写几个月前的模型名称很可能误导读者建议按你当前使用的社区教程为准。6. 视听语言与分镜设计让 AI 短剧不再是“图片轮播”6.1 为什么需要懂一点视听语言很多新手做出来的 AI 短剧画面单看很精美连起来看却像幻灯片。原因就是缺少视听语言思维。视听语言是视频创作的基本语法它决定了观众如何理解画面、感受节奏。对于 AI 短剧创作最核心的三个概念是景别、角度、运动。6.2 常用景别与情绪效果景别画面范围适用场景情绪暗示远景人物很小环境为主交代环境、渲染氛围孤独、浩瀚、命运感全景人物全身展示动作与环境关系客观叙事、信息交代中景人物膝盖以上对话、交流自然、日常近景人物胸部以上表现情绪和表情代入感、心理活动特写局部细节如眼睛、手强化情绪、关键道具紧张、专注、情感冲击AI 短剧常见错误是全程使用中景或近景画面没有层次。建议在单元镜头里至少交替安排 3 种景别让视觉有变化。6.3 镜头角度与运镜提示词镜头角度能影响观众对角色的判断。俯拍会削弱角色的力量感仰拍会增强角色的威压感平视则产生平等代入感。在提示词里可以明确写俯拍high angle shottop-down view仰拍low angle shotfrom below平视eye-level shot运镜的提示词同样可以在 AI 工具里使用推镜头camera slowly pushes in拉镜头camera slowly pulls out摇镜头camera pans left/right移镜头camera moves sideways跟拍camera follows character环绕camera orbits around character6.4 AI 短剧分镜脚本模板开始制作前强烈建议用表格做一份分镜脚本。下面是一个可直接复制的模板场次景别画面描述运镜台词/旁白音效时长1远景山崖边男子黑衣远眺慢推旁白三年了……风声、悲壮配乐5s2特写男子眼神从悲伤转为决然固定无音乐渐强3s3中景女子雨中奔跑回头跟拍女声等等我雨声、脚步4s4全景两人对视花瓣飘落固定无音乐骤停3s这一份表格做完后后续的 AI 绘画、图生视频、剪辑全部以它为依据你会有一种“心里有底”的感觉而不是想到哪做到哪。7. 剪辑成片配音、配乐、字幕与导出7.1 素材整理与命名剪辑的第一步不是打开剪辑软件而是整理素材。建议像下面这样组织文件夹结构project/ ├── 00_script/ # 分镜脚本、剧情文案 ├── 01_storyboard/ # 分镜图文件 ├── 02_video_clips/ # 图生视频生成的分段视频 ├── 03_audio/ # 配音、BGM、音效 ├── 04_output/ # 最终导出视频 └── 05_reference/ # 参考视频、风格参考图用剪映为例把图生视频生成的分段素材按分镜顺序拖入轨道再做粗剪。7.2 粗剪与精剪的核心思路粗剪阶段只做一件事把每个镜头的“可用区间”找出来。AI 生成的视频片段开头和结尾很容易出现画面变化不自然的情况尤其是人物脸部形变一般发生在运动幅度较大的中间帧。所以粗剪时要把每个片段掐头去尾只保留画面稳定的部分。精剪阶段重点控制节奏。一个普遍规律是叙事镜头可以适当短一些情绪镜头要留足。比如人物惊讶的表情2 秒就够两个人沉默对视至少留 4 到 5 秒情绪才出得来。7.3 配音与配乐AI 短剧的配音有两种方式真人配音和 AI 配音。真人配音用手机或麦克风录制感情最自然推荐优先使用。AI 配音用剪映自带的文本朗读、各类 TTS 工具生成适合批量制作和预算有限的项目。配乐方面短视频平台的版权音乐需要谨慎尽量使用平台提供的可商用音乐库避免侵权。在剪映中只需要把音乐素材拖入音轨根据高潮点做淡入淡出。7.4 字幕与导出设置字幕要清晰建议使用醒目的字体但不要遮挡关键画面信息。剪映支持自动识别字幕AI 短剧由于台词通常不多识别后手动改一下错别字即可。导出时如果发布到抖音、快手推荐以下设置分辨率1080x1920 帧率30fps 格式MP4 (H.264) 码率更高质量文件较大但画质好如果你用的是 Premiere可以在导出窗口选择“匹配源”或“自定义”手动输入以上参数。8. 常见问题与排查思路AI 视频创作过程中几乎每个人都会遇到下面这些问题。这里汇总成一张排查表方便你按图索骥。问题现象常见原因解决思路生成的人像脸部扭曲运动幅度太高降低运动幅度尽量控制在 5 以下人物眼神呆滞图生视频提示词缺少“眼动”描述在提示词中增加“眼球轻微转动”“眨眼”人物跨镜头长相不一致没有使用参考图或固定种子使用角色参考图模式固定种子参数画面像幻灯片几乎不动提示词只写了静态描述改为写“动态运动描述”如风吹、转身、镜头推近生成视频大量拖影画面中物体运动过快降低运动幅度或缩短单段视频时长手部变形严重原图手部结构有误出图时筛选手部正常的分镜再进入图生视频剪辑后故事不连贯分镜脚本设计不完整回到分镜表检查镜头之间的动作衔接视频导出发糊素材分辨率不足出图时按 2 倍分辨率生成剪辑前确认素材清晰9. 工程化与合规从玩一玩到稳定产出的关键9.1 版权与素材合规AI 生成内容目前存在版权边界争议不同平台和国家的规定也不同。作为创作者有几个基本底线必须守住不使用有版权争议的画作、图片、角色形象作为垫图。不搬运、不模仿他人原创短剧的完整分镜和脚本。发布平台已明确要求标注 AI 生成内容的务必如实标注。商业项目需要确认你使用的 AI 工具服务条款是否允许商用。9.2 内容安全底线技术本身没有立场但创作者有责任。请避免使用 AI 视频生成低俗、暴力、侵权、误导性内容。很多平台对 AI 生成内容的审核越来越严格不要为了一时流量去踩红线。这里特别提醒网络上有大量号称“无限制”“无审核”的工具或提示词包这些背后通常存在违规素材来源、账号安全和法律风险不建议碰。9.3 项目化管理与模板沉淀当你从随机创作进入稳定更新阶段建议建立自己的“素材银行”和“提示词模板库”。我的做法是维护一个 AI 视频项目清单用表格记录每个项目的核心信息项目名类型主角设定分镜数风格关键词稳定工具每集成本古风短剧《月下》连载女主月白裙玉簪28唯美、工笔、暖光即梦 剪映约 10 元/集宠物拟人动画单集橘猫大侠163D 卡通、明快ComfyUI约 30 元/集这样做有两个好处一是方便复盘不同类型的项目时间成本和效果一目了然二是沉淀下来之后下一部剧可以直接复用上一部剧的风格锚点词和人物设定模板制作效率会成倍提升。9.4 成本控制与效率建议AI 视频真正的成本不只是工具会员费更多是你的调试时间。建议大批量生成前用低价或免费模式测试提示词确定风格后再用最高质量参数生成最终分镜。另外同一张优质分镜图可以多次用于图生视频尝试不同的运动角度不要每次都重新生成底图。10. 从单条爆款到长期更新的进阶路线当你已经能独立完成一条完整的 AI 短剧后下一步的成长方向有三条路第一条路是“单镜头 - 多镜头 - 系列短剧”。先把一个镜头做到极致再挑战一段完整的情绪戏最后再规划多集连载的剧情。不要一上来就做 10 集短剧很容易因为工作量爆炸而放弃。第二条路是“单一风格 - 多风格切换”。先吃透一种风格比如古风唯美再尝试赛博朋克、治愈系、暗黑系。每种风格都需要不同的画面关键词、提示词结构和配音配乐逻辑掌握越多风格接单和变现的能力越强。第三条路是“纯 AI 生成 - AI 实拍结合”。把 AI 生成的特效场景、虚拟人物与实拍镜头结合这也是目前广告和影视行业正在尝试的方向。如果你能掌握把 AI 画面与实拍素材在色调、光照、构图上统一的方法职业竞争力会非常明显。最后给新手一个实际建议不要等到把所有工具都研究透了再动手。AI 视频这个领域工具永远在变只有动手做过的东西才是你自己的。先用你手头最容易上手的工具按照本文的流程做一条 30 秒的小短片然后把它发到社交平台让真实的反馈告诉你下一步该优化什么。记住AI 视频创作的竞争力不在于你用了多贵的工具而在于你有没有把创意、提示词、画面、节奏和声音完整地组织成一个让人愿意看完的作品。这一点和传统的视频创作本质上是一样的。