如何使用AI制作画中画视频? 在制作 YouTube 视频时你可能经常会看到一种很常见的画面视频主体占据整个屏幕而一个人物出现在画面的左下角或右下角一边播放主要内容一边进行讲解。这种视频形式就是我们经常说的「画中画Picture in Picture简称 PiP」。它非常适合教程、知识分享、游戏解说、软件演示以及产品介绍等内容。传统方式通常需要先拍摄一段人物口播视频然后再使用视频编辑软件将人物视频叠加到主视频上。但现在借助 AI可以把其中一些步骤变得简单很多。本文就来介绍一个比较实用的工作流先使用 AI 生成一个会说话的人物再把它作为画中画叠加到主视频中最终生成适合 YouTube 发布的视频。一、什么是 YouTube 画中画视频在开始制作之前需要先区分两个容易混淆的概念。对于普通 YouTube 用户来说Picture in Picture 通常指的是一种播放器功能也就是让视频缩小成一个浮动窗口同时继续浏览其他内容。但对于视频创作者来说画中画更多指的是一种视频构图方式。简单来说就是主视频 一个较小的人物视频例如主画面游戏画面小画面游戏主播或者主画面软件操作录屏小画面AI数字人进行讲解还可以是主画面产品展示视频小画面人物介绍产品特点所以画中画并不是单纯把两个视频随便叠在一起而是需要让两个画面承担不同的功能。通常情况下背景视频负责展示主要内容人物负责解释和补充信息。这样才能让画中画真正发挥作用。二、为什么AI适合制作画中画视频传统的 YouTube 口播视频需要准备摄像头、灯光、麦克风以及拍摄环境。如果每天都需要更新视频那么每次重新拍摄都会增加不少时间成本。AI数字人提供了另一种思路。你可以先准备一张人物照片或者创建一个自己的 AI 角色然后通过 AI Talking Photo 技术让这个人物根据文字或音频进行说话。之后再把生成的人物视频放到主视频上。这样就形成了一个简单的 AI 视频制作流程人物图片 → AI Talking Photo → 人物口播视频 → 画中画 → YouTube视频这种方式尤其适合YouTube教程软件操作演示AI工具介绍知识类视频产品介绍游戏解说在线课程如果你不想真人出镜也可以使用 AI 人物完成讲解。三、AI制作YouTube画中画视频的完整流程整个制作过程其实可以拆成三个主要步骤。第一步制作一个会说话的人物首先需要准备视频中的讲解人物。你可以使用自己的照片AI生成的人物虚拟角色卡通人物如果人物最终只会占据视频的一小部分那么图片本身不需要特别复杂。反而建议使用正面或接近正面的角度清晰的脸部简单的背景足够明显的五官这样在缩小之后人物仍然容易被识别。接下来就是给人物添加声音。通常有三种方式输入文字让 AI 自动生成语音上传已经录制好的音频直接录制自己的声音如果你希望批量制作 YouTube 视频那么第一种方式会比较方便。只需要修改脚本就可以重新生成一段人物口播而不需要再次进行拍摄。第二步准备主视频人物视频准备好之后就需要准备真正的主内容。主视频可以是屏幕录制游戏录像产品展示PPT演示教程视频AI生成的视频其他已有素材这里有一个非常重要的思路不要让人物成为视频的绝对主角。如果你是在制作软件教程那么观众真正需要看到的是软件操作过程。人物只是负责解释「这里应该点击什么」「这个功能有什么作用」「下一步应该怎么操作」因此可以把整个画面理解成背景视频 信息主体AI人物 讲解者这样做出来的画中画视频会更加自然。第三步设置人物的位置和形状接下来就是最关键的构图环节。人物可以放在左上角右上角左下角右下角也可以根据视频内容进行调整。最常见的方式是将人物放在右下角并使用圆形头像看起来比较像传统的视频主播。但不要形成一个固定思维「画中画一定要放右下角。」实际上人物应该放在主视频信息最少的位置。例如如果视频底部有大量字幕那么右下角可能就不是一个好的位置。如果主视频的核心操作发生在右上角那么人物也不应该放在那里。所以在确定位置之前可以先观察主视频哪里的信息最少就把人物放在哪里。除了位置还可以调整人物的形状。例如圆形原始比例圆形比较接近传统的摄像头窗口而圆角矩形则更加适合一些现代化的视频设计。四、如何让画中画视频看起来更加自然把人物叠加到视频上其实并不难。真正困难的是如何让两个画面看起来像一个完整的视频而不是简单地把一个视频盖到另一个视频上。这里有几个比较实用的技巧。人物不要太大人物太大会抢走主视频的注意力。但如果人物太小又很难看清脸部表情。所以建议从较小的尺寸开始然后逐渐调整。最终可以用手机和电脑分别观看一次。因为在编辑器里看起来刚刚好的尺寸真正播放之后可能会显得太小。可以问自己一个简单的问题我能看清是谁在说话同时又不会忽略主视频吗如果答案是可以那么人物大小基本就合适了。不要遮挡关键内容这是画中画视频最容易犯的问题之一。人物窗口可能会挡住字幕按钮菜单图表游戏比分产品信息软件操作区域因此人物位置应该根据每一条视频单独判断。例如一条教程视频的底部有字幕那么可以把人物移动到左上角。而如果顶部正在展示重要操作那么人物就可以放到下面。没有一个位置适合所有视频。最好的位置永远是不影响主要信息的位置。保持频道视觉风格统一如果你准备长期制作 YouTube 视频那么可以固定一个视觉风格。例如每一期视频都使用同一个 AI 人物并保持相同的人物相同的边框相同的形状相近的位置这样做的好处是观众看到这个人物时就能够逐渐形成频道记忆。对于 AI 内容创作者来说这一点尤其重要。AI不仅可以帮助你制作单个视频也可以帮助你建立一套可以重复使用的内容模板。五、使用AI Talking Photo制作人物视频如果不想自己拍摄 talking head可以先使用 AI Talking Photo 生成一段人物讲解视频。例如AI Talking Photo 可以将静态人物图片转换成会说话的视频。你可以上传一张人物照片然后输入需要说的内容或者使用自己的音频。生成之后再将人物视频与准备好的主视频组合起来。目前这类工作流已经不仅限于真人照片也可以用于一些角色图片、插画或者其他视觉内容。因此如果你正在制作一个固定的 AI 主播角色也可以重复使用同一个人物形象。六、AI画中画和传统视频编辑有什么区别传统的视频制作方式当然依然有效。如果只制作一两条视频直接使用剪映、Premiere Pro 等编辑软件进行操作完全没有问题。传统流程一般是拍摄人物 → 导入人物视频 → 导入主视频 → 调整大小 → 调整位置 → 添加字幕 → 导出而 AI 工作流则可以变成准备人物 → 生成口播 → 添加主视频 → 设置画中画 → 导出两者并不是谁完全取代谁。AI真正比较有优势的地方是重复制作同一种视频内容时可以减少重复劳动。例如你已经准备好了一个固定的 AI 人物。下一期只需要修改文章主题口播脚本背景视频就可以继续生成新的视频。如果你需要长期更新 YouTube 频道这种方式会更加方便。七、别忽略一个细节AI人物的台词要像人在说话很多 AI 视频看起来很自然但听起来依然很像机器。其中一个重要原因就是脚本写得不像人说的话。为什么长句会让 AI 听起来像机器AI 语音合成在处理长句时容易出现断句不自然、重音位置错误的问题。长句包含的信息量过大AI 难以判断哪里该停顿、哪里该强调听起来就会显得生硬。书面语 vs 口语一个直观的对比例如「通过修改以下相关参数用户可以进一步完成后续操作。」这种句子作为书面文字没有问题。但如果让 AI 人物直接念出来就会显得非常生硬。可以改成「接下来我们打开这个设置然后进行下一步操作。」后者明显更像真人口语。再看一个例子「本工具支持多种格式的视频文件导入用户可根据实际需求进行选择。」可以改成「你可以直接拖一个视频进来MP4、MOV 都行。」长句拆短句的演示如果你想要制作一个看起来比较自然的画中画视频那么你需要先准备好人物素材然后再准备主视频最后还要注意人物的位置和大小。可以拆成想做出自然的画中画视频需要三步。先准备人物素材。再准备主视频。最后调整人物的位置和大小。写脚本的实用建议因此在制作 AI Talking Head 或 AI Talking Photo 视频时建议少用过于复杂的长句一句话不要包含太多信息多使用自然的转折尽量按照真实说话的方式写脚本写完脚本后可以自己大声读一遍。如果读起来觉得别扭、需要换气那么 AI 读出来也会同样别扭。AI人物是否自然不只是看口型。台词本身是否像人说的同样重要。结## 八、总结uTube 画中画视频并不是什么复杂的新技术。它本质上就是将两个视频画面组合起来一个负责展示内容一个负责进行讲解。传统方式需要拍摄真人视频再通过视频编辑软件进行合成。而现在借助 AI Talking Photo 和 AI数字人技术可以先从一张人物图片生成口播视频再将它与主视频组合从而减少拍摄和重复剪辑的工作量。如果你想制作自己的第一条 AI 画中画视频可以从最简单的组合开始一张人物图片 一段口播 一个主视频。先把人物、声音和主内容组合起来再慢慢调整位置、大小和视觉风格。对于需要长期制作 YouTube 教程、知识分享或产品介绍视频的创作者来说这种工作流值得尝试。如果你想如果你想直接体验这种制作方式可以从 Lipsync.video 的 AI Talking Photo 工具开始尝试。最后别忘了AI 人物是否自然不仅取决于画面也取决于台词是否像人说的话。