【Coze】【视频】三分钟读一本书 今天给大家演示一个《三分钟读一本书》Coze 工作流。该工作流通过大模型驱动的分镜文案生成、图像合成、语音合成以及视频草稿自动创建等一整套流程,将一本书的内容浓缩为一个三分钟的视频,实现从文本到成片的全自动化制作。用户只需输入书名、作者和个人账号信息,即可得到包含字幕、画面、旁白和转场效果的完整视频成品。文章目录工作流介绍核心模型Node节点工作流程大模型应用分镜画面生成与字幕拆解使用方法应用场景开发与应用工作流介绍这个工作流的核心逻辑围绕大模型文案分镜生成 + 图像生成与处理 + 音频合成 + 视频草稿合成四个部分展开。它利用大语言模型生成分镜脚本和关键词,再调用图像生成与抠图工具输出视觉元素,结合语音合成生成解说音频,最后通过代码逻辑和视频剪映插件完成音视频素材的整合,生成最终的视频草稿。整个过程体现了文本、图像、音频多模态结合的自动化生产能力。核心模型该工作流的核心模型是大语言模型「豆包·1.5·Pro·256k」,它负责将输入的书籍文案转化为视频分镜描述、图像提示词和字幕。模型的能力保证了分镜与原文案一致,且在画面表现和关键词抽取上具有创造性和准确性。模型名称说明豆包·1.5·Pro·256k用于生成分镜画面描述、字幕文案及关键词,驱动整个视频内容创作Node节点该工作流包含多个关键节点,覆盖了从数据输入、分镜生成、图像处理到视频草稿生成的各个环节。大模型节点完成文本到分镜的转换,图像生成