今天要演示的是一个书单选书视频自动化工作流。它基于 Coze 平台,将书籍信息、封面图片、配套音频与视频合成能力结合在一起,能够实现从选书到生成完整短视频的全流程。工作流的设计逻辑不仅覆盖了数据处理、批量任务调度,还融合了大模型在音频合成、图像生成和视频渲染等方面的能力。通过表格化的整理,我们可以直观理解工作流中涉及的核心模型、Node 节点以及它们的角色定位。文章目录工作流介绍核心模型Node节点工作流程大模型应用语音合成使用方法应用场景开发与应用工作流介绍该工作流的核心价值在于:将外部书籍数据接入后,自动处理封面与时间线信息,再配合语音合成、背景音效和图像叠加,最终输出适合发布的短视频内容。整体流程强调批量化、高并发执行,并借助多个节点协同,实现图文声像的有机组合。核心模型在该工作流中,核心模型主要体现在对语音合成与视频合成的调用上。语音合成模型根据输入文本和预设音色生成自然的语音文件;视频合成模型则负责将书籍图像、音频与效果轨道整合成最终视频。它们是实现自动化视频生产的关键支撑点。模型名称说明语音合成 (speech_synthesis)将书籍金句文本转化为配音,支持多音色选择,生成自然语音视频合成 (gen_video)结合草稿链接渲染完整视频,整合图片、音频与效果Node节点节点设计涵盖了批处理、文本与图片处理、音频生成与合成等环节,每个节点承担不同的工作职责。例如,批处理-书本封面图片用于批量