Pixelle-Video:输入一个主题,3 分钟出片 AI 短视频 📅 发布时间:2026/9/18 23:24:10 👁 浏览次数: Pixelle-Video输入一个主题3 分钟出片 AI 短视频【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video一条 60 秒的竖屏科普视频从输入如何提升工作效率到 MP4 落盘全程 3–5 分钟中间不打开任何剪辑软件、不录一次音轨。这是 Pixelle-Video 做到的事一个开源的 AI 短视频生成引擎输入一句话主题自动产出带旁白、配图、字幕和背景音乐的完整成片。 它到底能做什么你只负责给主题或贴一段现成文案剩下的环节它全包了写稿LLM 按分镜数生成结构化旁白每段 5–20 字天然适配一句话配一帧的节奏配图逐帧调用 FLUX、SDXL、Qwen、Wan 等图像/视频模型或走 ComfyUI 工作流配音Edge-TTS 或 Index-TTS支持上传参考音频做声音克隆合成HTML 模板排版文字与画面ffmpeg 拼接片段、叠加 BGM输出 MP4。传统流程 vs 本项目环节传统做法Pixelle-Video脚本 分镜手动写稿切段一次生成默认 5 段素材找图 / 拍图AI 逐帧生成剪辑时间轴拖拽按音频时长自动对齐 3 分钟跑通最小可用流程克隆仓库并进入目录git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video启动 Web 界面需先装好 uv 和 ffmpeguv run streamlit run web/app.py浏览器打开 http://localhost:8501。首次进入展开「⚙️ 系统配置」面板只填两处就够LLM选通义千问或 DeepSeek 预设填 API Key图像工作流默认走runninghub/image_flux.json填一个 RunningHub Key 即可不用本地部署 ComfyUI。其余 TTS、模板、BGM 保持默认。左侧输入主题右侧点「 生成视频」进度条会实时显示分镜 3/5 - 生成插图几分钟内右侧就出现可播放的成片文件落在output/目录。⚙️ 核心机制拆解一条流水线是怎么跑通的整条流水线在 pixelle_video/pipelines/standard.py 里可以拆成四段。主题到分镜让 LLM 替你切节奏输入为什么我们还没找到外星文明系统先调 LLM 生成标题再按n_scenes5拆出 5 段旁白每段限制在min_narration_words5到max_narration_words20之间——这是刻意压短因为每一段都会对应一帧画面太长会把单帧时长拖垮。如果你走固定文案模式系统按段落、行或句子三种方式切分split_mode参数适合已有完整稿子的场景。音画同步先合成语音再生成画面这是整个项目最反直觉的设计。每一帧的处理顺序是TTS 先跑 → 拿到音频时长 → 把时长传给视频生成工作流。也就是说Wan 2.1 生成的片段时长是被旁白锁死的拼接时不用补帧也不用裁尾音画天然对齐。你最终听到的是一段语速均匀、切镜点精确卡在句尾的解说不会出现画面还在动、声音已经停了的空档。HTML 模板把画面排版成模板化成品templates/目录里有 30 个 HTML 模板按static_/image_/video_三种前缀区分是否需要 AI 生成媒体。渲染时系统把 AI 配图、标题、旁白文字、品牌角标按模板的 CSS 排版成一帧截图再合成视频。同一句AI 改变内容创作切到极简模板就是白底细线的杂志感切到 film 模板就是黑底衬线字加留白。模板即风格改 CSS 就能出品牌视觉。ffmpeg 收尾拼接 BGM 一次完成VideoService用 ffmpeg 把 N 个片段串成一条音频轨合并旁白与bgm/目录里的背景音乐音量自动归一。你拿到的是一个 1080×1920、可直接发抖音的 MP4。 实战一条为什么还没找到外星文明走完全流程输入左侧选「AI 生成内容」主题栏填为什么我们还没有找到外星文明分镜数保持默认 5语音中间栏 TTS 工作流选selfhost/tts_edge.json音色选zh-CN-YunxiNeural男声偏解说点「预览语音」先听 3 秒视觉图像工作流选runninghub/image_flux.json提示词前缀填Cinematic, moody, deep space, minimalist英文模板选1920x1080/image_film.html尺寸 1920×1080BGM选内置default.mp3试听确认不抢人声生成点「 生成视频」右侧进度依次显示生成文案 → 分镜 1/5 插图 → 分镜 1/5 语音 → …全程 3 分 40 秒左右微调第一版旁白第 3 段太书面切到固定文案模式贴入改写稿重新生成或保留文案、把模板换成image_ultrawide_minimal.html再跑一遍只动视觉层。其他场景如数字人口播、图生视频、动作迁移都在 web/pipelines/ 下以独立流水线提供切换方式相同。 进阶批量、模板与参数批量生成内容输入区切到批量模式每行一个主题任务队列自动排队适合做系列或日更模板定制所有模板在 templates/ 下改 CSS 变量即可换主色、字号、品牌 Logo无需碰 Python 代码工作流扩展把 ComfyUI 导出的 JSON 丢进 workflows/重启后自动出现在下拉菜单支持本地 selfhost 与云端 runninghub 两套目录参数调优n_scenes控制分镜数3–8 之间tts_speed调语速0.8–1.2 最自然prompt_prefix是全局画风锚点改动一次影响所有分镜。❓ 新手最容易卡住的 4 个问题Q生成卡在生成配图不动A先查 RunningHub 配额是否耗尽再查comfyui.comfyui_url是否可达本地模式最后看终端日志里 prompt 是否被内容审核拦截。Q旁白听起来机械、和画面不同步A同步问题查 TTS 工作流是否返回了duration机械感先换音色再调tts_speed0.9仍不行就上 Index-TTS 传参考音频克隆。Q图片风格跑偏跟提示词前缀对不上A先确认prompt_prefix是英文再看图像模型是否支持你给的分辨率换selfhost/image_flux.json与runninghub/image_flux.json对比即可定位是模型问题还是参数问题。QWindows 上 ffmpeg 报错A先跑ffmpeg -version确认在 PATH 里整合包已内置源码安装需把bin目录加入环境变量。 把仓库拉下来跑通第一条配置模板见 config.example.yaml界面细节查 docs/zh/user-guide/web-ui.md扩展能力看 workflows/ 目录。今晚把主题贴进去明早你的账号上就多一条 60 秒成片。【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考