WorkBuddy 获客自动化,字幕方案我替你选好了

WorkBuddy 获客自动化,字幕方案我替你选好了

我花了两周时间,把市面上能用的字幕方案全试了一遍。

大家好,我是小虎。

上周训练营有个学员跟我说,他的视频自动化链路全跑通了,脚本自动写、配音自动出、画面自动生成,但最后一步加字幕,怎么弄都丑,丑到他自己都不想发。

我一看他发的截图,好家伙,白色宋体小字贴在画面最底下,没描边没阴影没动画,活脱脱 2005 年盗版 DVD 的感觉。

我说你用的什么加的字幕?他说 FFmpeg,一条命令烧进去的。

我说那就对了。FFmpeg 能自动化,但它出来的字幕就是长这样。

这件事让我意识到一个问题。做短视频自动化的人,大部分把字幕当成了「加个 SRT 就完事」的简单环节。但真正卡住你的,不是识别准不准,是字幕长什么样。

识别这件事,2026 年早就不是问题了。百炼 FunASR 一小时才 0.13 元,edge-tts 配音还免费带时间戳,Whisper 本地跑完全不要钱。随便选一个都能打。

但识别出来的文字,怎么让它好看地出现在画面上?这才是真正的坑。

我花了两周时间,把市面上能用的字幕方案全试了一遍。今天把结果给你,5 款工具,逐个说清楚,最后告诉你我选哪个、为什么选、怎么搭。

这次对比的 5 款工具

先列出来,心里有个数。

  1. 1.剪映(字节跳动)
  2. 2.FFmpeg(开源命令行)
  3. 3.妙幕 SmartSub(开源桌面工具)
  4. 4.Remotion(开源代码渲染)
  5. 5.ChatCut(第三方 Web 平台)

下面逐个说。每款我会讲清楚它是什么、怎么接入、字幕效果怎么样、能不能自动化、价格多少、适合谁。说完一个再说下一个,不跳着来。

剪映

剪映不用我多介绍了吧?字节跳动的,APP 下载量 1.2 亿,国内做短视频的人手机里基本都有。

它的字幕能力确实是开箱即用的天花板。你录一段视频或者导入一段音频,点「识别字幕」,几秒钟就出来了。中文普通话识别率号称 98.5%,我实测下来确实很高,日常说话基本不出错。

识别完以后,花字模板几百种。逐字弹跳、打字机效果、描边阴影、渐变背景条、霓虹发光,你见过的短视频上那些好看字幕,大部分就是剪映出的。点一下模板就套上去了,不用写任何东西。

还能做多语言翻译字幕,一键把中文翻成英文、日文,字幕直接替换。

价格方面,手机端基本免费,专业版有些高级花字模板要会员,但日常够用。

听起来完美对吧?但问题来了。

剪映没有 API。一个字都没有。

它的字幕能力锁在客户端里,只能手动操作。你没办法写一行代码让剪映自动给视频加花字。WorkBuddy 调不了它,n8n 调不了它,Python 调不了它,任何自动化框架都调不了它。

这意味着什么?你每天做 10 条视频,每条都要打开剪映,手动点识别字幕,手动选花字模板,手动调位置大小。10 条就是 10 次手动操作。做 100 条就是 100 次。

这不是自动化,这是半自动化的体力活。

而且剪映的工程文件是私有格式,你没法用代码批量修改字幕内容。想改一个字?打开剪映,找到那条视频,手动改。

所以剪映的定位很清楚。单条视频手动加字幕,效果最好,没有之一。但如果你想做批量、做流水线、做一人公司视频工厂,剪映帮不了你。

FFmpeg

FFmpeg 是开源的命令行音视频处理工具,做视频自动化的人基本都绕不开它。

字幕方面,它能做的事情很简单。你给它一个 SRT 或者 ASS 字幕文件,一条命令就能把字幕烧进视频画面里。完全命令行操作,能被任何脚本调用,自动化能力满分。

ffmpeg -i input.mp4 -vf "subtitles=subs.srt" output.mp4

就这一行,字幕就烧进去了。

但效果呢?默认是白色 Arial 字体,没有描边,没有阴影,没有背景,没有动画。贴在画面底部,小得跟蚂蚁似的。你看过那种盗版电影的字幕吗?就那个感觉。

01_ffmpeg

能不能调?能。FFmpeg 支持 ASS 字幕格式,ASS 可以设置字体、字号、颜色、描边、阴影、位置,甚至简单的淡入淡出动画。但 ASS 的语法极其反人类,写一个带描边加阴影加居中加淡入的字幕样式,你得查半天文档,写一堆标签。

而且 ASS 的上限就在那了。逐字弹跳?做不到。当前词高亮?做不到。毛玻璃背景条?做不到。弹簧动画?想都别想。

价格方面,FFmpeg 完全免费,开源,本地运行,不联网。

所以 FFmpeg 的定位也很清楚。自动化能力满分,但渲染效果停在 2005 年。适合「有字幕就行,好不好看无所谓」的场景,比如内部培训视频、监控录像加时间戳这种。做获客短视频?你自己看了都不想发。

妙幕 SmartSub

妙幕是一个开源的桌面字幕工具,GitHub 上能找到,跨平台,Windows 和 Mac 都能用。

它做的事情比较完整。从音视频生成字幕、翻译、校对、到烧录,一条龙。支持批量处理,支持 GPU 加速。

最厉害的是它支持 6 种 ASR 引擎。whisper.cpp、faster-whisper、FunASR、Qwen3-ASR、FireRedASR、Whisper CLI,你本地装了哪个它就能调哪个。识别完以后可以在界面里校对修改,改完直接烧录。

字幕样式方面,比 FFmpeg 强不少。字体、大小、颜色、描边、阴影、位置都能调,还有样式预设。比纯 SRT 好看,但跟剪映的花字比还是差一截。没有逐字动画,没有弹跳效果,就是静态样式调得好一点。

烧录方式支持两种。硬字幕(直接烧进画面)和软字幕(封装成可开关的字幕轨道)。

价格完全免费,开源,本地运行,数据不出你的电脑。

但妙幕有个致命问题。它是 GUI 工具,图形界面的。你得用鼠标点,用眼睛看,手动操作。WorkBuddy 调不了它,脚本调不了它,自动化链路里塞不进去。

它适合什么场景?你有一批视频需要批量加字幕,但不需要全自动。比如你手动跑一下妙幕,它帮你批量识别加烧录,省得你一条一条在剪映里点。比纯手动快,但不是真正的自动化。

Remotion

Remotion 是一个开源框架,用 React 加 CSS 来写视频。听起来很疯狂对吧?用写网页的方式做视频。但 2026 年它已经非常成熟了,GitHub 上 star 数很高,社区活跃。

字幕方面,Remotion 的能力是降维打击级别的。因为字幕样式本质上就是 CSS,动画本质上就是 JavaScript。你能用 CSS 写出来的任何效果,Remotion 都能渲染成视频帧。

02_remotion

逐字弹入动画?spring 物理弹簧,几行代码。当前词金色高亮?条件渲染,一个 if 的事。毛玻璃背景条?backdrop-filter 一行 CSS。渐变描边?text-shadow 叠几层。打字机效果?逐帧控制显示字数。

上限不是工具决定的,是你的 CSS 水平决定的。而 CSS 这东西,比 ASS 字幕格式好学一百倍。

自动化方面,Remotion 本身就是代码,天然在自动化链路里。WorkBuddy 调它跟调任何一个 Node.js 脚本没有区别。ASR 出词级时间戳,喂给 Remotion 组件,组件按时间戳逐词渲染,最后输出 MP4。全程零手动。

价格完全免费,开源,本地渲染。唯一需要的是 Node.js 环境和一个 Chrome 浏览器(渲染用)。

缺点呢?有,说实话。

第一,你得会写一点 React 和 CSS。不是说要精通,但基本的组件概念、JSX 语法、CSS 属性你得知道。如果你连 HTML 都没碰过,上手会有学习曲线。不过话说回来,你在做视频自动化,说明你已经接受了「用代码代替手动」这个前提。

第二,首次配置需要装 Node.js、装 Remotion、配置 Chrome 路径。国内网络下载 Chromium 经常卡住,需要用本地 Chrome 绕过。我后面实操部分会讲怎么解决。

第三,渲染速度取决于你的电脑配置。一条 12 秒的 1080x1920 视频,我的电脑大概渲染 30 秒到 1 分钟。不算快,但能接受。

Remotion 的定位。自动化能力满分,渲染效果天花板,但有一定技术门槛。适合已经在用代码做视频自动化的人,字幕环节用 Remotion 补齐,整条链路就闭环了。

ChatCut

ChatCut 是一个第三方的 Web 端 AI 视频编辑器,公司叫 ChatCut Inc。,跟剪映没有任何关系。

它的思路比较新。你用自然语言跟它说话,它帮你剪视频。比如你说「把第三段删掉,加个字幕」,它就帮你做了。

字幕方面,它支持近 100 种语言的自动转录,能识别不同说话人,时间码精确到帧。导出格式包括 MP4、XML、SRT 字幕、Word 文档等。

它有一个开源的 Agent 插件(GitHub 上能找到),还提供了 MCP 接口,理论上 AI Agent 可以调用它。

但实际用下来,有几个问题。

第一,核心剪辑能力跑在它的云端,不是真正开源。插件只是调用入口,数据要过它的服务器。做获客视频的话,内容安全是个考量。

第二,字幕样式能力没有公开文档,不确定能不能自定义花字效果。从演示来看,字幕样式比较基础,没有剪映那种丰富的花字模板。

第三,价格没公开,需要联系商务。对个人创作者来说,这是个不确定因素。

ChatCut 的定位。思路很新,对话式剪辑是未来方向,但目前字幕能力不够成熟,价格不透明,数据过云端。适合尝鲜体验,不适合放进生产链路。

5 款工具推荐星数

说完了,给个总结。5 星满分。

说明一下这个评分逻辑。

剪映识别和渲染都是满分,但自动化能力是 1 星,因为完全没有 API。如果你只做单条视频,剪映是 5 星。但如果你要做批量、做流水线,它只能给 3 星。

FFmpeg 自动化满分,但渲染效果 1 星,识别能力 2 星(它本身不做识别,得配合其他 ASR 工具)。适合「有就行」的场景。

妙幕识别和渲染都还行,但自动化 2 星,因为是 GUI 工具。适合批量手动处理。

Remotion 五项全高,唯一扣在上手难度 4 星。但一旦学会了,就是字幕自动化的终局方案。

ChatCut 思路新但不够成熟,价格不透明,暂时观望。

我的选择是 Remotion。 理由很简单,做短视频获客自动化,字幕环节必须能进流水线,同时效果不能丑。同时满足这两个条件的,只有 Remotion。

怎么用 Remotion 搭字幕自动化

好,选型说完了,下面讲怎么搭。我尽量说得简单,没写过代码的也能跟着做。

整条链路就三步。配音加时间戳、搭 Remotion 项目、渲染出片。

配音加时间戳

用 edge-tts,免费,一行命令同时出配音和字幕时间戳。

先装 edge-tts。

pip install edge-tts

装好以后跑这条命令。

edge-tts --voice zh-CN-YunxiNeural --rate="+5%" --text "你的文案内容" --write-media voice.mp3 --write-subtitles subs.vtt

跑完你会得到两个文件。voice.mp3 是配音,subs.vtt 是带时间戳的字幕。

打开 vtt 文件看一下,长这样。

1 00:00:00,100 --> 00:00:02,157 大家好,我是小虎。

每句话的起止时间都有了。后面 Remotion 就靠这个时间来同步字幕动画。

😅 有个坑。edge-tts 给的是句级时间戳,不是词级。要做逐词动画,得自己按字数比例拆。比如一句话 2 秒,10 个字,那每个字大概 0.2 秒。不需要精确到毫秒,视觉上看不出差别。

搭 Remotion 项目

在 D 盘建个文件夹(C 盘空间紧张的朋友注意),初始化项目。

mkdir D:\subtitle-demo cd D:\subtitle-demo pnpm init pnpm add remotion @remotion/cli react react-dom pnpm add -D typescript @types/react

把 voice.mp3 复制到 public 文件夹里。

然后在 src 目录下写一个字幕组件。核心逻辑很简单。每个词是一个 span 标签,用 spring 动画控制弹入,当前正在读的词变金色,其余白色。整行字幕加个半透明背景条。

我直接给你完整代码,复制就能用。

// src/AnimatedCaptions.tsx import React from 'react'; import {AbsoluteFill, Audio, staticFile, useCurrentFrame, interpolate, spring, useVideoConfig} from 'remotion'; // 把vtt时间戳换算成帧数(秒数×30),按字数比例拆词 const captionLines = [ { startFrame: 3, endFrame: 65, words: [ {word: '大家好', startFrame: 3, endFrame: 30}, {word: '我是', startFrame: 30, endFrame: 48}, {word: '小虎', startFrame: 48, endFrame: 65}, ], }, // 后面的句子同理,按vtt时间×30填进来 ]; export const AnimatedCaptions = () => { const frame = useCurrentFrame(); const {fps} = useVideoConfig(); return (

{captionLines.map((line, i) => { if (frame < line.startFrame || frame > line.endFrame + 10) return null; return (

{line.words.map((w, j) => { const appeared = frame >= w.startFrame; const active = frame >= w.startFrame && frame <= w.endFrame; const p = spring({frame: frame - w.startFrame, fps, config: {damping: 12, stiffness: 200}}); return ( <span key="{j}" style="{{;" display:="" 'inline-block',="" fontsize:="" 52,="" marginright:="" 6,="" opacity:="" appeared="" ?="" p="" :="" 0,="" transform:="" `scale(${appeared="" 0.6="" +="" 0.4="" *="" 0})`,="" color:="" active="" '#ffd700'="" '#fff',="" textshadow:="" '0="" 0="" 20px="" rgba(255,215,0,0.8)'="" 2px="" 4px="" rgba(0,0,0,0.9)',="" fontweight:="" 900="" 700,="" fontfamily:="" '"microsoft="" yahei",="" sans-serif',="" }}="">{w.word} ); })}

); })}

); };

这段代码做了什么?每个词弹入的时候有个从小变大的弹簧动画,正在朗读的词变成金色加发光,其余词白色。整行有个半透明黑底。字号 52px,在竖屏手机上看得很清楚。

想调样式?改 CSS 就行。字号改 fontSize,颜色改 color,动画快慢改 damping 和 stiffness。全是前端那套东西,没有黑魔法。

渲染出片

一条命令。

npx remotion render src/index.ts AnimatedCaptions out/result.mp4 --browser-executable="C:/Program Files/Google/Chrome/Application/chrome.exe"

😅 这里有个坑。Remotion 默认会下载一个 Chromium 浏览器,国内网络经常卡住。加--browser-executable参数指向你本地的 Chrome 或 Edge,跳过下载,秒开。

渲染完打开 result.mp4,你应该看到深色背景上,字幕逐词弹入,当前词金色高亮,配音同步播放。

验证方式很简单。播放视频,看字幕出现的时间和配音是不是对齐的。如果有偏移,回去改 captionLines 里的帧数就行。

效果对比

我做了个对比视频。左边 FFmpeg 默认字幕,右边 Remotion 动态字幕。同一段配音,同一段文案。

03_comparison

左边是白色宋体小字,无动画无背景,像 2005 年的盗版碟。右边是逐词弹入加金色高亮加半透明背景条,像 2026 年的抖音爆款。

差距不在内容,在渲染层。

成本账

最后算个账。

edge-tts 配音,免费。Remotion 渲染,本地跑,免费。整条链路零额外费用。

如果你用百炼 FunASR 做识别(比如你有真人录音需要转字幕),0.13 元一小时,一条两分钟的视频不到半分钱。

跑一条是这个成本,跑一百条也是,跑一千条还是。链路搭好以后,边际成本趋近于零。

对比一下手动方案。剪映手动加字幕,一条 3 到 5 分钟。一天 10 条就是半小时到一小时的纯体力活。一个月下来十几个小时花在「点字幕」上。

自动化方案把这些时间还给你了。

但是,上面这些你其实都不用自己做

我知道你看到代码块的时候心里咯噔了一下。

React? CSS? spring 动画?我一个做内容的,为什么要学这些?

说得好。你不需要学。

上面那些代码、那些命令、那些配置,是我替你趟过的路。我写这篇文章的目的,不是让你自己去学 Remotion,是让你知道这条路存在、效果能打、成本为零。

真正干活的时候,你只需要打开 WorkBuddy,跟它说几句话。

比如你可以这样说。

「帮我用 edge-tts 给这段文案配音,声音用云希,语速加 5%。然后用 Remotion 做逐词弹入的动态字幕,当前词金色高亮,背景半透明黑底,字号 52,竖屏 1080x1920。渲染成 MP4 给我。」

WorkBuddy 会自己装环境、写代码、跑命令、出视频。你全程不需要碰一行代码。

它背后调的就是我上面讲的这套链路。edge-tts 出配音加时间戳,Remotion 组件渲染逐词动画,Chrome 渲染输出 MP4。但这些细节你不用管,WorkBuddy 替你管。

你只管给文案,它给你成品视频。带配音的,带动态字幕的,能直接发的那种。

这才是真正的自动化。不是你学会了所有工具,而是你只需要说一句话,工具自己串起来干活。

写在最后

整条链路串起来看。脚本有素材库,配音有 edge-tts,画面有分镜图加即梦,视频渲染有 Remotion,字幕也是 Remotion。每个环节都能被 WorkBuddy 一句话调起来。

字幕是这条链上最后一个补齐的环节。补上以后,从文案到成片,全程零手动。

你一个人,一台电脑,一个 WorkBuddy,就是一个视频工厂。

以前做 10 条视频要一天,现在做 10 条视频要 10 分钟。省下来的时间,拿去谈客户、做产品、陪家人,哪个不比「点字幕」值钱?

字幕不是视频自动化的配角,是成片的最后一道门面。而这道门面,现在一句话就能搞定。

我还在持续更新短视频获客自动化的系列内容。想深入聊这块的话,后台私信我,我拉你进交流群。

群里都是正在做 AI 短视频的朋友,大家一起碰方法,比一个人闷头摸索强太多了。

想,都是问题。干,就对了。