录完教程不用再写一遍:我把 38 秒视频交给 WorkBuddy,文章和 SOP 都出来了

录完教程不用再写一遍:我把 38 秒视频交给 WorkBuddy,文章和 SOP 都出来了 录完一段软件演示最磨人的活往往还没结束。视频里已经把操作讲了一遍准备图文稿时却还得从头听、暂停、抄按钮名再把截图塞回对应步骤。团队里的培训录屏也有同样的问题。新人培训、后台操作、客服排错全躺在视频里真正要查某一步时只能拖着进度条找。业务人员想把它们整理成知识库又很难抽时间从空白文档写起。这两种重复劳动可以交给同一套桌面 Agent 工作流放入自己录制或获授权的软件操作视频取回图文教程、操作步骤文档SOP、关键截图和待确认项。个人录完演示可以继续发图文团队积压的培训视频也能逐条变成内部文档。先看成品再讲它怎么做出来这次输入的是一段 38.96 秒的 SkillHub 录屏搜索腾讯云文字识别 Skill进入认证详情页再找到安装提示词。下面就是它实际生成的tutorial-article.md不是流程示意图。生成稿的标题是《如何在 SkillHub 找到腾讯云文字识别 Skill并把安装提示词交给 AI》。正文已经写成四个动作打开全部技能并搜索、核对目标 Skill、找到安装提示词、安装后配置密钥。它还保留了视频没有证明的部分。录屏只出现“复制 prompt”入口没有终端安装画面所以成品写的是“找到安装提示词”而不是“已经安装成功”。同一目录里还生成了六步 SOP、4×4 全程联系图和待确认项清单。难点不只是语音转文字。旁白通常是一整段话没有按钮位置、页面变化和成功状态。本文把 VITA、语音识别和文字识别封装成一个名为tencentcloud-media-review的组合 Skill分别看视频、听旁白、读界面再由 WorkBuddy 把同一时间点的内容合成教程步骤。为什么不能只做语音转写比如旁白说“选择认证条目”语音识别不知道页面上哪个结果带认证标识文字识别能读到作者名称却不知道它对应视频里的哪一步。单项能力都不够。三项能力放进同一个桌面 Agent 后各自只负责自己擅长的部分环节谁来做给文章提供什么理解视频结构VITA操作顺序、可能对应的时间点、画面变化听懂讲解语音识别目标、理由、提醒和口头补充读取界面文字识别按钮名、产品名、状态和提示文字整理成文WorkBuddy步骤编排、图片位置、成功标志和注意事项同一时间点的动作、旁白、截图和界面文字对齐后才组成一个可检查的教程步骤。下面这张 2×2 是真实执行结果。旁白、界面文字、运行记录和六步 SOP 都来自同一段视频。视频进去后教程是怎么出来的Agent 先读取视频时长、分辨率和音轨再从头到尾均匀抽取 16 帧。这样可以先确认操作是否完整避免模型只看到开头几秒就开始写步骤。4×4 联系图只证明整段视频被覆盖。随后三项能力分别找动作、听讲解、读界面WorkBuddy 按时间对齐后先生成 SOP再改写成教程文章。不到 60 秒的短视频直接识别整段旁白。更长的录屏会进入长音频识别或自动切片不会因为超过一分钟就停下。关键步骤每四张合成一张 2×2正文只挑能支撑操作的图片。换成你的视频直接这样交给 Agent把tencentcloud-media-review装进桌面 Agent 后拖入自己录制或获授权的视频再发出下面这段要求把这段带旁白的软件操作视频整理成图文教程。 请用 tencentcloud-media-review 检查完整视频用 VITA 拆步骤、语音识别转写旁白、文字识别读取关键帧。 每一步保留视频秒数、真实截图和成功标志。 最后交付 tutorial-article.md、SOP、来源表和待确认项不要自动发布。Windows 上也可以直接运行通用入口视频路径和输出目录都能替换.\scripts\run_video_to_tutorial.ps1 -VideoFileD:\videos\你的教程.mp4-VideoUrlhttps://你已确认可上传的视频地址.mp4-OutputDirD:\tutorial-output-ConfirmVitaCostVITA 需要公网视频 URL所以桌面 Agent 会先展示 URL、完整提示词和费用风险等用户确认后再调用。SecretId、SecretKey 和 VITA API Key 使用隐藏输入只进入当前 PowerShell 进程。本次视频能看到“复制 prompt”入口但没有展示安装终端。因此生成稿只把它写成“找到安装提示词”没有写成“安装已经完成”。这次实测哪些结果可以确认输入视频为 38.96 秒、1280×720视频理解和语音识别均返回结果关键帧文字识别为 6/6三项云端能力合计用时 56.412 秒补取全程关键帧并再次识别用时 12.85 秒。第一次视频理解给出的时间点集中在前段平台名称也和旁白、界面文字对不上。Agent 随后按完整时长重新抽帧用文字识别补齐后半段没有把一次识别结果直接写进教程。旁白、画面和界面文字会互相校对。三份证据对不上时相关步骤进入待确认清单不会直接混进正文。录完以后怎么接进日常工作个人创作者录完视频后先拿生成稿补齐标题、步骤和配图再核对待确认项不必从空白文档重写。团队可以把同一产品的培训录屏放进固定目录逐条生成 SOP。业务负责人只核对按钮、成功状态和内容时效确认后再放进知识库。第三方教程也能作为输入但只有获得再利用和改写许可后才适合公开成文。能下载视频不等于拥有转载权没有许可时生成结果只用于个人学习笔记。交付物是可复核初稿不会自动发布。视频没有展示的结果也不会被补写成“已经成功”例如画面只出现“复制提示词”按钮就只能确认入口存在不能据此声称安装已经完成。录屏结束后下一步不再是重新写一遍而是把视频变成带证据的教程初稿再由人完成最后确认。