重大升级:安装一个 Skill,让 AI 在一杯咖啡时间内自动剪出成片,并保留可编辑工程

重大升级:安装一个 Skill,让 AI 在一杯咖啡时间内自动剪出成片,并保留可编辑工程

重大升级:安装一个 Skill,让 AI 在一杯咖啡时间内自动剪出成片,并保留可编辑工程

Timeline Studio v0.9.1 正式发布。只需要安装一个 Agent Skill,提供图片、视频、产品素材或者网站地址,AI 就能自动完成内容分析、脚本规划、配音、字幕、镜头剪辑和视觉引导,并同时交付最终视频与可继续修改的.timeline工程。

GitHub 仓库:

https://github.com/MartinDelophy/ai-video-editor

Skill 安装页:

https://skills.sh/MartinDelophy/ai-video-editor

一、这次为什么是一次重大升级

Timeline Studio 最初是一个本地优先、直接运行在浏览器中的 AI 视频编辑器。

随着功能不断完善,我们逐渐发现:只在编辑器里增加 AI 配音、字幕、音乐、修复和跟踪能力还不够。

真正能够改变视频生产效率的,是让 Agent 理解用户需求、分析素材、规划镜头、操作编辑器、检查结果,并交付一个可以继续修改的工程。

因此,在 v0.9.1 中,我们重新设计了edit-timeline-studioAgent Skill。

现在,用户只需要描述最终想要的视频:

请把这个网站制作成一条英文介绍视频。 使用自然女声,专业可信但有活力,16:9,约 60 秒。 先体验网站的公开页面。如果关键功能需要登录, 请让我在浏览器中自行登录。 画面保持稳定,使用真实交互、关键帧放大、 下划线和准确框选突出重要功能。 最终输出成品视频和可继续修改的工程文件。

接下来,可以暂时离开去喝一杯咖啡。

Agent 会自动完成第一次完整剪辑,并交付:

project-name.mp4 project-name.timeline

MP4 可以直接发布,.timeline则可以重新导入 Timeline Studio 继续修改。

二、安装 Skill 即可使用

通过 skills.sh 安装:

npx skillsaddMartinDelophy/ai-video-editor\--skilledit-timeline-studio

安装到 Codex:

gh skillinstallMartinDelophy/ai-video-editor\edit-timeline-studio\--agentcodex\--scopeuser\--pinv0.9.1

安装到 Claude Code:

gh skillinstallMartinDelophy/ai-video-editor\edit-timeline-studio\--agentclaude-code\--scopeuser\--pinv0.9.1

GitHub Copilot、Gemini CLI、Cursor 等支持 Agent Skills 的客户端,也可以从同一个 GitHub 仓库发现这套 Skill。

三、不是“一键套模板”,而是先理解内容

传统自动剪辑经常采用固定模板:

  1. 检测静音;
  2. 删除空白;
  3. 按固定时长切片;
  4. 套用统一转场;
  5. 生成字幕;
  6. 导出视频。

这种方式可以处理简单素材,但很难完成专业的产品宣传、教程或网站介绍。

Timeline Studio 的工作流首先会识别内容类别:

类型需要优先保护的内容
人物口播语义、表情、自然停顿和人物稳定性
教程演示指令、操作与结果的对应关系
访谈对话说话人身份、问答关系和真实语境
Vlog/活动事件发展、自然声和镜头变化
产品营销产品身份、卖点证据、品牌和行动号召
叙事纪录人物、因果关系和时空连续性
网站宣传页面证据、真实交互、隐私和视觉引导

分类的目的不是选择一个模板,而是为不同内容应用不同的保护规则。

例如,教程中的“讲解—点击—结果”必须被视为一个整体;产品宣传不能因为 AI 生成的画面更漂亮,就改变包装文字、Logo、颜色或者产品结构。

四、图片和视频如何分析

对于图片,Agent 会检查:

  • 人物、产品和主要视觉主体;
  • Logo 与品牌关键元素;
  • 可读文字;
  • 图像清晰度;
  • 分辨率;
  • 裁切空间;
  • 景深和分层条件;
  • 是否适合直接使用、2.5D、图生视频或图生图处理。

对于视频,分析会组合:

  • 镜头边界;
  • 代表帧;
  • OCR;
  • 语音与字幕;
  • 人物、产品和界面区域;
  • 全局光流;
  • 主体区域光流;
  • 模糊、遮挡与失焦;
  • 动作开始与结果出现的时间点。

光流只负责分析运动,不能单独证明一个区域的语义。

因此,系统会先判断“画面中的对象是什么”,再利用光流判断“它如何移动”。

这让 Agent 可以区分:

全局运动 → 相机移动或相机抖动 局部运动 → 人物、产品或界面内容移动 稳定区域 → 适合阅读、突出或停留 异常运动 → 模糊、遮挡或跟踪失败

在进行跟踪和视觉增强之前,系统会优先处理不必要的全局抖动。

五、自动剪辑之前先生成决策记录

Agent 不会分析完成后立即修改时间线。

它会先构建一份剪辑决策记录:

{"category":"website-walkthrough-promo","goal":"product-introduction","targetDurationSeconds":60,"aspectRatio":"16:9","narrationLanguage":"en-US","voiceProfile":{"genderPresentation":"female","style":"professional-energetic"},"mustKeep":["product value","real interaction","visible result"],"mustAvoid":["private account information","unsupported product claims","camera shake","tracking drift"]}

然后为素材中的重要时间范围记录:

  • 保留;
  • 删除;
  • 缩短;
  • 重排;
  • 加速;
  • 强调;
  • 保护音频连续性;
  • 保护字幕边界。

每个重要决定都会保留原因和置信度。

对于存在实质性歧义的问题,Agent 会向用户询问;对于能够直接从素材中观察到的内容,则不会重复提问。

六、网站宣传视频不再是截图轮播

网站宣传是本次升级重点优化的场景。

拿到一个网站地址后,Agent 不会只截取首页。

它会先构建页面和流程覆盖清单:

  • 主页;
  • 功能页面;
  • 产品列表;
  • 详情页面;
  • 搜索与筛选;
  • 关键操作流程;
  • 登录后的产品界面;
  • 外部链接;
  • 具有真实外部影响的操作。

如果关键页面需要登录,Agent 会要求用户自行在浏览器中完成登录,而不会索要:

  • 密码;
  • 短信验证码;
  • 一次性口令;
  • Cookie;
  • Token;
  • 账户恢复信息。

如果用户不方便登录,Agent 只会基于公开页面继续制作,并把无法访问的能力标记为“未验证”。

在获得授权的页面范围内,Agent 可以通过脚本驱动真实浏览器完成:

  • 平滑滚动;
  • 鼠标移动;
  • hover 状态;
  • 标签切换;
  • 搜索和筛选;
  • 加载到结果的变化;
  • 页面视频播放;
  • 可逆的表单预览;
  • 临时鼠标光环和焦点提示。

脚本不能提交订单、发布内容、发送消息、修改账户资料或者执行其他有外部影响的操作。

七、专业动效不等于“到处画矩形框”

我们在早期测试中发现,自动生成的网站视频很容易出现两个问题:

  1. 每个页面都使用矩形框;
  2. 画面始终在放大、缩小和移动。

这种视频虽然“有动效”,却不具备专业质感。

在新工作流中,Agent 会根据目标选择不同的视觉引导方式:

  • 小而密集的界面:关键帧放大;
  • 精确文字和数字:下划线或括线;
  • 按钮、卡片和结果:准确框选;
  • 需要保留上下文:聚光遮罩;
  • 需要解释元素关系:引导线;
  • 视频中的移动对象:光流辅助跟踪;
  • 静态产品图片:景深或 2.5D 分层。

一个标准的解释镜头遵循:

建立上下文 ↓ 引导注意 ↓ 锁定目标 ↓ 静止阅读 ↓ 自然释放

画面抵达目标后必须停稳,让观众有足够时间阅读。

我们明确拒绝:

  • 无意义的持续缩放;
  • 模拟手持画面;
  • 微抖动;
  • 弹性过冲;
  • 框选漂移;
  • 重复放大和缩小;
  • 滚动和变焦同时发生;
  • 为了展示效果而堆叠效果。

八、先生成自然配音,再决定画面时长

不少自动视频会先固定 60 秒画面,再把配音强行压缩到 60 秒。

这样很容易导致:

  • 语速过快;
  • 停顿消失;
  • 字幕闪过;
  • 品牌名发音错误;
  • 画面重点与配音错位。

Timeline Studio 会先确认:

  • 配音语言;
  • 女性、男性或指定声音;
  • 年龄感;
  • 专业、可信、温暖、活力或沉稳等表达风格;
  • 品牌名、网址、数字和专业词的读法;
  • 字幕语言;
  • 自然语速。

配音确认后,再根据每句话的实际长度和自然停顿安排画面。

如果文案超过目标时长,系统优先修改和压缩文案,而不是粗暴加速声音。

光标到达、框选锁定、下划线出现、关键帧放大和结果展示,也会同步到对应的语句。

九、.timelinev3:一条字幕对应一个音频文件

这是本次工程结构中非常重要的一项升级。

过去,一整段旁白可能只有一个音频文件,时间线中的多个句子只是引用不同时间范围。

这样虽然在界面上看起来已经分段,实际修改一句配音时仍然会影响完整音频。

最新的.timelinev3 会将句子级配音物理拆分:

caption-01 → voice-01.wav caption-02 → voice-02.wav caption-03 → voice-03.wav

字幕通过audioClipId与音频片段一一对应。

归档结构类似:

project.timeline ├── project.json ├── media/ │ ├── visuals/ │ │ ├── 001-homepage.png │ │ └── 002-product.png │ └── audio/ │ ├── voice-001.wav │ ├── voice-002.wav │ ├── voice-003.wav │ └── music.wav

重新打开工程后,用户可以:

  • 替换其中一句配音;
  • 调整一句话的开始时间;
  • 修改音量和淡入淡出;
  • 更新对应字幕;
  • 删除其中一个句子;
  • 重新生成局部声音;
  • 保留其他已经确认的结果。

十、播放循环问题是如何解决的

在多媒体时间线中,如果使用当前视频元素的currentTime作为总时间线时钟,视频在片尾发生解码停顿时,播放头可能一直被限制在当前片段末尾。

用户看到的表现,就是视频在某一个片段中不断循环。

原来的关系接近:

Video currentTime ↓ Timeline playhead ↓ Other media

现在改为:

Monotonic Timeline Clock ├── Video ├── Voiceover ├── Music ├── Captions └── Effects

时间线成为单调递增的主时钟,视频和音频只作为跟随者。

核心逻辑可以概括为:

constwallClockTime=Math.min(timelineDuration,playbackStartTime+(now-playbackStartedAt)/1000);currentTimelineTime=wallClockTime;

同时,片段区间从闭区间判断:

time>=start&&time<=start+duration

调整为半开区间:

time>=start&&time<start+duration

这样可以避免在两个相邻片段的公共边界上同时激活两段媒体。

十一、本地优先与 ModelScope 双线路模型交付

Timeline Studio 将多种 AI 能力放在浏览器中运行:

  • 多语言 AI 配音;
  • Whisper 自动字幕;
  • Stable Audio AI 音乐;
  • 人物与物体检测;
  • 智能画面;
  • 人像处理;
  • AI 修复;
  • 高清增强;
  • 人声分离;
  • 数字人相关能力。

模型采用按需下载和版本固定策略,并通过 Hugging Face 与 ModelScope 双线路交付。

对于国内网络环境,Timeline Studio 优先选择 ModelScope;当线路不可用时,再使用对应的 Hugging Face 镜像。

两家平台使用统一缓存身份:

ModelScope artifact │ ├── same revision ├── same checksum └── same cache identity │ Hugging Face artifact

因此,切换模型来源不会让浏览器重复下载同一个模型。

运行流程如下:

用户第一次选择 AI 能力 ↓ 检查本地缓存 ↓ 检测模型线路 ↓ 下载缺失文件 ↓ 初始化浏览器推理 ↓ 后续任务直接复用

这种本地优先架构带来的价值包括:

  • 原始素材不需要为了基础编辑上传到后端;
  • 模型下载后可以重复使用;
  • 国内外网络环境可以使用不同镜像;
  • 模型版本和许可证更加清晰;
  • Agent 和人工编辑共享同一个项目状态;
  • 导出结果更容易复现。

涉及人脸替换、数字人或其他深度合成能力时,使用者必须取得相关素材的合法授权,不得生成或传播违法、侵权、虚假或误导性内容,也不能将生成结果冒充为真实影像。

十二、命令层与浏览器层协同

Timeline Studio 的 Agent 自动化分为两条路径。

1. 版本化命令路径

对于命令层已经支持的操作,Agent 会先检查工程,再构建声明式编辑计划:

npmrun agent -- project.inspect /absolute/path/project.timelinenpmrun agent -- project.diff /absolute/path/edit-plan.jsonnpmrun agent -- project.run /absolute/path/edit-plan.jsonnpmrun agent -- project.inspect /absolute/path/project-v2.timeline

其中:

  • project.inspect:读取工程摘要;
  • track.inspect:检查具体轨道;
  • clip.inspect:检查片段;
  • transcript.inspect:检查字幕和配音关系;
  • project.diff:进行不写文件的语义 dry run;
  • project.run:执行通过验证的编辑计划;
  • project.render:渲染当前支持的便携工程子集。

命令操作使用稳定 ID、修订号、操作 ID 和前置条件,支持事务和幂等控制。

2. 浏览器兼容路径

对于以下能力,Agent 会使用 Timeline Studio 编辑器:

  • AI 配音;
  • 自动字幕;
  • 复杂效果;
  • 网站交互;
  • 实时预览;
  • 尚未进入命令注册表的编辑操作;
  • 富媒体最终导出。

Skill 会明确区分两条路径,不会把浏览器自动化描述成完全确定性的无头执行。

十三、一键成片之后如何快速修改

因为最终保留了.timeline工程,用户后续可以直接提出局部修改需求。

例如:

请打开这个工程。 将第二句英文配音替换为新的文案, 同时更新对应字幕。 把第三个镜头延长 1.5 秒, 其余已经确认的画面、配音和音乐保持不变。 重新导出视频。

也可以继续调整:

  • 单个镜头;
  • 镜头顺序;
  • 字幕内容;
  • 字幕样式;
  • 某一句配音;
  • 背景音乐;
  • 音量;
  • 淡入淡出;
  • 放大位置;
  • 框选范围;
  • 转场;
  • 视频比例;
  • 不同语言版本。

这让 Agent 的工作从“一次性生成”变成“持续协作”。

十四、我们如何定义任务完成

成功调用导出接口,并不代表视频已经完成。

Timeline Studio 会检查两类结果。

结构正确性

  • .timeline能否重新打开;
  • 媒体文件是否完整;
  • 字幕与配音是否一一对应;
  • 主画面是否可见;
  • 第一帧能否正常渲染;
  • 轨道时间是否正确;
  • 轨道显隐和锁定状态是否恢复;
  • 导出视频是否包含真实音频;
  • 分辨率、时长和帧数是否正确;
  • 播放是否可以连续跨越全部片段边界。

编辑质量

  • 是否存在画面抖动;
  • 跟踪是否漂移;
  • 框选是否准确;
  • 产品或人物身份是否被改变;
  • 配音是否自然;
  • 字幕是否有足够阅读时间;
  • 强调效果是否与声音同步;
  • 画面是否遮挡关键内容;
  • 需要阅读时画面是否停稳;
  • 是否堆叠了过多效果。

只有结构和质量都通过检查,任务才算完成。

十五、这次升级意味着什么

过去,AI 视频工具通常交付一个结果。

现在,Timeline Studio 希望交付一套可以持续工作的生产流程:

用户提出需求 ↓ Agent 理解素材与目标 ↓ Agent 自动完成第一次剪辑 ↓ 交付 MP4 + .timeline ↓ 用户提出局部修改 ↓ Agent 调整指定片段 ↓ 重新验证并导出

用户不需要学习所有剪辑工具,也不需要每次从零生成。

第一次任务只需要一杯咖啡的时间,之后的修改则可以基于原工程快速完成。

结语

我们认为,AI 视频编辑下一阶段的竞争点,不只是生成模型能否做出漂亮画面。

真正重要的是:

  • 能否理解素材;
  • 能否保护事实和品牌;
  • 能否规划清晰的叙事;
  • 能否生成自然配音;
  • 能否稳定、准确地引导观众;
  • 能否交付可继续编辑的工程;
  • 能否在用户修改需求时只调整必要部分。

Timeline Studio 想做的事情,可以概括为一句话:

安装一个 Skill,一杯咖啡的时间获得一条成品视频;保留一个可编辑工程,承接之后的每一次调整。

GitHub 仓库:

https://github.com/MartinDelophy/ai-video-editor

相关地址:

  • Skill 安装:https://skills.sh/MartinDelophy/ai-video-editor

如果这个项目对你有帮助,欢迎 Star、提交 Issue,或者告诉我们你最希望交给 AI 自动完成的视频制作场景。