FunClip使用指南:本地部署AI视频剪辑,3步把2小时会议录像变成精华片段
FunClip使用指南本地部署AI视频剪辑3步把2小时会议录像变成精华片段【免费下载链接】FunClipFunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.项目地址: https://gitcode.com/GitHub_Trending/fu/FunClipFunClip 是一款本地部署的开源AI视频剪辑工具基于阿里达摩院 FunASR 的 Paraformer 语音识别模型先把会议录像、网课、访谈转成带时间戳的文字再按文本片段、说话人或大模型推理结果一键剪出目标视频并自动生成 SRT 字幕。适合需要整理会议纪要、课程切片和自媒体素材的职场人、教师与创作者无需编程基础装好依赖后很快能跑通第一次剪辑。项目速写它替你做了哪几件事FunClip 完全开源、免费MIT 许可整个流程在本地运行语音识别、文本筛选、视频裁剪都在自己的机器上完成数据不出内网也能部署到服务器后通过浏览器访问。它的核心工作流是先识别、后剪辑Paraformer-Large 识别 时间戳目前性能最好的开源中文 ASR 模型之一ModelScope 平台下载量超过 1300 万次识别的同时给出每句话的起止时间SeACo-Paraformer 热词定制把专有名词、人名设为热词显著提升这类词的识别准确率CAM 说话人分离自动给每句话标注说话人 IDspk0、spk1……可以直接按人提取多段自由裁剪 双份 SRT一次可选多个片段自动返回整段视频字幕和目标段落字幕中英文音频均支持和纯手工比差异很直观一段 2 小时的视频手动记录时间点、裁剪、对齐字幕往往要 3-4 小时用 FunClip 大约 15-20 分钟全程不需要专业剪辑软件一个 Python 环境加浏览器就够说话人区分、字幕同步这些最耗时的环节全部自动化。快速上手从克隆代码到第一次识别第一步装环境。克隆仓库并安装依赖只需两行命令git clone https://gitcode.com/GitHub_Trending/fu/FunClip cd FunClip pip install -r requirements.txt首次启动会自动下载语音识别模型约 2GB建议在网络较好的环境下进行。第二步启动服务。执行下面命令然后打开浏览器访问localhost:7860python funclip/launch.py要处理英文视频就加-l en想换端口用-p指定。第三步跑通第一次剪辑。上传 MP4、AVI、MOV 等常见格式的文件 → 点击识别(ASR) → 从识别结果里复制需要的句子到待裁剪文本输入框 → 点击裁剪。界面右侧会立刻出现目标视频片段和对应字幕。实战演示两个高频场景场景一2小时会议录像出纪要。上传录像前先在 Hotwords 里填上公司名、产品名、项目代号空格分隔目前支持中文热词让识别结果更靠谱。跑完识别后不必通读全部文本直接定位到讨论决策和分工的句子复制进待裁剪文本点击裁剪得到的就是只含关键结论的短片附带该段 SRT丢进纪要文档就是现成的素材引用。场景二90分钟网课按知识点切片。识别完成后把文字按章节拆成几组每组对应一个知识点多段文本用分隔方式填入待裁剪框即可一次选出多个片段。每段各自导出成独立视频和字幕文件学生想看哪部分就点哪部分不用反复拖 90 分钟的时间轴。进阶能力大模型剪辑、按人提取与命令行LLM 智能剪辑。这是 v2.0.0 引入的能力识别完成后在界面里选一个大模型qwen 系列、GPT 系列等并填入 apikey点击LLM 推理——工具会自动把两套 Prompt 和视频 SRT 组合起来送给模型拿到带时间戳的候选段落后再点AI 剪辑完成裁剪。举个例子手头有一段 1 小时的产品发布回放在 Prompt 里写挑出介绍定价方案和上线计划的连续片段模型返回按时间对齐的段落列表一键即可剪出省去人工通读。模型集成的实现都在 funclip/llm/ 目录想换模型或改默认 Prompt 可以从这里入手。按说话人提取。多人访谈、圆桌讨论这类素材识别时勾选识别区分说话人(ASRSD)每句话都会带上 spk0、spk1 等标签。之后在待裁剪说话人里填spk0就只保留第一位发言者填spk0#spk2可以同时提取两位非常适合从圆桌视频里拆出单人独白。命令行调用。需要批量或自动化时funclip/videoclipper.py 提供两阶段命令--stage 1做识别并把 SRT 写入输出目录--stage 2用--dest_text或--dest_spk指定裁剪目标可以嵌进任何脚本流程。FunClip LLM智能剪辑指南展示Prompt配置与LLM推理结果常见问题三个高频卡点专有名词识别总出错。现象人名、产品名被听写成别的词原因通用词表对低频词覆盖有限解法在 Hotwords 输入框填入这些词空格分隔仅支持中文识别时会优先匹配。多人视频分不清谁在说。现象按人剪辑时结果混杂原因识别时没开启说话人分离解法勾选 ASRSD 重新识别系统用 CAM 模型标注说话人 ID再按spk0、spk0#spk2提取。字幕观感不佳。现象字号偏小或与画面糊在一起原因沿用了默认参数解法裁剪前调整字幕字体大小并更换字幕颜色白、黑、绿、红可选界面会同步预览效果。版本演进与后续规划v1.1.0支持配置输出目录保存识别中间结果和裁剪文件UI 升级视频与音频剪辑合并到同一页面修复 FunASR 接口升级引入的严重剪辑错误支持为每段配置不同的起止时间偏移v2.0.0接入大语言模型智能剪辑集成 qwen 系列、GPT 系列并提供默认 Prompt支持英文音频识别-l en新增 Fun-ASR-Nano 和 SenseVoice 模型可选v2.1.0首个带版本号的 GitHub Release提供 SHA256 校验的源码归档作为稳定的回退节点正在进行反向时间段选择、静音段落移除后续规划更多语言支持日语、韩语等、云端部署方案、更丰富的字幕样式模板2025 年还计划探索实时语音识别剪辑、结合视觉信息的多模态分析以及企业级部署接下来做什么与其收藏不如跑一遍——FunClip 的价值在一次真实素材的处理里才能体会到。建议按这个顺序推进克隆仓库、装好依赖拿一段 5 分钟以内的会议录像走完整流程熟悉三种裁剪入口分别用文本片段、说话人 ID、LLM 推理各剪一次同一段素材对比哪种方式最贴合你的工作想定制场景时翻一翻 funclip/llm/ 的模型接入和 funclip/utils/ 的工具函数把自己的 Prompt 调出效果项目完全免费开源使用中遇到问题可以在仓库提交 Issue欢迎提交 PR 改进功能、文档或多语言翻译也欢迎分享你调出来的 Prompt 写法。【免费下载链接】FunClipFunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.项目地址: https://gitcode.com/GitHub_Trending/fu/FunClip创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考