一条命令搞定视频智能分析:video-analyzer 让 AI 全自动吃透画面与语音

一条命令搞定视频智能分析:video-analyzer 让 AI 全自动吃透画面与语音 一条命令搞定视频智能分析video-analyzer 让 AI 全自动吃透画面与语音【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer最会「看」视频的人从来不自己看视频。当同事对着一段一小时的回放逐秒拖动进度条、边看边记笔记时另一个人已经用 video-analyzer——这款集计算机视觉、自动语音识别与大语言模型于一体的视频智能分析工具——泡杯咖啡的功夫拿到了一份带时间戳的完整分析报告。而他从头到尾只敲了一条命令。它是什么一位自带「翻译官」的剪辑助理一句话说清定位video-analyzer 把「看画面」「听声音」「组织语言」三件事全部交给 AI你输入一条视频它输出一份结构化的analysis.json报告。打个比方它像一位自带翻译官的剪辑助理画面被翻译成文字描述语音被转写为逐句文本最后汇合成一段「这段视频到底讲了什么」的口述总结。你只管把素材丢过去剩下的事它全包。看这张流程图就懂了它的灵魂视频被拆成「语音」与「画面」两条线索语音走 Whisper 转写画面走 OpenCV 关键帧挑选两条线索汇合后由视觉大模型逐帧解读、再统一重建最终写入报告。全程无人干预。5分钟跑起来先拿到正反馈别急着翻文档三步就能让第一条视频出报告git clone https://gitcode.com/gh_mirrors/vi/video-analyzer cd video-analyzer pip install .ollama pull llama3.2-vision ollama servevideo-analyzer demo.mp4等output/analysis.json出现在目录里你看到语音转录、逐帧解析、整体描述三大块整整齐齐才算真正摸到这款工具的脾气。真正让它与众不同的3个瞬间瞬间一一小时视频只挑「有料的帧」。画面里大部分时间可能是静止的 PPT逐帧分析纯属浪费算力。video-analyzer 用 OpenCV 计算相邻帧的画面差异自动挑出变化最大的关键帧再按视频时长自适应采样几十帧就铺满整条剧情线。想控制成本--max-frames 50就能让候选帧均匀分布全片。瞬间二声音糊成一团它宁可「降权」也不硬编。会议室收音差、语速快转写出来的文字往往错误百出。Whisper 转写自带质量自检语音置信度过低时这段内容在报告中的权重会被主动调低——从源头保证结论可信而不是把错字连篇的文本硬塞给大模型。瞬间三带着「前情提要」看每一帧。解读每一帧时模型都会携带之前所有帧的描述作为上下文时间线上的叙事不会断片最后综合全部帧描述与语音转录生成从场景、动作到事件脉络、核心观点的多层级解读。想追问细节加一句--prompt 视频中有哪些关键决策即可。想再进一步这样调教它默认配置够用但真正好用的工具都经得起调。配置遵循「命令行 用户配置文件 默认配置」的级联优先级最常动这几项场景默认进阶转录精度medium--whisper-model large转录速度CPU--device cudaGPU 加速分析焦点通用描述--prompt 关注人物互动细节断点续跑从头开始--start-stage 2跳过已完成阶段一条可直接照抄的组合video-analyzer 发布会回放.mp4 --whisper-model large --device cuda --prompt 产品发布了哪些新功能采样密度、关键帧阈值等参数都沉淀在 video_analyzer/config/default_config.json完整参数表见 docs/USAGES.md输出样例可参考 docs/sample_analysis.json。谁在用、用在哪纪录片团队的素材抢救。面对十几年前的老录像带编目人员曾要逐盘快进、手写时间轴。现在把数字化后的视频批量交给 video-analyzer每盘几分钟就得到「哪分钟出现什么画面、说了什么话」的索引翻箱底找素材的效率翻了几倍。电商直播运营的复盘。每场直播结束主播说了哪些话术、镜头切到哪个产品、观众最关心哪个环节——回放分析报告就是现成的复盘底稿话术迭代不再靠记忆和运气。你可能关心的3个问题本地显存不够怎么办切到 OpenRouter 等 OpenAI 兼容接口即可一条--client openai_api --api-url ...就用云端模型换处理速度。视频会被传出去吗默认走 Ollama 本地推理数据不出本机、无需任何 API Key涉密素材也能放心分析。分析到一半断了要重来不用。--start-stage 2支持断点续跑直接从帧分析阶段接着干已完成的阶段不浪费。现在去找一段你早就想「看完」却一直没时间的视频敲下那行命令然后去泡杯咖啡——等你回来AI 已经把故事讲完了。【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考