视频内容分析工具 video-analyzer:如何把 10 小时的人工工作压缩到 3 分钟 视频内容分析工具 video-analyzer如何把 10 小时的人工工作压缩到 3 分钟【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer上周你错过了一场产品评审会同事发来 42 分钟录像附言重点看 15 到 20 分钟。你快进、回放、再快进四十分钟后只能承认视频看了重点没抓到。这种看完等于没看的时刻正是视频内容分析工具 video-analyzer 想解决的。它把视频关键帧提取、视频转文字、AI 视频内容摘要合并进一条命令几分钟后交给你一份结构化的 JSON 报告逐帧描述、时间戳转录、整段总结一次给全。从下载到第一份分析结果只需 3 步先别被分析视频四个字吓到实际安装比想象中轻。第一步克隆并安装。要求 Python 3.11 以上和 FFmpeg然后git clone https://gitcode.com/gh_mirrors/vi/video-analyzer cd video-analyzer python3 -m venv .venv source .venv/bin/activate pip install .第二步准备本地模型。默认走 Ollama拉取视觉模型并启动服务ollama pull llama3.2-vision ollama serve第三步跑第一条分析命令video-analyzer demo.mp4命令结束后output/analysis.json就是你要的东西。默认配置下工具用 OpenCV 按画面差异挑关键帧、用 Whispermedium 模型把音频转成文字、再用 llama3.2-vision 逐帧描述并整合成整段视频总结。一张流程图看懂它内部怎么协作流程分四段Transcribe 把音频转成带时间戳的文字Frame Selection 按每帧差异选出关键帧Describe Frames 把当前帧 前几帧的描述一起喂给 LLM 服务器保证描述有时间上的连贯性最后 Describe Video 汇总所有帧描述和转录文本生成整段视频的总结全部写入analysis.json。注意 LLM 被调用了两次一次回答这一帧发生了什么一次回答整段视频在讲什么。人工看片 vs 自动分析差距到底在哪对比项人工处理video-analyzer40 分钟录像提炼要点40 分钟起步容易漏约 3–5 分钟出报告关键帧选取凭手感截图无标准OpenCV 按画面差异自动采样音频转文字边听边记或另找工具Whisper 多语种转录 时间戳逐帧上下文前后画面靠记忆衔接每帧描述都带上前面帧的上下文输出形态笔记散落各文档结构化 JSON可被程序直接读取这张表的落点不只是快而是可复用JSON 报告既能给人读也能直接接进你的内容库、标签系统或批量处理流程。拆开 output/analysis.json四个模块各管什么打开项目自带的docs/sample_analysis.json能看到四层结构metadata记录本次用了哪个客户端ollama、哪个视觉模型llama3.2-vision、哪个 Whisper 模型medium、每分钟取多少帧、转写是否成功参数全部留痕方便复现。transcript完整的视频转文字结果按 segment 分块每块带 start/end 时间戳甚至每个单词都有置信度评分。某段听不清的内容你可以直接看到它的可靠程度。frame_analyses每个关键帧一段描述包含场景、动作、新出现的信息、与前帧的连续性以及下一帧值得注意什么。这就是关键帧提取的价值——不是随机截图而是按叙事脉络抽出来的画面。video_description综合所有帧描述和转录后的整段总结开头往往是这段视频讲的是……接着按时间线铺开事件。想跳过某一步时用--start-stage指定从第几阶段续跑例如帧已提过就从阶段 2 直接开始分析画面。新手最容易问的 5 个问题Q1本地和云端模式怎么选本地用 Ollama全离线、不需要 API key但建议 16GB 以上内存32GB 更稳GPU 至少 12GB 显存。云端走 OpenAI 兼容接口如 OpenRouter对机器配置没要求适合快速出结果OpenRouter 上meta-llama/llama-3.2-11b-vision-instruct:free还能免费跑。Q2只想转文字不想分析画面呢用--whisper-model large提高转写质量配合--start-stage跳过画面分析即可。Q3视频太长、帧太多怎么办三个旋钮配置文件里frames.per_minute控制每分钟取帧数、frames.max_count封顶总帧数命令行--max-frames 30会在整段视频中均匀采样而不是只取前 30 帧只想分析前 60 秒就加--duration 60。Q4背景音很吵转录出来一堆乱码Whisper 转录自带质量检测低于audio.quality_threshold默认 0.2的段落会被判为不可靠并跳过也可以用--language en强制指定语言避免自动检测出错。Q5想换视觉模型怎么操作本地用--model换 Ollama 里的其他视觉模型云端把--model换成gpt-4o等 OpenAI 兼容模型再配--api-key和--api-url即可。三步行动清单今晚就能跑通准备素材✅ 找一段 3 分钟以内的短视频太长的先剪一剪方便对照结果。搭环境✅ 装好 Python 3.11 和 FFmpeg拉取 llama3.2-vision 后运行video-analyzer your.mp4。读报告调参✅ 打开output/analysis.json对照上面的四层结构逐段看帧数太多或转写不准就回 FAQ 挑对应参数再跑一遍。跑通一次之后你会发现真正值钱的不是省了 40 分钟而是你从此有了一个把任意视频批量变成结构化文本的入口。会议回放、课程回放、素材库整理都只是换一条命令的事。【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考