如何用InternVideo快速跑通第一个视频理解Demo:环境配置与Quick Start完整教程 如何用InternVideo快速跑通第一个视频理解Demo环境配置与Quick Start完整教程【免费下载链接】InternVideo[ECCV2024] Video Foundation Models Data for Multimodal Understanding项目地址: https://gitcode.com/OpenGVLab/InternVideoInternVideo是上海AI实验室开源的视频基础模型系列ECCV 2024让模型看懂视频并理解内容。本教程带你从零完成InternVideo 环境配置在 5 步内跑通你的第一个视频理解 Demo让模型观看一段视频并判断它和哪句文字描述最匹配。一、InternVideo是什么新手能跑什么任务InternVideo 仓库涵盖 InternVideo 1 到 InternVideo 3 的完整系列以及配套的大规模视频文本数据集InternVid。对新手来说最快的上手路径是运行 Data/InternVid 内置的ViCLIP 视频文本检索 Demo读取示例视频 example1.mp4一只狗在雪地玩耍的场景模型抽取视频特征与 10 句候选描述逐一比对输出置信度排名正确答案A playful dog and its owner wrestle in the snowy yard…以 0.8192 的置信度排第一。这个 Demo 对 GPU 没有硬性要求CPU 也能跑只是稍慢非常适合第一次验证环境。二、环境配置三步搭好可运行环境第 1 步确认硬件与软件要求项目最低要求推荐配置GPU无CPU 可运行任意一张 NVIDIA GPUCUDA—11.8Python3.83.9PyTorch1.132.x第 2 步克隆仓库并安装依赖git clone https://gitcode.com/OpenGVLab/InternVideo cd InternVideo/Data/InternVid # 创建独立虚拟环境推荐 python -m venv venv source venv/bin/activate pip install torch torchvision opencv-python numpy einopsViCLIP 推理只需上面这几个库无需编译 C 扩展安装一两分钟即可完成。第 3 步下载预训练权重下载ViCLIP-L-14InternVid-10M-FLT 训练权重文件ViCLIP-L_InternVid-FLT-10M.pth获取方式见 README.md 的 Data Model Zoo 表格放入 vicclip 目录Data/InternVid/vicclip/ └── ViCLIP-L_InternVid-FLT-10M.pth # 你下载的权重三、Quick Start跑通第一个视频理解 Demo你可以直接打开 demo.ipynb 逐格运行其核心 API 定义在 vicclip.py 中三步即可完成推理import cv2 from vicclip import get_viclip, retrieve_text, _frame_from_video # 1. 读取视频帧 frames [x for x in _frame_from_video(cv2.VideoCapture(example1.mp4))] # 2. 加载模型 model get_viclip(l, vicclip/ViCLIP-L_InternVid-FLT-10M.pth) # 3. 文本检索传入候选描述列表取 top-5 texts, probs retrieve_text(frames, text_candidates, modelsmodel, topk5)预期输出正确答案以 81.92% 置信度排第一text: A playful dog and its owner wrestle in the snowy yard... ~ prob: 0.8192 text: A man in a gray sweater plays fetch with his dog in the snowy yard... ~ prob: 0.1084 至此你的第一个视频理解 Demo 就跑通了把example1.mp4换成自己的视频、替换候选描述列表就能做视频检索、内容核验等真实场景。四、进阶更强的模型与更多任务跑通 Demo 后建议按下面的路线继续探索你想做的事对应模块视频文本对比学习预训练ViCLIP动作识别微调VideoMAE、UniFormerV2视频文本检索微调Video-Text-Retrieval更强的多模态模型 InternVideo2DEMO_USAGE_GUIDE.md其中InternVideo2-Stage2Demo 的输出更丰富但依赖稍多Flash-Attention、DeepSpeed 等环境基线为 Python 3.8 / Torch 2.4.1 / CUDA 11.8权重配置说明见 DEMO_USAGE_GUIDE.md模型配置文件在 internvideo2_stage2_config.py。五、常见问题速查报ModuleNotFoundError: vicclip请在Data/InternVid目录下运行脚本或把该目录加入PYTHONPATH找不到权重文件demo 中的pretrained路径指向vicclip/子目录请确认文件名和位置正确CPU 上跑得慢Demo 默认抽取 8 帧视频特征GPU 上数秒即可完成CPU 属正常现象显存不足可改用更小的ViCLIP-B-16权重体积约为 L 版的 1/5。六、总结InternVideo是面向多模态理解的开源视频基础模型系列内置 ViCLIP Demo 是新手最快的视频理解入口环境配置只需 Python torch OpenCV einops 一个权重文件无需编译跑通后可依次探索 InternVid 数据集、动作识别微调与 InternVideo2/3 的更强能力。【免费下载链接】InternVideo[ECCV2024] Video Foundation Models Data for Multimodal Understanding项目地址: https://gitcode.com/OpenGVLab/InternVideo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考