
CVAT 实战指南3 步完成首次部署与视频、3D 数据标注【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat一万帧车载视频要标 bounding box人工逐帧画框显然不现实但如果只是少量静态图片拉个表格打标签也够用。真正让标注成本失控的是序列数据——视频、点云、多视角——以及多人协作带来的质量不一致。CVAT 就是为这两类场景设计的开源标注平台支持图像、视频和 3D 点云标注内置自动标注、插值、团队协作和质量检查MIT 协议可以完全跑在自己的机器上。3 步启动一个可用的标注环境前置条件只有两样Docker Engine 和 Docker Compose。CVAT 的主要功能在 Chromium 系浏览器Chrome、Edge下体验最好。git clone https://gitcode.com/GitHub_Trending/cvat/cvat cd cvat docker compose up -d然后创建管理员账号并登录docker exec -it cvat_server bash -ic python3 ~/manage.py createsuperuser打开http://localhost:8080登录创建 Task、上传数据、定义标签就可以开始标注。整个流程不依赖云服务数据不出本机这也是很多团队选择自托管而非 SaaS 的原因。日常标注哪些操作最省时间插值与 Tracker。视频标注的核心技巧不是逐帧画而是每隔 N 帧画关键帧让 CVAT 自动补齐中间帧。直线运动的物体用线性插值即可复杂轨迹可以启用内置的 MIL Tracker 做自动跟踪再人工修正。一个 100 帧的片段实际手工帧数可能只有十几帧。画笔与智能工具。对于轮廓不规则的物体逐点多边形效率低。CVAT 的刷选工具Brushing允许用笔刷圈出区域后自动拟合多边形配合吸附边缘snap to contour可以显著减少手工调整。3D 点云。自动驾驶场景下CVAT 提供 Standard 3D 模式主视图加 Top/Side/Front 三个正交投影同步显示立方体框cuboid的尺寸和朝向可以通过可视化控件直接调整而不必手填数值。相关实现位于 cvat-canvas3d/。自动标注。CVAT 通过 Serverless 组件基于 Nuclio挂载预构建模型仓库serverless/目录提供了现成配置覆盖检测YOLO v7、RetinaNet R101、Mask R-CNN、Faster R-CNN分割Segment Anything (SAM)、IOG姿态估计HRNet32 全身关键点跟踪TransT启用方式是在部署时叠加一个 compose 文件docker compose -f docker-compose.yml -f components/serverless/docker-compose.serverless.yml up -d之后在界面上选择模型对选定的帧或 ROI 运行结果作为可编辑的草稿出现——定位是加速首标不是替你标注。多人协作与质量如何把控CVAT 的数据层级是项目Project→ 任务Task→ 作业Job项目是组织单位任务对应一份数据集作业是把任务切分后的可指派单元。标注员只拿到分派给自己的 Job负责人可以看整体进度这一套模型定义在 cvat/apps/engine/models.py。权限方面cvat/apps/iam/ 实现了组织、角色、邀请机制成员可以按组织隔离不同角色对任务的操作范围不同。质量侧有两个常用手段共识Consensus同一任务设置多份副本由多名标注员独立标注再用 cvat/apps/consensus/ 的合并策略如交集合并得到最终结果适合对准确率要求高的数据。质检与统计审核者通过 review 工作流复核 Job项目级的标注统计按标签、按形状类型汇总数量可在 Analytics 页面查看也可以接入 Grafana 仪表盘监控用户活跃度和事件流相关配置在 components/analytics/。接入现有 ML 流程标注的终点是训练数据CVAT 的导出覆盖 20 种行业格式常见如 CVAT XML、COCO JSON、YOLO TXT、Pascal VOC、KITTI、Cityscapes、MOT。格式适配代码集中在 cvat/apps/dataset_manager/formats/每种格式一个模块导入导出走同一套转换层所以CVAT 标注 → 导出 COCO → 训练 → 评估这条链路没有额外胶水代码。自动化方面提供三个入口按粒度从轻到重工具安装适合场景REST API无需安装细粒度控制、事件回调WebhookPython SDKpip install cvat-sdk任务创建、上传、导出脚本化CLIpip install cvat-cli终端里跑常规工作流SDK 的最小用法from cvat_sdk import make_client client make_client(http://localhost:8080) client.tasks.create(namedriving-log, labels[{name: car}])更多示例可以直接看 cvat-sdk/examples/里面有任务导入导出、Webhook 注册、任务分配等完整脚本。什么时候该用 CVAT什么时候不必适合数据集是视频、点云或多视角手动工具Excel、标注小程序已经hold不住团队 2 人以上协作需要分派、权限和质检流程数据不能出内网必须自托管已有训练管道需要稳定的格式导出和 API 自动化不必只有几百张图、且只是分类标签——用更轻的工具或表格更快标注需求是一次性实验且完全无法接受部署 Docker 栈的成本需要纯外包交付标注结果——自托管 CVAT 省的是数据费用不是人力费用部署和维护成本仍在入门材料可参考仓库自带文档 site/content/en/docs/getting_started/overview.md 和快捷键说明 site/content/en/docs/getting_started/shortcuts.md。下一步如果手头正好有一批视频或点云数据先用docker compose up -d把服务拉起来建一个 Task 试 30 分钟插值 Tracker 的工作流确认效率后再决定是否叠加 serverless 自动标注和共识机制。CVAT 的价值不在于功能数量而在于它把序列数据标注和多人质检这两件传统上最贵的事变成了可以自托管、可脚本化的标准流程。【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考