CVAT 计算机视觉标注完整指南:从一键部署到高效标注
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
给一千帧视频数据画框,纯人工至少要耗掉一整天,还难免漏标。更麻烦的是团队场景:标准靠口头传达,结果散落在各人电脑里,最后拼起来的标注集质量参差不齐。CVAT(Computer Vision Annotation Tool)就是为这类问题而生的开源数据标注平台——把上传、标注、质检、导出收进同一套工作流,数据全部留在你自己的服务器上。
它覆盖的标注场景:图片与视频的框选、多边形、骨架等 2D 标注,3D 点云标注,AI 模型预标注,以及多人协作和按多种格式导出。本文按真实标注工作流走一遍。
一条命令部署 CVAT,2 分钟跑起服务
环境要求不苛刻:任意主流 Linux 发行版(Ubuntu 20.04/22.04 均可),Docker 20.10 以上,内存 8GB(16GB 更稳),留 20GB 磁盘。
克隆仓库后启动全套服务:
git clone https://gitcode.com/GitHub_Trending/cvat/cvat cd cvat docker-compose up -d这条命令会把后端 API、前端界面、数据库、缓存、后台任务 worker 一次拉起,首次初始化需要 2~5 分钟。想盯着部署进度,另开终端看日志:
docker-compose logs -f看到Server ready相关输出后,浏览器打开http://localhost:8080。登录前先建一个管理员账号:
docker exec -it cvat_server bash -ic 'python3 manage.py createsuperuser'按提示填用户名、邮箱、密码,第一次标注的入口就有了。
完成第一次标注:建任务、画形状、导出数据集
登录后进入 Tasks 页面新建任务。创建时先定义标签(labels),比如car、person,标签就是后续所有标注的分类骨架,建议先想好粒度再建。
数据上传有四个来源:本机拖拽、已挂载的共享目录、远程地址、云存储。选本机时直接拖图片或压缩包进上传区即可,视频会自动按帧切分。任务建好后进入编辑器:左侧是形状工具栏(矩形、多边形、折线、点、骨架),右侧是对象列表。选中工具后在画面上画框,从右侧列表挑标签,属性字段在选中对象时展开填写。视频任务可以用插值——首尾各标一帧,中间轨迹自动补全,再微调。
全部标完后,在任务或 Job 上执行导出,选格式和类型(COCO、VOC、YOLO 等标注格式,或 COCO 等数据集格式),下载得到的就是能直接喂给训练代码的数据集。格式对应的导入导出逻辑都在 dataset_manager/formats 模块 里,共二十多种格式。
让自动标注模型批量干活,人工只做修正
纯手工标注的最大出路是引入预标注:先让模型跑一遍,人工只修正,效率通常能翻几倍。
在 CVAT 的 Models 页面注册一个模型(检测、分割、姿态估计、目标跟踪都可以),填入模型地址或本地文件。之后在任务上打开 Automatic Annotation 对话框,选择模型,把模型输出类别映射到你的标签,设定置信度阈值,点 Annotate。模型跑出的框直接落在编辑器里,你只需删掉误检、挪正歪框。
两个实用技巧:给视频任务开目标跟踪(tracking),只需在首帧标框,后续帧自动跟随;只关心画面某个区域时,用 Region of interest 限定模型推理范围,省算力。
进阶:3D 点云标注与团队协作
自动驾驶、工业检测这类场景,CVAT 支持 PCD/PCAP 等点云格式的 3D 标注:主视图配合 Top/Side/Front 三个正交小窗同步操作,标一个 cuboid,四个视角同时更新。
团队协作方面,项目按组织划分,成员可以分配不同角色(管理员、标注员、审阅者),任务按 Job 切分后指派给不同的人,再走标注-提交-审阅的流程。还可以开启质量校验:多人重复标注同一 Job 做交叉验证,系统自动算出一致性指标,标得差的自动打回。3D 标注的前端渲染逻辑在 cvat-canvas3d 模块,想改交互可以参考这里。
只讲 3 个高频坑
端口冲突。CVAT 默认占用 8080 和 8090,如果本机已被占用(比如别的 Docker 服务),编辑docker-compose.yml里 traefik 的端口映射,把8080:8080改成8081:8080即可,前端和 API 的地址会跟着变。
服务起不来。最常见原因是内存不足或磁盘被旧镜像占满。停掉重建:
docker-compose down docker-compose up -d启动后仍报错就看docker-compose logs,重点盯数据库和 redis 两个容器是否 ready。
别用浏览器刷新保存状态。编辑器支持快捷键和撤销,但误操作时优先用工具栏的 Undo,刷新页面可能丢失未保存的标注。标注完成后养成先导出再关页的习惯。
下一步清单
- ✅ 部署完成后上传一批真实图片,建第一个任务走完 上传→标注→导出 全流程
- ✅ 注册一个预标注模型(检测或姿态估计),在下一批数据上对比"纯人工 vs 预标注"的实际耗时
- ✅ 邀请一位同事加入,按"标注员+审阅者"两种角色分配权限,跑一次交叉验证,看看一致性指标
想从代码层面继续深入,可以从 官方文档 和 Python SDK 入手,SDK 提供了与 Web 界面相同能力的编程接口,批量操作和自动化流水线都能跑起来。
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考