-
命名与定位
Common Objects in Context(COCO)是微软研究院 2014 年开源的 multi-task 视觉基准,覆盖目标检测、实例分割、全景分割、关键点检测与图像描述五项任务。其设计目标是“对象级上下文理解”,强调复杂场景下的精细标注与长尾分布。 -
数据规模与标注粒度
• 图像量:123 k 张训练 + 40 k 验证 + 20 k 测试(2017 split)。
• 类别:80 thing 类(人、车、动物等)+ 91 stuff 类(可扩展,用于全景分割)。
• 实例框:1.5 M 个轴对齐 bbox,全部人工绘制,IoU>90 % 通过二次质检。
• 分割掩膜:instance mask 采用 uncompressed RLE,平均顶点数 ≈ 200,支持像素级 IOU 评估。
• 关键点:17 点骨架,标注人数 > 250 k,遮挡点统一赋 vis=1。
• 平均图像分辨率:640×480;最小对象 16×16 像素,保证下游小目标训练价值。
• 元数据:每张图附带 5 句人工英文描述,用于视觉-语言预训练。 -
标注管线与质量控管
a. 分段式标注:先画 bbox → 生成超像素 → 人工修正 mask → 交叉验证 → 质检。
b. 质检指标:mask 精度 < 1 pixel 误差;bbox 一致性 IoU>0.95;关键点半自动地真值对比。
c. 版本冻结:2017 版后不再扩充,保证 benchmark 一致性;新增数据以“COCO-Stuff”、“LVIS”外挂形式发布。 -
评估协议(官方 metric)
• 检测:mAP@0.50:0.95(primary)、mAP@0.50(PASCAL 兼容)、mAP@small/medium/large。
• 分割:mask mAP(同检测指标),RLE 直接参与计算。
• 关键点:OKS-based mAP,σ 按人体部位动态加权。
• 全景分割:PQ = SQ × RQ,统
COCO预训练模型
最新推荐文章于 2026-07-20 10:00:00 发布


617

被折叠的 条评论
为什么被折叠?



