COCO预训练模型

  1. 命名与定位
    Common Objects in Context(COCO)是微软研究院 2014 年开源的 multi-task 视觉基准,覆盖目标检测、实例分割、全景分割、关键点检测与图像描述五项任务。其设计目标是“对象级上下文理解”,强调复杂场景下的精细标注与长尾分布。

  2. 数据规模与标注粒度
     • 图像量:123 k 张训练 + 40 k 验证 + 20 k 测试(2017 split)。
     • 类别:80 thing 类(人、车、动物等)+ 91 stuff 类(可扩展,用于全景分割)。
     • 实例框:1.5 M 个轴对齐 bbox,全部人工绘制,IoU>90 % 通过二次质检。
     • 分割掩膜:instance mask 采用 uncompressed RLE,平均顶点数 ≈ 200,支持像素级 IOU 评估。
     • 关键点:17 点骨架,标注人数 > 250 k,遮挡点统一赋 vis=1。
     • 平均图像分辨率:640×480;最小对象 16×16 像素,保证下游小目标训练价值。
     • 元数据:每张图附带 5 句人工英文描述,用于视觉-语言预训练。

  3. 标注管线与质量控管
     a. 分段式标注:先画 bbox → 生成超像素 → 人工修正 mask → 交叉验证 → 质检。
     b. 质检指标:mask 精度 < 1 pixel 误差;bbox 一致性 IoU>0.95;关键点半自动地真值对比。
     c. 版本冻结:2017 版后不再扩充,保证 benchmark 一致性;新增数据以“COCO-Stuff”、“LVIS”外挂形式发布。

  4. 评估协议(官方 metric)
     • 检测:mAP@0.50:0.95(primary)、mAP@0.50(PASCAL 兼容)、mAP@small/medium/large。
     • 分割:mask mAP(同检测指标),RLE 直接参与计算。
     • 关键点:OKS-based mAP,σ 按人体部位动态加权。
     • 全景分割:PQ = SQ × RQ,统

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值