COCOとは
COCO(Common Objects in Context)とは、物体検出、セグメンテーション、キャプショニングなどのコンピュータビジョンタスクのための大規模ベンチマークデータセットです。Microsoftにより2014年に公開され、日常的な場面の画像に対して詳細なアノテーション(注釈)が付与されています。
| ひとことで言うと | 物体検出・領域分割・キャプション生成の標準となる大規模画像データセット。 |
|---|---|
| どこで使う | 画像認識モデルの性能比較、学習済みモデルの土台。 |
| 注意点 | 日常物体が中心。工業部品や医用画像には転用しにくい。 |
COCOの構成
COCOデータセットは33万枚以上の画像と250万以上のラベル付きインスタンスで構成されています。80のオブジェクトカテゴリの物体検出、インスタンスセグメンテーション、パノプティックセグメンテーション、キーポイント検出、画像キャプショニングなど、多様なタスクに対応しています。
133万枚の画像80カテゴリの日常物体
▶
2詳細な注釈付き枠・輪郭・説明文
▶
3モデルを学習事前学習の土台
▶
4mAPで評価共通基準で比較
COCOの評価指標
物体検出タスクではmAP(mean Average Precision)が主要な評価指標です。IoU(Intersection over Union)の閾値を変化させた平均APや、小・中・大オブジェクト別のAPなど、詳細な評価が可能です。セグメンテーションタスクではマスクのmAPが使われます。
COCOの影響
COCOはコンピュータビジョン研究の標準ベンチマークとして不動の地位を確立しています。YOLO、Faster R-CNN、Mask R-CNN、DETRなど、物体検出の主要なアーキテクチャはすべてCOCOでの性能が報告されています。年次のCOCOチャレンジは最先端技術の発展を促進しています。