Mask R-CNNとは
Mask R-CNN(Mask Region-based Convolutional Neural Network)とは、2017年にKaiming Heらによって提案されたインスタンスセグメンテーションモデルです。Faster R-CNNにマスク予測ブランチを追加したシンプルかつ強力なアーキテクチャで、物体の検出、分類、ピクセルレベルのセグメンテーションを同時に行います。
| ひとことで言うと | Faster R-CNNにマスク出力の枝を足して、輪郭まで取れるようにしたモデル。 |
|---|---|
| どこで使う | 個体ごとの輪郭が必要な検査、細胞計測、姿勢推定の前処理。 |
| 注意点 | 処理が重い。リアルタイム用途では軽量な代替を検討する。 |
Mask R-CNNのアーキテクチャ
Mask R-CNNはFaster R-CNNの構造をベースにしています。ResNetとFPNをバックボーンとして特徴を抽出し、RPNで候補領域を生成します。各候補領域に対してROI Align(ROI Poolingの改良版)で特徴を抽出し、3つの並列ブランチで処理します。分類ブランチは物体のクラスを予測し、ボックス回帰ブランチは位置を精密化し、マスクブランチは各クラスに対するピクセルレベルのセグメンテーションマスクを生成します。マスクブランチは分類とは独立に動作するため、マスクの品質が向上しています。
1候補領域を提案RPNが枠を出す
▶
2ROI Alignで整形位置ずれを防ぐ
▶
3分類と枠の調整Faster R-CNNと同じ
▶
4マスクを出力枝を1本追加
▶
5輪郭付きの検出個体ごとに切り出せる
Mask R-CNNの影響と応用
Mask R-CNNはインスタンスセグメンテーションの事実上の標準モデルとして広く利用されています。姿勢推定にも拡張可能であり、キーポイント検出ブランチを追加したKeypoint R-CNNも提案されています。自動運転、ロボティクス、医療画像分析、衛星画像解析など、精密な物体認識が求められる多くの分野で活用されています。