Mask R-CNN

Mask Region-based CNN

Mask R-CNNとは

Mask R-CNN(Mask Region-based Convolutional Neural Network)とは、2017年にKaiming Heらによって提案されたインスタンスセグメンテーションモデルです。Faster R-CNNにマスク予測ブランチを追加したシンプルかつ強力なアーキテクチャで、物体の検出、分類、ピクセルレベルのセグメンテーションを同時に行います。

表:Mask R-CNNの要点まとめ
ひとことで言うとFaster R-CNNにマスク出力の枝を足して、輪郭まで取れるようにしたモデル。
どこで使う個体ごとの輪郭が必要な検査、細胞計測、姿勢推定の前処理。
注意点処理が重い。リアルタイム用途では軽量な代替を検討する。

Mask R-CNNのアーキテクチャ

Mask R-CNNはFaster R-CNNの構造をベースにしています。ResNetとFPNをバックボーンとして特徴を抽出し、RPNで候補領域を生成します。各候補領域に対してROI Align(ROI Poolingの改良版)で特徴を抽出し、3つの並列ブランチで処理します。分類ブランチは物体のクラスを予測し、ボックス回帰ブランチは位置を精密化し、マスクブランチは各クラスに対するピクセルレベルのセグメンテーションマスクを生成します。マスクブランチは分類とは独立に動作するため、マスクの品質が向上しています。

図:Mask R-CNNの構成
1候補領域を提案RPNが枠を出す
▶
2ROI Alignで整形位置ずれを防ぐ
▶
3分類と枠の調整Faster R-CNNと同じ
▶
4マスクを出力枝を1本追加
▶
5輪郭付きの検出個体ごとに切り出せる

Mask R-CNNの影響と応用

Mask R-CNNはインスタンスセグメンテーションの事実上の標準モデルとして広く利用されています。姿勢推定にも拡張可能であり、キーポイント検出ブランチを追加したKeypoint R-CNNも提案されています。自動運転、ロボティクス、医療画像分析、衛星画像解析など、精密な物体認識が求められる多くの分野で活用されています。