特徴ピラミッドネットワーク(FPN)

Feature Pyramid Network

特徴ピラミッドネットワーク(FPN)とは

特徴ピラミッドネットワーク(Feature Pyramid Network:FPN)とは、画像中の異なるサイズの物体を効果的に検出するための特徴抽出アーキテクチャです。2017年にTsung-Yi Linらによって提案され、CNNの各層から得られるマルチスケールの特徴マップを効率的に統合します。

表:特徴ピラミッドネットワーク(FPN)の要点まとめ
ひとことで言うと深い層の意味情報を浅い層に戻し、大小さまざまな物体を検出できるようにする構造。
何がうれしいか小さい物体の検出精度が大きく向上する。多くの検出モデルの標準部品。
注意点層が増えるため計算コストとメモリ使用量が上がる。

FPNの構造

FPNはボトムアップパスウェイ、トップダウンパスウェイ、ラテラル接続の3つの要素から構成されます。ボトムアップパスウェイは通常のCNN(ResNetなど)のフォワードパスで、画像から階層的な特徴を抽出します。トップダウンパスウェイは、最上位の意味的に豊かな特徴マップをアップサンプリングして低レベル層に戻します。ラテラル接続は、ボトムアップの特徴マップとトップダウンの特徴マップを1x1畳み込みで結合します。これにより、すべてのスケールで「空間的に詳細」かつ「意味的に豊か」な特徴マップが得られます。

図:FPNの情報の流れ
1下から上へCNNで特徴を抽出
▶
2深い層は意味に強いただし解像度が低い
▶
3上から下へ戻す意味情報を浅い層へ
▶
4横方向で合流解像度と意味を両立
▶
5全スケールで検出小物体にも強い

影響と応用

FPNは物体検出における根本的な課題、すなわち小さな物体の検出精度の低さを大きく改善しました。Faster R-CNN、RetinaNet、Mask R-CNNなど、多くの検出・セグメンテーションモデルのバックボーンとして採用されています。FPNの概念を発展させたPANet、NAS-FPN、BiFPNなどの派生手法も提案されており、マルチスケール特徴融合は現代の物体検出に不可欠な要素となっています。