U-Netとは
U-Net(ユーネット)は、2015年にRonnebergerらが医用画像セグメンテーションのために提案したCNNアーキテクチャです。名前の由来はネットワーク構造がU字型をしていることに由来します。エンコーダー(収縮パス)とデコーダー(拡張パス)をスキップ接続で結ぶ構造が特徴であり、少ないトレーニングデータでも高精度なセグメンテーションを実現します。
| ひとことで言うと | 縮めてから広げ、途中の情報を橋渡しする「U字型」の画像分割ネットワーク。 |
|---|---|
| どこで使う | 医用画像の病変抽出、衛星画像の土地分類、画像生成AIのノイズ除去部分。 |
| 注意点 | ピクセル単位の正解ラベル(アノテーション)を用意する手間が大きい。 |
U字型アーキテクチャ
U-Netの左側(エンコーダー)は畳み込み層とプーリング層で構成され、入力画像から特徴を抽出しながら解像度を段階的に下げていきます。右側(デコーダー)はアップサンプリング(転置畳み込み)で解像度を元に戻し、ピクセルレベルの予測を行います。エンコーダーとデコーダーの対応する層をスキップ接続で結ぶことで、低レベルの空間情報を保持します。
1縮小しながら抽出何が写っているか把握
▶
2最小サイズへ意味の圧縮
▶
3拡大しながら復元元の解像度に戻す
▶
4途中の情報を橋渡し細部の位置を取り戻す
▶
5領域マップピクセル単位で分類
スキップ接続の重要性
U-Netのスキップ接続は、エンコーダーで失われる空間的な詳細情報をデコーダーに直接伝達する役割を果たします。これにより、物体の境界や微細な構造を正確に復元することが可能になります。この設計はセグメンテーションの精度を大幅に向上させ、後続の多くのアーキテクチャに影響を与えました。
U-Netの応用と発展
U-Netは医用画像に限らず、衛星画像解析、自動運転のセマンティックセグメンテーション、そして近年では拡散モデル(Diffusion Model)の中核アーキテクチャとしても使用されています。Stable Diffusionなどの画像生成モデルではU-Net構造がノイズ除去ネットワークとして採用されており、画像生成AIの基盤技術となっています。