拡散モデル

Diffusion Model

拡散モデルとは

拡散モデル(Diffusion Model)とは、データに徐々にノイズを加えて破壊する「拡散過程」と、ノイズからデータを段階的に復元する「逆拡散過程」を学習することで、高品質なデータを生成する深層生成モデルです。画像生成AIの分野で革命的な成果を上げ、Stable Diffusion、DALL-E、Midjourneyなどの基盤技術となっています。

表:拡散モデルの要点まとめ
ひとことで言うと砂嵐のようなノイズを少しずつ取り除いて、画像を作り出す仕組み。
どこで使う画像生成、動画生成、音声・音楽生成。今の画像生成AIの主流方式。
注意点生成に時間がかかる。ステップ数を減らすと速いが品質が落ちやすい。

拡散モデルの仕組み

拡散モデルは2つのプロセスで構成されます。順方向の拡散過程では、元の画像にガウスノイズを段階的に加え、最終的に純粋なノイズに変換します。逆方向の復元過程では、ニューラルネットワーク(通常はU-Net)がノイズからの復元方法を学習します。推論時には、ランダムノイズから出発して段階的にノイズを除去していくことで、新しい画像を生成します。

図:拡散モデルが画像を生み出す流れ
1ランダムな砂嵐意味のないノイズ画像
▶
2ノイズを予測プロンプトを手がかりに
▶
3少しだけ引くノイズを一段階除去
▶
4画像が現れるだんだん形になる
▶
5完成画像指示に沿った絵が出力
↺ 2〜3を20〜50回くり返して、砂嵐が絵に変わっていく

※ 学習時は逆に「きれいな画像へノイズを足す」練習をして、ノイズの見分け方を覚えます。

拡散モデルの発展

DDPM(Denoising Diffusion Probabilistic Models)から始まり、生成速度を改善するDDIM、潜在空間で拡散を行うLatent Diffusion(Stable Diffusionの基盤)、テキスト条件付き生成を可能にするCLIP誘導やClassifier-Free Guidanceなど、多くの改良が加えられてきました。現在では画像だけでなく、音声、動画、3Dモデル、分子構造など、幅広い分野で応用されています。GANと比較して訓練が安定し、より多様で高品質な出力を生成できることが大きな利点です。