Transformer(NLP)

Transformer

Transformerとは

Transformer(トランスフォーマー)とは、2017年にGoogleの「Attention Is All You Need」論文で提案された深層学習アーキテクチャです。RNNやCNNを使わず、Self-Attention機構のみでシーケンスの処理を行う画期的な設計で、現代のNLPとAIの基盤技術となっています。

表:Transformer(NLP)の要点まとめ
ひとことで言うと自己注意だけで文章を処理する、現在のNLPの土台となるアーキテクチャ。
何がうれしいか並列計算ができて学習が速く、離れた語どうしの関係も直接つかめる。
注意点長い入力ほど計算量が急増。学習には大量のデータと計算資源が必要。

Transformerの構造

Transformerはエンコーダーとデコーダーの2つの部分で構成されます。各部分はMulti-Head Self-Attention層とFeed-Forward層の積み重ねで構築されています。位置符号(Positional Encoding)により系列中の位置情報を付与し、残差接続とLayer Normalizationで学習を安定化させています。

図:Transformerの処理の流れ
1単語をベクトル化意味を数値に
▶
2位置情報を追加語順を伝える
▶
3自己注意語どうしの関係を計算
▶
4全結合で変換各語を個別に加工
▶
5層を重ねる深い理解を積み上げる

RNNとの比較

RNNは系列を逐次的に処理するため並列化が困難で、長距離の依存関係の学習にも課題がありました。Transformerは全位置間のAttentionを一度に計算できるため並列化が容易で、長距離の依存関係も直接的に捉えられます。この利点により大規模データでの効率的な学習が可能になりました。

Transformerの影響

TransformerはBERT(エンコーダーのみ)、GPT(デコーダーのみ)、T5(エンコーダー・デコーダー)など、現代の主要なNLPモデルの基盤となっています。さらに画像認識(Vision Transformer)や音声処理にも応用され、AI全般に大きな影響を与えています。