GPT(アーキテクチャ)

GPT Architecture

GPTとは

GPT(Generative Pre-trained Transformer)は、OpenAIが開発したTransformerのデコーダーをベースとした自己回帰型の言語モデルアーキテクチャです。2018年のGPT-1から始まり、GPT-2、GPT-3、GPT-4と進化を重ね、テキスト生成能力を劇的に向上させてきました。ChatGPTの基盤技術としても知られ、大規模言語モデル(LLM)の代名詞的存在です。

表:GPT(アーキテクチャ)の要点まとめ
ひとことで言うと前から順に次の語を予測していく、Transformerのデコーダー型モデル。
どこで使う文章生成、対話AI、要約、コード生成。ChatGPTの土台。
注意点後ろの文脈は見られない(前だけ)。事実の正確さはモデル側で保証されない。

GPTのアーキテクチャ

GPTはTransformerのデコーダー部分のみを使用し、マスク付き自己注意機構(Masked Self-Attention)により左から右への単方向の文脈で次のトークンを予測します。各位置のトークンは自分自身と左側のトークンのみを参照でき、右側の未来のトークンは参照できません。この自己回帰的な設計により、自然なテキスト生成が可能になっています。

図:GPTが文章を作るしくみ
1ここまでの文プロンプト+生成済み
▶
2前だけ参照未来は見ないよう遮断
▶
3次の語を予測確率の高い候補を出す
▶
41語を追加文が1語伸びる
↺ 1〜4をくり返して文章が伸びていく

スケーリングの成功

GPTシリーズはモデルサイズとデータ量のスケールアップにより性能が飛躍的に向上することを実証しました。GPT-1は1.2億パラメータ、GPT-2は15億パラメータ、GPT-3は1750億パラメータと規模を拡大し、GPT-3では少数ショット学習(Few-shot Learning)の能力が創発的に出現しました。このスケーリング則の発見はAI研究の方向性に大きな影響を与えました。

GPTの影響と現在の位置づけ

GPTのアーキテクチャは、LLaMA、Mistral、Gemmaなど多くのオープンソースLLMにも採用されており、現代の大規模言語モデルの標準的な設計となっています。デコーダーのみの構造は、テキスト生成だけでなく、プログラミング(Codex/GitHub Copilot)、マルチモーダル理解(GPT-4V)、推論(o1シリーズ)など、幅広いタスクの基盤として発展を続けています。