AlphaZeroとは
AlphaZero(アルファゼロ)とは、DeepMindが2017年に発表した汎用的なゲームAIプログラムです。囲碁、チェス、将棋の3つのゲームで、それぞれ人間のチャンピオンレベルの既存AIを打ち破りました。ゲームのルール以外の知識を一切使わず、ゼロから自己対戦のみで学習する点が最大の特徴です。
| ひとことで言うと | 人間の棋譜を一切使わず、ルールだけから自己対戦で最強になった汎用ゲームAI。 |
|---|---|
| 何が画期的か | 囲碁・将棋・チェスのいずれでも、同じアルゴリズムで既存最強を上回った。 |
| 注意点 | ルールが明確で完全情報のゲームに限られる。現実の課題はそう単純でない。 |
AlphaGoとの違い
AlphaGoが人間の棋譜による教師あり学習を初期段階で必要としたのに対し、AlphaZeroは完全にゼロから(タブラ・ラサ)自己対戦のみで学習します。また、AlphaGoが囲碁専用だったのに対し、AlphaZeroは単一のアルゴリズムで複数のゲームに対応する汎用的なフレームワークです。
1ルールだけ与える人間の知識はゼロ
▶
2自己対戦ランダムな手から開始
▶
3勝敗から学習方策と価値を更新
▶
4少し強くなる次はより強い相手に
▶
5人間を超える数時間〜数日で到達
↺ 2〜4をひたすらくり返す
アルゴリズムの仕組み
AlphaZeroは方策と価値を同時に出力する単一のニューラルネットワークと、モンテカルロ木探索(MCTS)を組み合わせています。自己対戦でゲームをプレイし、MCTSの探索結果を方策ネットワークの教師信号として使い、勝敗結果を価値ネットワークの教師信号として使います。
汎用性と影響
AlphaZeroは「ドメイン知識なしでも超人的な性能に到達できる」ことを示し、AI研究全体に大きなインパクトを与えました。その後のMuZeroはゲームのルールすら不要とする方向に発展し、さらに汎用的なアルゴリズムへと進化しています。