OpenAI Gymとは
OpenAI Gym(現在はGymnasiumとして後継プロジェクトが運営)とは、強化学習アルゴリズムの開発・評価のための標準的なプラットフォームおよびAPIです。2016年にOpenAIが公開し、統一的なインターフェースで様々な環境にアクセスできることから、強化学習研究のデファクトスタンダードとなりました。
| ひとことで言うと | 強化学習アルゴリズムを試すための、標準的な練習環境のライブラリ。 |
|---|---|
| 何がうれしいか | 共通の作法で多数の課題を試せるので、手法同士を公平に比較できる。 |
| 注意点 | 現在は後継のGymnasiumが主流。古いコードはそのままでは動かない場合がある。 |
標準的なAPI
Gymの最大の貢献は、強化学習環境の標準APIを定義したことです。env.reset()で環境をリセットし、env.step(action)で行動を実行して(observation, reward, done, info)を受け取るというシンプルなインターフェースにより、どの環境でも同じコードで強化学習アルゴリズムを実行できます。
1環境を作るmake('CartPole-v1')
▶
2reset で初期化初期状態を取得
▶
3step で行動次状態と報酬が返る
▶
4終了まで繰り返す1エピソード完了
▶
5学習に利用アルゴリズムを検証
環境の種類
Classic Control(CartPole、MountainCarなど)、Atariゲーム(Breakout、Pongなど)、MuJoCoベースの連続制御タスク(HalfCheetah、Humanoidなど)、テキストベース環境など、多様な環境が提供されています。サードパーティによる拡張環境も豊富です。
GymnasiumとPettingZoo
OpenAI Gymのメンテナンス停止後、Farama Foundationが後継のGymnasiumを開発しています。マルチエージェント環境にはPettingZooが標準となっています。これらのツールにより強化学習の研究と実装がさらに容易になっています。