強化学習(基礎)

Reinforcement Learning Basics

強化学習(Reinforcement Learning)とは、エージェントが環境と相互作用しながら、報酬を最大化する行動方策を学習する機械学習の一分野です。教師あり学習が「正解」を与えるのに対し、強化学習は「報酬」というフィードバックから学習します。

基本要素

エージェント(学習する主体)、環境(エージェントが行動する世界)、状態(環境の状況)、行動(エージェントの選択)、報酬(行動の結果として得られるフィードバック)の5つの基本要素で構成されます。

表:強化学習(基礎)の要点まとめ
ひとことで言うと試行錯誤しながら、報酬が最大になる行動の仕方を学ぶ方法。
どこで使うロボット制御、在庫や価格の最適化、対話AIの応答調整(RLHF)。
注意点報酬の設計を誤ると、狙いと違う行動を学習してしまう。

探索と活用のジレンマ

既に高い報酬が得られる行動を繰り返す「活用」と、未知の行動を試してより良い報酬を探す「探索」のバランスが重要な課題です。ε-greedy法やUCBアルゴリズムなどがこのバランスを制御します。

図:強化学習のサイクル
1状態を観測今どうなっているか
▶
2行動を選ぶ方策に従って決定
▶
3環境が変化結果として状態が変わる
▶
4報酬を受取る良し悪しの信号
▶
5方策を改善報酬が増える方向へ
↺ 1〜5を何万回もくり返して上達する

活用例

ゲームAI(AlphaGo、Atari)、ロボット制御、自動運転、推薦システム、LLMの調整(RLHF)など、幅広い分野で活用されています。