マルコフ決定過程とは
マルコフ決定過程(MDP: Markov Decision Process)とは、強化学習問題を数学的に定式化するためのフレームワークです。MDPは状態集合S、行動集合A、状態遷移確率P(s'|s,a)、報酬関数R(s,a,s')、割引率γの5つの要素で定義され、逐次的意思決定問題の標準的なモデルとなっています。
| ひとことで言うと | 強化学習の問題を、状態・行動・遷移・報酬の4点で数学的に表した枠組み。 |
|---|---|
| マルコフ性とは | 次の状態は「今の状態と行動」だけで決まり、過去の経緯には依らないという性質。 |
| 注意点 | 現実には過去も効く場合が多い。必要な履歴は状態に含める設計にする。 |
マルコフ性
MDPの根幹をなすのがマルコフ性(Markov Property)です。これは「次の状態と報酬は現在の状態と行動のみに依存し、過去の履歴には依存しない」という性質で、P(s_{t+1}|s_t, a_t) = P(s_{t+1}|s_0, a_0, ..., s_t, a_t) が成り立ちます。この性質により問題が大幅に簡略化されます。
1状態 S取り得る状況の集合
▶
2行動 A選べる行動の集合
▶
3遷移 P行動で状態がどう変わるか
▶
4報酬 R各遷移でもらえる値
▶
5最適方策を探す報酬合計を最大化
MDPの解法
MDPが完全に既知(遷移確率と報酬関数が分かっている)の場合は、価値反復法や方策反復法などの動的計画法で最適方策を求められます。環境が未知の場合は、モンテカルロ法、TD学習、Q学習などのモデルフリー手法で、環境との相互作用を通じて最適方策を学習します。
MDPの拡張
部分観測MDP(POMDP)は状態が完全に観測できない場合の拡張です。半マルコフ決定過程(SMDP)は行動の持続時間が可変な場合に対応します。これらの拡張により、より現実的な問題を扱うことが可能になります。