RLHF

Reinforcement Learning from Human Feedback

RLHFとは

RLHF(Reinforcement Learning from Human Feedback:人間のフィードバックからの強化学習)とは、人間の評価者によるフィードバックを使って報酬モデルを訓練し、その報酬モデルを用いて強化学習によりLLMの出力を改善する手法です。ChatGPTの成功を支える核心技術として広く知られるようになりました。

表:RLHFの要点まとめ
ひとことで言うと人の「良し悪し」の評価を学ばせて、AIの応答を人好みに整える手法。
どこで使うChatGPTなど対話AIの品質調整、安全性・丁寧さの向上。
注意点評価する人の偏りがそのまま反映される。手順が多くコストが高い。

RLHFのプロセス

RLHFは一般的に3つの段階で行われます。第1段階(SFT)では、人間が作成した高品質なデモンストレーションデータで教師ありファインチューニングを行います。第2段階では、モデルの複数の出力を人間が順位付けしたデータから報酬モデル(Reward Model)を訓練します。第3段階では、PPO(Proximal Policy Optimization)などの強化学習アルゴリズムを用いて、報酬モデルのスコアを最大化するようLLMを最適化します。

図:RLHFの3段階
1SFTで基礎模範回答で素直にする
▶
2人が順位付け複数の回答を good/bad に
▶
3報酬モデル好みを点数化する係を学習
▶
4強化学習点数が高くなるよう調整
▶
5人好みのAI丁寧で安全な応答に

RLHFの意義と課題

RLHFにより、AIは人間の意図や好みに沿った有用で安全な応答を生成できるようになります。これは「アライメント」(人間の価値観との整合)の重要な手段です。ただし、人間の評価にはバイアスが含まれる可能性があり、報酬モデルのハッキング(高い報酬を得るが実質的に有害な出力の最適化)のリスクもあります。コストの高さも課題で、代替手法としてDPO(Direct Preference Optimization)が注目されています。