重み減衰(Weight Decay)とは、最適化の各ステップでパラメータ(重み)を一定の比率で減衰させる正則化手法です。L2正則化と密接に関連していますが、AdamWオプティマイザでは両者が区別されます。
L2正則化との関係
SGDにおいてはL2正則化と重み減衰は数学的に等価です。しかし、Adamなどの適応的学習率オプティマイザではこの等価性が成り立たず、AdamW(decoupled weight decay)で正しい重み減衰が実装されています。
| ひとことで言うと | 更新のたびに重みを少しずつ小さくして、過学習を防ぐ手法。 |
|---|---|
| L2正則化との関係 | 多くの場合ほぼ同じ効果。実装上は更新式に組み込む形が一般的。 |
| 注意点 | Adamでは単純なL2と挙動が異なるため、AdamWを使うのが推奨。 |
効果
大きな重みにペナルティを課すことで、モデルの複雑さを抑制し過学習を防ぎます。一般的な値は0.01〜0.1程度で、タスクやモデルに応じて調整します。
1勾配で更新通常の学習ステップ
▶
2重みを少し縮める一定比率を掛ける
▶
3毎回くり返す使われない重みは0に近づく
▶
4過学習を抑制汎化性能が向上