L2正則化(Ridge)

L2 Regularization / Ridge

L2正則化(Ridge回帰)とは、損失関数にモデルパラメータの二乗和を正則化項として追加する手法です。パラメータ全体を小さく保つことで過学習を防ぎ、モデルの汎化性能を向上させます。

L2正則化の仕組み

L2正則化では、損失関数にλ×Σ(w_i)²という項を追加します。この項はパラメータの値が大きくなるほどペナルティも大きくなるため、モデルは大きなパラメータ値を避けるように学習します。結果として、各パラメータは小さな値に分散されます。

表:L2正則化(Ridge)の要点まとめ
ひとことで言うと重みの2乗に罰則を与え、全体をなだらかに小さく抑える正則化。
L1との違いL1は0にして切り捨てる。L2は0にはせず、全体を均等に小さくする。
注意点特徴量の数は減らない。説明をシンプルにしたいならL1を検討する。

重み減衰との関係

深層学習の文脈では、L2正則化は「重み減衰(Weight Decay)」と呼ばれることが多いです。AdamWオプティマイザなどでは重み減衰がL2正則化として組み込まれています。

図:L2正則化の効果
1重みが大きい特定の特徴に依存
▶
22乗で罰則大きい重みほど強く罰する
▶
3全体が小さくなる0にはならない
▶
4影響が分散特定の特徴への依存が減る

活用場面

L2正則化は多重共線性(特徴量間の強い相関)がある場合に特に有効です。相関の高い特徴量のパラメータを均等に縮小することで、モデルの安定性を向上させます。