未学習(アンダーフィッティング)

Underfitting

未学習(アンダーフィッティング、Underfitting)とは、機械学習モデルが訓練データのパターンを十分に捉えられず、訓練データに対しても予測精度が低い状態を指します。モデルが単純すぎたり、学習が不十分な場合に発生します。

未学習が起きる原因

未学習の主な原因は、モデルの表現力が不足していること(線形モデルで非線形データを学習しようとするなど)、特徴量が不足していること、学習回数が少なすぎること、学習率が不適切であることなどです。

表:未学習(アンダーフィッティング)の要点まとめ
ひとことで言うとモデルが単純すぎて、訓練データのパターンすら捉えられていない状態。
見分け方訓練データでも検証データでも精度が低いまま。両方とも悪い。
対策モデルを複雑にする、特徴量を増やす、学習を長く回す、正則化を弱める。

未学習の対策

未学習を解消するには、より複雑なモデルを使用する、特徴量を追加する、学習回数を増やす、正則化の強度を下げる、などの方法があります。適切なモデル選択と十分な学習が鍵となります。

図:未学習と過学習の見分け方
1訓練精度が低い学習データすら当たらない
▶
2検証精度も低い両方悪い=未学習
▶
3モデルを強化層や特徴量を増やす
▶
4両方上がる適切な複雑さへ