特徴量選択

Feature Selection

特徴量選択(Feature Selection)とは、モデルの入力として使う特徴量のうち、予測に有効なものだけを選び出す手法です。不要な特徴量を除くことで、モデルの性能向上、過学習の防止、学習時間の短縮が期待できます。

特徴量選択の手法

フィルタ法(相関係数やカイ二乗検定でスコアリング)、ラッパー法(前方選択や後方除去で最適な組み合わせを探索)、組み込み法(L1正則化やランダムフォレストの特徴量重要度で自動選択)の3つのアプローチがあります。

表:特徴量選択の要点まとめ
ひとことで言うとたくさんある特徴量から、予測に本当に効くものだけを絞り込む作業。
何がうれしいか過学習を防ぎ、学習が速くなり、モデルの説明もしやすくなる。
注意点選ぶ工程を訓練データの外で行うとデータリークになる。分割後に行う。

次元の呪いとの関連

特徴量が多すぎると「次元の呪い」により、モデルの性能が低下する場合があります。特徴量選択はこの問題を緩和する有効な手段です。

図:特徴量選択の進め方
1全特徴量100列など
▶
2重要度を測る相関・木の重要度など
▶
3不要な列を削る効かない・重複する列
▶
4精度を比較削っても落ちないか確認
▶
5少数精鋭に運用しやすいモデルへ