訓練データ

Training Data

訓練データ(Training Data)とは、機械学習モデルのパラメータを学習するために使用するデータのことです。モデルはこのデータからパターンや規則性を抽出し、予測能力を獲得します。

訓練データの品質

「Garbage In, Garbage Out」という格言が示すように、訓練データの品質がモデルの性能を決定します。ラベルの正確性、データの多様性、代表性、十分な量など、高品質な訓練データの確保は機械学習プロジェクトの成否を左右します。

表:訓練データの要点まとめ
ひとことで言うとモデルのパラメータを学習させるために使うデータ。全体の6〜8割が目安。
どこで使うすべての教師あり学習。ここの質がモデルの上限を決める。
注意点テストデータと混ぜてはいけない。混ざると実力より高い精度に見えてしまう。

データの分割

データセット全体を訓練データ、検証データ、テストデータの3つに分割して使用するのが一般的です。訓練データでモデルを学習し、検証データでハイパーパラメータを調整し、テストデータで最終評価を行います。

図:3つのデータの役割
1訓練データ学習に使う(60〜80%)
▶
2検証データ設定の調整(10〜20%)
▶
3テストデータ最終評価(10〜20%)
▶
4最後まで隠すテストは1度だけ使う