統計的有意性

Statistical Significance

統計的有意性とは

統計的有意性(Statistical Significance)とは、観察された結果が偶然によるものではなく、真の差や効果を反映している可能性が高いことを示す統計的概念です。機械学習のモデル評価では、モデル間の性能差が統計的に有意かどうかを検証することで、信頼性の高い比較を行います。

表:統計的有意性の要点まとめ
ひとことで言うと観測された差が、偶然では説明しにくいと言えるかどうかの判断。
どこで使うモデルAとBの差が本物か、A/Bテストの結果が信頼できるかの判断。
注意点有意=重要ではない。差が小さければ実務上の意味はない。

仮説検定の基本

統計的有意性は仮説検定により判定されます。帰無仮説(モデル間に差がない)を設定し、データから計算されたp値が有意水準(通常0.05)を下回れば帰無仮説を棄却し、統計的に有意な差があると結論します。ただし、p値が小さいことは効果の大きさを保証するものではありません。

図:有意性を確かめる流れ
1差を観測モデルAが2%高い
▶
2偶然の可能性を計算p値を求める
▶
3基準と比較通常は5%未満
▶
4有意かを判断偶然とは言いにくい
▶
5実務価値も確認2%に意味があるか

モデル比較での検定手法

モデル比較では、McNemar検定(二値分類の正誤パターンの比較)、対応のあるt検定(交差検証結果の比較)、Wilcoxon符号順位検定(ノンパラメトリックな比較)、ブートストラップ検定などが使用されます。複数のモデルを同時に比較する場合は、多重比較補正(Bonferroni補正など)も考慮する必要があります。

実務上の注意点

統計的有意性だけでは十分ではなく、効果量(Effect Size)や実用的な有意性も考慮すべきです。大量のデータがあれば些細な差でも統計的に有意になりますが、実用上意味のある差とは限りません。信頼区間の報告やベイズ的アプローチの併用が推奨されています。