混同行列

Confusion Matrix

混同行列(Confusion Matrix)とは、分類モデルの予測結果を真陽性(TP)、偽陽性(FP)、真陰性(TN)、偽陰性(FN)の4つのカテゴリに分類して表形式にまとめたものです。モデルの性能を多角的に評価するための基礎となります。

4つの要素

真陽性(TP):正しく陽性と予測。偽陽性(FP):誤って陽性と予測(第1種の過誤)。真陰性(TN):正しく陰性と予測。偽陰性(FN):誤って陰性と予測(第2種の過誤)。

表:混同行列の要点まとめ
ひとことで言うと予測と実際の組み合わせを2×2の表にまとめた、分類評価の出発点。
4つのマス正しく陽性(TP)/誤って陽性(FP)/誤って陰性(FN)/正しく陰性(TN)。
注意点精度だけ見ずに、まずこの表を見るのが鉄則。どこで間違えているかが分かる。

混同行列から算出される指標

精度(Accuracy)= (TP+TN)/(TP+FP+TN+FN)、適合率(Precision)= TP/(TP+FP)、再現率(Recall)= TP/(TP+FN)、F値 = 2×Precision×Recall/(Precision+Recall) など、様々な評価指標を算出できます。

図:混同行列から指標を導く
1予測と実際を集計4つのマスに振り分け
▶
2適合率TP ÷ 陽性と予測した数
▶
3再現率TP ÷ 実際の陽性数
▶
4F値両者の調和平均
▶
5改善点が見える誤検知か見逃しか

多クラス分類での拡張

2クラスの場合は2×2の行列ですが、Kクラスの場合はK×Kの行列に拡張されます。対角成分が正しい予測、非対角成分が誤分類を表し、どのクラス間で混同が多いかを分析できます。