分類

Classification

分類(Classification)とは、入力データを事前に定義されたカテゴリ(クラス)のいずれかに割り当てる教師あり学習のタスクです。スパム検出、画像認識、感情分析など、機械学習の最も一般的な応用の一つです。

分類の種類

二値分類(2クラス:陽性/陰性)と多クラス分類(3クラス以上)が基本です。さらに、1つのサンプルが複数のクラスに属しうるマルチラベル分類もあります。

表:分類の要点まとめ
ひとことで言うとデータがどのカテゴリに属するかを当てる、教師あり学習の代表的なタスク。
どこで使う不良品判定、スパム判定、顧客の離反予測、与信判断。
注意点クラスの件数が偏っていると、多いほうばかり当てる使えないモデルになる。

分類アルゴリズム

ロジスティック回帰、決定木、ランダムフォレスト、SVM、k-NN、ナイーブベイズ、ニューラルネットワークなど、多様なアルゴリズムが分類に利用できます。

図:分類モデルができるまで
1ラベル付きデータ良品/不良品などの正解
▶
2特徴量を作る判断材料を数値化
▶
3境界線を学習クラスを分ける線を引く
▶
4新データを判定どちら側かで分類
▶
5精度を評価混同行列で確認

評価指標

精度、適合率、再現率、F値、ROC-AUC、混同行列など、複数の指標を用いてモデルの性能を多角的に評価します。データの不均衡度やタスクの要件に応じた適切な指標の選択が重要です。