DBSCAN(Density-Based Spatial Clustering of Applications with Noise)とは、データの密度に基づいてクラスタを形成する手法です。不規則な形状のクラスタを発見でき、ノイズ(外れ値)を自動的に検出できるのが特徴です。
コアポイント・ボーダーポイント・ノイズ
DBSCANはε(eps)半径内にMinPts個以上のデータ点を持つ点を「コアポイント」、コアポイントのε近傍内にある非コアポイントを「ボーダーポイント」、いずれにも属さない点を「ノイズ」として分類します。
| ひとことで言うと | データの「密集具合」でグループを見つけ、まばらな点は外れ値とする手法。 |
|---|---|
| 何がうれしいか | グループ数を指定不要。丸くない複雑な形のまとまりも見つけられる。 |
| 注意点 | 密度の設定(半径と最小点数)が結果を大きく左右する。 |
利点
クラスタ数の事前指定が不要、任意の形状のクラスタを発見可能、外れ値を自動検出できるという3つの大きな利点があります。k-meansでは見つけられない三日月型やリング型のクラスタも正しく識別できます。
1半径内の点を数える各点の周りを調べる
▶
2密集していれば核最小点数以上なら中心
▶
3つながりを広げる隣接する核を結合
▶
4クラスタが完成任意の形になる
▶
5残りは外れ値どこにも属さない点
パラメータの設定
εとMinPtsの設定が結果に大きく影響します。k-距離グラフを用いたεの決定方法が一般的で、MinPtsは次元数+1以上が推奨されています。