データクレンジングとは
データクレンジング(Data Cleansing)とは、データセット内の誤り、不整合、重複、欠損などの品質問題を検出し、修正するプロセスです。データクリーニングとも呼ばれ、データの信頼性と正確性を確保するための基本的な作業です。
| ひとことで言うと | データの誤り・重複・表記ゆれを直して、使える状態にする作業。 |
|---|---|
| よくある作業 | 会社名の表記統一、全角半角の統一、重複レコードの名寄せ、明らかな入力ミスの修正。 |
| 注意点 | 修正の履歴を残すこと。元データは必ず保存しておく。 |
データクレンジングの対象
クレンジングの主な対象には、表記揺れの統一(株式会社と(株)など)、重複レコードの除去、不正なフォーマットの修正(日付形式の統一など)、データ型の不整合の解消、不正確なデータの修正または削除などがあります。
1品質を点検欠損・重複・矛盾を洗う
▶
2ルールを決めるどう直すか基準化
▶
3表記を統一全角半角・法人格など
▶
4重複を名寄せ同一先をまとめる
▶
5履歴を残す後から追跡できるように
データクレンジングの手順
一般的な手順は、まずデータプロファイリングによりデータの品質を評価し、次にルールベースまたは統計的手法で問題を検出し、修正ルールを適用します。自動化ツールを活用することで効率的なクレンジングが可能ですが、ドメイン知識に基づく人手の確認も欠かせません。
データ品質の指標
データ品質は、正確性(Accuracy)、完全性(Completeness)、一貫性(Consistency)、適時性(Timeliness)、一意性(Uniqueness)、妥当性(Validity)の6つの指標で評価されます。クレンジングによりこれらの品質指標を向上させることが目標です。