テキストマイニングとは
テキストマイニング(Text Mining)とは、大量のテキストデータから有益な情報やパターン、知見を自動的に発見・抽出する技術の総称です。非構造化データであるテキストを分析し、ビジネスインテリジェンスや学術研究に活用するためのデータ分析手法です。
| ひとことで言うと | 大量の文章から、傾向や気づきを自動で掘り出す分析のこと。 |
|---|---|
| どこで使う | 顧客アンケート、口コミ、問い合わせ履歴、社内の日報の分析。 |
| 注意点 | 件数が少ないと偶然の傾向を拾う。必ず元の文章も読んで裏づけを取る。 |
テキストマイニングの手法
テキストマイニングには多様な手法が含まれます。頻度分析は単語やフレーズの出現頻度を分析します。共起分析は単語の共起パターンを発見します。トピックモデルは文書集合に潜在するトピックを抽出します。感情分析はテキストの感情的な傾向を判定します。クラスタリングは類似した文書をグループ化します。
1テキスト収集アンケート・口コミ
▶
2前処理表記ゆれ・不要語を整理
▶
3単語を数える頻度・共起を集計
▶
4可視化ワードクラウド・共起図
▶
5打ち手を検討改善アクションにつなげる
テキストマイニングの前処理
効果的なテキストマイニングには適切な前処理が不可欠です。トークン化、ストップワードの除去、ステミング・レンマ化、正規化などの前処理により、分析に適した形にデータを整形します。日本語では形態素解析が前処理の重要なステップとなります。
活用事例
顧客の声(VoC)分析、ソーシャルメディア分析、特許分析、医療文献のレビュー、コールセンターのログ分析、アンケートの自由記述欄の分析など、テキストデータが存在するあらゆる場面で活用されています。