トピックモデル

Topic Model

トピックモデルとは

トピックモデル(Topic Model)とは、大量の文書集合から潜在的なトピック(話題・テーマ)を自動的に発見する確率的な生成モデルです。各文書が複数のトピックの混合として構成され、各トピックは特定の単語の分布として表現されると仮定します。

表:トピックモデルの要点まとめ
ひとことで言うと大量の文書から、どんな話題が含まれているかを自動で見つける手法。
どこで使う問い合わせ内容の分類、口コミの論点整理、社内文書のテーマ把握。
注意点トピック数は人が指定する必要がある。出てきた話題の解釈も人が行う。

トピックモデルの考え方

例えば、ニュース記事の集合にトピックモデルを適用すると、「政治」「経済」「スポーツ」「科学」などのトピックが自動的に発見されます。各トピックは関連する単語(例:「政治」トピックは「選挙」「政策」「議会」など)の確率分布として表されます。各文書は複数のトピックの混合比率で特徴づけられます。

図:トピックモデルの流れ
1文書集合問い合わせ履歴など
▶
2トピック数を指定5個・10個など
▶
3語の分布を推定話題ごとの特徴語
▶
4文書に割当各文書の話題の比率
▶
5人が名前を付ける「価格」「納期」など

代表的な手法

LDA(Latent Dirichlet Allocation)が最も広く使われているトピックモデルです。LSA(Latent Semantic Analysis)は特異値分解を用いた初期の手法です。NMF(Non-negative Matrix Factorization)は非負制約のある行列分解によるトピック発見手法です。近年はBERTopicのように事前学習済みモデルを活用した手法も注目されています。

トピックモデルの活用

学術論文の研究動向分析、ニュース記事の自動分類、顧客レビューの分析、ソーシャルメディアのトレンド分析、文書推薦システムなどに活用されています。