合成データ(トレンド)

Synthetic Data

合成データとは

合成データ(Synthetic Data)とは、実際のデータから生成された統計的に類似する人工的なデータ、またはAIモデルによって生成されたデータのことです。プライバシー保護、データ不足の解消、バイアスの軽減、コスト削減など多様な目的で活用が急拡大しています。

表:合成データ(トレンド)の要点まとめ
ひとことで言うと実データの代わりに、人工的に作り出した学習用データ。
どこで使うかデータが少ない分野、個人情報を扱えない領域、希少な異常データの補完。
注意点合成データだけで学習を繰り返すと、品質が劣化する現象が指摘されている。

合成データの生成手法

統計的手法(分布に基づくサンプリング)、GAN(敵対的生成ネットワーク)、VAE(変分オートエンコーダー)、拡散モデル、LLMによるテキスト生成など、多様な手法が用いられます。近年ではLLMが高品質な訓練データを生成する「自己改善」的なアプローチも注目されています。

図:合成データの活用と注意
1実データが足りない収集が困難・高コスト
▶
2AIで生成する統計的性質を保って
▶
3学習に使うデータ量を補う
▶
4個人情報を回避プライバシーに有利
▶
5劣化に注意実データとの併用が前提

合成データの活用領域

自動運転のシミュレーションデータ、医療画像の拡張、金融の不正検出用データ、プライバシー保護が必要な個人データの代替、LLMの訓練データ拡張など、幅広い分野で活用されています。Gartnerは2030年までにAI訓練データの大半が合成データになると予測しています。

課題とリスク

合成データの品質評価の難しさ、「モデル崩壊」(合成データで訓練を繰り返すと品質が劣化する現象)、元データのバイアスが増幅されるリスクなどが課題として指摘されています。