能動学習(Active Learning)とは、モデル自身がラベル付けすべきデータを選択的に選び、人間のアノテーターに問い合わせる学習手法です。限られたラベル付けコストで最大の性能向上を目指す効率的なアプローチです。
能動学習の仕組み
初期の少量のラベル付きデータでモデルを学習し、ラベルなしデータの中からモデルが「最も不確実」なサンプルを選んでラベル付けを依頼します。新たにラベル付けされたデータを追加してモデルを再学習するサイクルを繰り返します。
| ひとことで言うと | モデルが「自信のないデータ」を選び、そこだけ人にラベル付けしてもらう方法。 |
|---|---|
| 何がうれしいか | ラベル付けのコストを大幅に減らしながら、必要な精度に到達できる。 |
| 注意点 | 選ばれるデータが偏ることがある。定期的に無作為抽出も混ぜる。 |
サンプル選択戦略
不確実性サンプリング(モデルが最も予測に自信がないサンプル)、多様性サンプリング(データの多様性を最大化するサンプル)、期待値モデル変化(モデルへの影響が最大となるサンプル)などの戦略があります。
1少量で学習まず粗いモデルを作る
▶
2全データを予測確信度を計算
▶
3迷った例を選ぶ確率0.5付近など
▶
4人がラベル付けそこだけ確認してもらう
▶
5再学習効率よく精度が上がる
↺ 2〜5をくり返し、少ないラベルで高精度に
活用場面
医療画像のアノテーション、自然言語処理のラベル付け、工業検査など、専門家によるラベル付けが高コストな分野で特に有効です。