BERTモデル

Bidirectional Encoder Representations from Transformers

BERTとは

BERT(Bidirectional Encoder Representations from Transformers)とは、2018年にGoogleが発表した事前学習済み言語モデルです。Transformerのエンコーダーを使い、テキストの双方向の文脈を同時に学習することで、自然言語処理の多くのタスクで画期的な性能を達成しました。

表:BERTモデルの要点まとめ
ひとことで言うと文を前後両方向から読んで意味を捉える、理解タスクに強いモデル。
どこで使う検索の意図理解、文書分類、感情分析、固有表現抽出。
注意点文章生成には向かない。用途によってGPT型と使い分ける。

BERTの革新性

BERTの最大の特徴は双方向性です。それまでのモデル(GPTなど)が左から右への一方向、またはELMoのように左右を独立に学習していたのに対し、BERTはマスク言語モデリング(MLM)により、左右の両方向の文脈を同時に考慮した単語表現を学習します。これにより、文脈に応じた高品質な単語埋め込みが可能になりました。

図:BERTの学習と利用
1一部を隠す文中の語を[MASK]に
▶
2両方向から推測前後の文脈で当てる
▶
3言語知識を獲得事前学習の完了
▶
4タスク別に調整少量データで追加学習
▶
5業務で利用分類・抽出・検索

事前学習とファインチューニング

BERTは大量のテキスト(Wikipedia、BookCorpusなど)でマスク言語モデリング(MLM)と次文予測(NSP)の2つのタスクで事前学習されます。その後、少量のラベル付きデータで各タスク(質問応答、感情分析、NERなど)にファインチューニングすることで、高い性能を発揮します。

BERTの派生モデル

BERTの成功を受けて、RoBERTa、ALBERT、DistilBERT、XLNet、DeBERTaなどの多くの派生モデルが開発されました。日本語では東北大学のBERT日本語モデルなどが公開されており、日本語NLPタスクで広く利用されています。