BERTの登場

Emergence of BERT

BERTとは

BERT(Bidirectional Encoder Representations from Transformers)は、2018年にGoogleが発表した自然言語処理モデルです。双方向のコンテキスト理解を可能にし、NLPの多くのベンチマークで当時の最高性能を達成して、自然言語処理研究に革命をもたらしました。

表:BERTの登場の要点まとめ
ひとことで言うと2018年にGoogleが発表した、言語理解の精度を一気に引き上げたモデル。
何が新しかったか文を前後両方向から読むことで、文脈の理解が大きく向上した。
注意点Google検索にも導入され、検索の意図理解が大幅に改善した。

革新的な事前学習手法

BERTの最大の革新は、文中の単語をランダムにマスクして予測する「マスク言語モデル(MLM)」と、2つの文が連続しているかを判定する「次文予測(NSP)」という2つの事前学習タスクにあります。これにより、従来の左から右への一方向的な言語理解ではなく、前後の文脈を同時に考慮した双方向の理解が可能になりました。

図:BERTがもたらした変化
1従来は片方向前から順に読むだけ
▶
2前後から読む穴埋め問題で学習
▶
3文脈理解が向上多義語も正しく解釈
▶
4各種タスクで最高精度11分野で記録更新
▶
5検索にも導入実サービスで活用

NLPへのインパクト

BERTは発表直後にSQuAD(質問応答)やGLUE(言語理解ベンチマーク)など11のNLPタスクで最高性能を記録しました。さらに重要なことに、大規模データで事前学習した汎用モデルを少量のデータでファインチューニングするというパラダイムを確立し、NLP研究と実務の両方を大きく変革しました。

歴史的位置づけ

BERTの成功はGoogleの検索エンジンにも組み込まれ、実社会への影響も大きいものでした。RoBERTa、ALBERT、DistilBERTなど多くの派生モデルが生まれ、「BERTology」という研究分野まで形成されました。BERTはTransformerアーキテクチャの可能性を広く知らしめ、GPTシリーズとともに大規模言語モデル時代の礎を築きました。