GRUとは
GRU(Gated Recurrent Unit)は、2014年にチョらによって提案された再帰型ニューラルネットワークの一種です。LSTMと同様に勾配消失問題を解決しつつ、より単純な構造を持つことが特徴です。LSTMの3つのゲートを2つに簡略化し、セル状態と隠れ状態を統合することで、パラメータ数を削減しています。
| ひとことで言うと | LSTMをシンプルにした、ゲート2つの軽量な再帰型ネットワーク。 |
|---|---|
| 何がうれしいか | LSTMとほぼ同等の精度で、パラメータが少なく学習が速い。 |
| 注意点 | 非常に長い系列ではLSTMのほうが有利な場合もある。タスク次第で使い分ける。 |
GRUの構造
GRUはリセットゲートと更新ゲートの2つのゲート機構で構成されます。更新ゲートは過去の情報をどの程度保持するかを制御し、LSTMの忘却ゲートと入力ゲートの両方の役割を担います。リセットゲートは新しい候補隠れ状態を計算する際に、過去の情報をどの程度無視するかを決定します。
1リセットゲート過去をどれだけ無視するか
▶
2候補を計算新しい記憶の案を作る
▶
3更新ゲート過去と新しさの配合比
▶
4隠れ状態を更新1つの状態だけで管理
※ LSTMのセル状態と隠れ状態を1本にまとめたので、構造が簡単です。
LSTMとの比較
GRUはLSTMよりもパラメータ数が少なく、計算効率が高いという利点があります。多くのタスクでLSTMと同等の性能を発揮しますが、非常に長い系列の記憶が必要なタスクではLSTMが優れる場合があります。データ量が限られている場合や計算リソースに制約がある場合には、GRUが有利に働くことが多いです。
GRUの活用場面
GRUは音声合成、機械翻訳、株価予測など、さまざまな時系列タスクで利用されています。特にモバイルデバイスや組み込みシステムなど、計算リソースが限られた環境でのリアルタイム処理に適しています。Transformerが主流となった現在でも、軽量なシーケンスモデリングの選択肢として重要な位置を占めています。