LSTMとは
LSTM(Long Short-Term Memory)は、RNNの勾配消失問題を解決するために1997年にホッホライターとシュミットフーバーによって提案された再帰型ニューラルネットワークのアーキテクチャです。長期的な依存関係を効果的に学習できることから、自然言語処理や時系列分析の分野で広く利用されてきました。
| ひとことで言うと | 「覚える・忘れる」をゲートで制御し、長い系列でも記憶を保てるRNNの改良版。 |
|---|---|
| どこで使う | 時系列予測、音声認識、少ないデータでの系列モデリング。 |
| 注意点 | 計算が重く並列化しにくい。大規模な言語処理ではTransformerが主流。 |
LSTMのゲート機構
LSTMの核心は、3つのゲート機構(忘却ゲート、入力ゲート、出力ゲート)とセル状態にあります。忘却ゲートは過去の情報のうちどの部分を忘れるかを決定し、入力ゲートは新しい情報のうちどの部分をセル状態に書き込むかを制御します。出力ゲートはセル状態からどの情報を出力するかを決めます。これらのゲートはすべてシグモイド関数で制御され、0から1の値を取ります。
1忘却ゲート何を捨てるか決める
▶
2入力ゲート何を新しく覚えるか
▶
3セル状態を更新記憶の本体を書き換え
▶
4出力ゲート何を外に出すか
▶
5次の時点へ記憶を持ち越す
※ セル状態は足し算だけで更新されるため、勾配が消えにくいのがポイントです。
セル状態の役割
LSTMの重要な特徴であるセル状態は、情報のハイウェイとして機能します。セル状態はゲートによって制御される加算操作のみで更新されるため、勾配が長いタイムステップにわたって安定して伝播できます。これにより、数百タイムステップ以上離れた依存関係も学習可能になりました。
LSTMの応用と現在の位置づけ
LSTMは機械翻訳、音声認識、手書き文字認識、音楽生成など幅広い分野で成果を上げてきました。Googleの音声アシスタントや翻訳システムでも長年使用されていました。現在はTransformerベースのモデルが主流となっていますが、データが少ない場合やリアルタイム推論が求められる場面ではLSTMが選択されることもあります。