問題 No.96
時系列データや自然言語を処理する基本的なRNN(再帰型ニューラルネットワーク)には、過去の長いタイムステップ(長距離の依存関係)を遡って学習しようとすると、勾配消失や勾配爆発が起きてしまい、古い情報を記憶しておけないという課題がある。この課題を克服するため、内部に「入力ゲート」「出力ゲート」「忘却ゲート」という仕組み(セル)を導入したモデルはどれか。
【正解の解説】
LSTM
LSTMは、過去の情報を適切に保持したり忘れたりするために「入力」「出力」「忘却」の3つのゲートを備え、勾配消失を防ぎます。
スポンサーリンク
【その他の選択肢の解説】
Transformer
Transformerは、注意機構を活用して並列計算を可能にした最新のモデルで、RNNとは異なる構造を持ちます。
GRU
GRUは、LSTMを簡略化したモデルで、ゲートを2つに減らすことで効率よく過去の情報を保持できるようにしたものです。
BERT
BERTは、Transformerをベースに開発された大規模言語モデルで、RNNの一種ではありません。