問題 No.44
LSTMは長期の時系列情報を勾配消失させることなく学習できる優れたモデルだが、「入力ゲート」「出力ゲート」「忘却ゲート」という3つの緻密な弁構造を持つためパラメータ数が多く、学習の計算コストやメモリ消費量が非常に重いという実務上の課題がある。LSTMの記憶セルを廃止し、「更新ゲート」と「リセットゲート」の2つのゲートに機能を統合・簡略化することで、高い表現力を維持したまま大幅な軽量・高速化を図ったRNNの派生構造はどれか。
【正解の解説】
GRU
GRUは、LSTMの複雑なゲートを簡略化し、更新とリセットの2つに絞った構造です。必要な情報を効率的に選別できるため、少ないメモリで高い性能を発揮できます。
スポンサーリンク
【その他の選択肢の解説】
CEC
CECは、LSTMの基礎となる考え方で、誤差を消失させずに伝えるための定数誤差カルーセルという仕組みのことです。LSTMの記憶保持の核心ですが、モデル自体を軽量化する手法ではありません。
BPTT
BPTTは、RNNにおいて誤差を過去の時点まで遡って反映させる学習アルゴリズムです。学習方法の一つであり、モデルの構造を簡略化するものではありません。
Attention
Attentionは、データ内の重要な部分に集中して重みを付ける仕組みです。時系列の処理でも使われますが、RNNのゲート構造を簡略化する直接的な派生モデルではありません。