問題 No.614
文章生成モデルの中核構造であるTransformerにおいて、エンコーダ-デコーダ構造を採用する場合、デコーダ側で「生成済みの単語」のみを参照するようにマスク処理を行う理由はどれか。
【正解の解説】
未来の単語情報を参照して生成時にカンニングすることを防ぎ、学習時の整合性を保つため
未来の単語情報を参照して生成時にカンニングすることを防ぎ、学習時の整合性を保つためです。テストで隣の席の人の解答を見てしまうのを防ぐ、目隠しのような処理です。
スポンサーリンク
【その他の選択肢の解説】
生成速度を低下させて精度を上げるため
生成速度を上げるためにマスクをするのではなく、生成中のモデルがまだ見てはいけない未来の言葉を先に見て答えを知ってしまうことを防ぐのが目的です。
モデルのパラメータ数を削減するため
マスク処理はモデルの学習を正しく行うための制御であり、パラメータを削減する機能ではありません。
文章を逆順から生成するため
文章を逆順から生成するわけではなく、あくまで学習時に未来の情報を見ないように制限をかけているだけです。