文章生成モデルの中核構造であるTransformerにおいて、エンコーダ-デコーダ構造を採用する場合、デコーダ側で「生成済みの単語」のみを参照するようにマスク処理を行う理由はどれか。 トップへ戻る 次へ進む スポンサーリンク