Transformerモデルで採用されているScaled Dot-Product Attentionにおいて、ドット積を計算した後に「スケーリング(定数での除算)」を行う理由は「【 】」である。 トップへ戻る 次へ進む スポンサーリンク