ディープラーニングにおいて、層が深くなると各層の入力データの分布が学習の進行とともに変化し、学習が不安定になる(内部共変量シフト)。これを防ぐため、ネットワークの各層の直前(または直後)において、ミニバッチごとの入力データの分布が平均0、分散1になるように数理的に変換を施す手法はどれか。 トップへ戻る 次へ進む スポンサーリンク