問題 No.1285
ディープラーニングモデルの過学習を抑制する手法として、学習の各ステップにおいて中間層のニューロンを一定の確率でランダムに無効化しながらパラメータの更新を行うものがある。この手法を用いたモデルの実運用時における挙動に関する記述として、最も適切なものはどれか。
【正解の解説】
実運用時はすべてのニューロンを稼働させるが、出力のスケールが学習時と変わってしまうのを防ぐため、各ニューロンの出力に学習時の生存確率を掛け合わせる。
ドロップアウトは学習時に一部を間引くため、運用時は全てのニューロンを使いつつ、出力の期待値が学習時と一致するように調整します。
スポンサーリンク
【その他の選択肢の解説】
実運用時も学習時と全く同じ確率でニューロンを無効化し、複数回の予測結果の平均をとって最終的な出力を決定する。
実運用時はモデル全体を安定して使用することが求められるため、ランダムな無効化は行いません。
実運用時は学習時に一度でも無効化されたニューロンをネットワークから完全に物理的に削除し、モデルを軽量化して高速に実行する。
無効化は学習時のみの工夫であり、運用時に構造自体を変えてしまうとモデルの性能が発揮できません。
実運用時は出力層に近いニューロンのみを無効化し、入力層に近いニューロンの情報を強制的に引き出すことで予測を安定させる。
特定の層のみを無効化するような運用は一般的ではなく、ドロップアウトの本来の目的からも外れます。