問題 No.1268
モバイル端末向けに計算量を劇的に削減したMobileNetなどのアーキテクチャでは、通常の畳み込み処理を2つのステップに分解するDepthwise Separable Convolutionが採用されている。画像のチャンネルごとに独立して空間方向の特徴を抽出した直後に、カーネルサイズが【 】の畳み込みを用いてチャンネル間の情報を融合させる。
【正解の解説】
1x1
1x1の畳み込み(Pointwise Convolution)は、チャンネル間の情報を混ぜ合わせて統合する役割を持ち、Depthwise Separable Convolutionの後半ステップで使われます。
スポンサーリンク
【その他の選択肢の解説】
3x3
3x3の畳み込みは、通常、画像の特徴を抽出する最初のステップで用いられます。
5x5
5x5の畳み込みは、より広範囲の特徴を見るためのカーネルですが、MobileNetでは効率化のためあまり使われません。
7x7
7x7の畳み込みは非常に広い範囲を一度に見るため計算コストが高く、効率的なネットワークには不向きです。