スポンサーリンク

問題番号: No.45 (しっかりモード)

画像認識用のCNNにおいて、画像内に写っている識別対象(物体)の大きさが画像ごとに異なると、固定された1つのフィルターサイズ(例えば3x3のみ)では、小さな特徴を見落としたり、逆に広域な文脈を捉えきれなかったりして認識精度が低下する問題がある。サイズが異なる複数の畳み込み層(1x1、3x3、5x5)やプーリング層を1つのブロック内に並列に配置し、それぞれの出力を後からチャンネル方向に結合して次の層へと送る、GoogLeNetの核となるNW構造はどれか。

スポンサーリンク