問題 No.25
医療画像解析や自動運転の空間認識において、画像に写っている物体を単に四角い枠で囲むだけでなく、画面内の「すべての画素(ピクセル)レベル」で、それが道路なのか、歩行者なのか、背景なのかを厳密に塗り分けて識別(セマンティックセグメンテーション)したい。従来の画像分類用のCNNから全結合層を完全に排除し、すべて畳み込み層で構成することで、入力サイズを維持したまま各画素のクラスを直接出力可能にした基礎的なモデルはどれか。
【正解の解説】
FCN
FCNは、全結合層を畳み込み層に置き換えることで、入力サイズを問わず画素レベルでの分類結果を出力可能にした画期的なモデルです。
スポンサーリンク
【その他の選択肢の解説】
AlexNet
AlexNetは、画像分類タスクで深層学習の有用性を示した画期的なCNNです。全結合層が含まれており、ピクセル単位の識別には適していません。
VGG
VGGは、層を深くすることで精度を高めた画像認識モデルです。分類タスク向けであり、画素ごとの識別には最適化されていません。
Faster R-CNN
Faster R-CNNは、物体検出(物体を四角い枠で囲む)のための代表的なモデルですが、画素ごとの塗り分け(セグメンテーション)には特化していません。