問題 No.397
画像内の「どのピクセルが何であるか」を識別するセマンティックセグメンテーションにおいて、U-Netなどの構造が用いられる理由として最も適切なものはどれか。
【正解の解説】
エンコーダで抽象度を高め、デコーダで低次の空間情報を復元する「スキップ接続」により、精細な領域分割が可能になるため
正解です。U-Netは、画像を圧縮して特徴を抽出する部分と、元のサイズに戻しながら精細な情報を拾う部分を繋ぐ『スキップ接続』を持ちます。これにより、大まかな形と細かい位置情報を両立でき、高精度なセグメンテーションが可能です。
スポンサーリンク
【その他の選択肢の解説】
ピクセルごとの処理を全て排除し、画像全体を一つのクラスとして判定することで高速化するため
誤りです。セマンティックセグメンテーションは、ピクセル単位でクラス(物体)を判別するタスクであり、ピクセルごとの情報を重視します。
画像内の物体の移動を検知するために、動画形式の入力に特化しているため
誤りです。U-Netは静止画の領域分割にも広く使われる手法であり、動画専用ではありません。
畳み込み演算を使わずに、完全に全結合層のみで画像を解釈するため
誤りです。U-Netは名前の通り畳み込みニューラルネットワーク(CNN)の一種であり、畳み込み層を多用します。