スポンサーリンク

問題の解答・解説ページ

このページは解説の閲覧モードです。
実力試しをしたい方は、下のボタンからクイズに挑戦してください!

この問題をクイズ形式で解く
問題 No.1185
初期の敵対的生成ネットワーク(GAN)は、多層パーセプトロン(全結合層)のみで構成されていたため、画像の構造(縦横の空間的なつながり)をうまく捉えられず、生成される画像が非常にぼやけたり、学習が極めて不安定で崩壊しやすいという大きな課題があった。この問題を克服するため、生成器(Generator)と識別器(Discriminator)の双方に「畳み込み層(CNN)」を本格的に導入し、高精細かつ写実的な画像を安定して生成できるようにした画期的な基礎モデルはどれか。

【正解の解説】

DCGAN

深層畳み込み生成敵対的ネットワーク(DCGAN)は、GANに畳み込み層(CNN)を組み込み、空間的なつながりを考慮することで画像生成の精度と学習の安定性を劇的に向上させた記念碑的なモデルです。

スポンサーリンク

【その他の選択肢の解説】

VAE

変分オートエンコーダ(VAE)は、入力データを一旦小さな圧縮データ(潜在空間)に落とし込み、そこからデータを再構成することで新たなデータを生成する手法です。GANとは生成の仕組みが根本的に異なります。

Pix2Pix

Pix2Pixは、ある画像から別の画像へ変換する(例:線画からカラー画像へ)ための画像変換技術です。DCGANをベースにしていますが、問題が問う「GANの不安定さを克服した基礎モデル」の定義としてはDCGANが該当します。

Denoising Diffusion Probabilistic Models (DDPM)

拡散モデル(DDPM)は、ノイズを徐々に取り除くことで画像を生成する最新の生成手法です。DCGANの後の世代の技術であり、本問題の回答ではありません。