問題 No.579
画像とテキストのペアを大規模に学習し、テキストで画像を検索したり、分類したりすることを可能にした、対照学習(Contrastive Learning)ベースのモデルはどれか。
【正解の解説】
CLIP
CLIPは、画像とそれに関するテキストをセットで学習させることで、画像が何を表しているかを理解し、テキストから画像を検索したり分類したりすることを可能にする技術です。
スポンサーリンク
【その他の選択肢の解説】
BERT
BERTは、文章の中の言葉の前後関係を考慮することで、文脈を深く理解することに長けた自然言語処理のモデルです。
CycleGAN
CycleGANは、ペアになっていない2つの画像ドメイン間で、内容を保ったままスタイルや特徴を変換する生成モデルです。
VQ-VAE
VQ-VAEは、潜在空間の表現を離散化(数値の塊を特定の型に分類すること)し、データの圧縮と高精度な復元を実現するモデルです。