スポンサーリンク

問題の解答・解説ページ

このページは解説の閲覧モードです。
実力試しをしたい方は、下のボタンからクイズに挑戦してください!

この問題をクイズ形式で解く
問題 No.579
画像とテキストのペアを大規模に学習し、テキストで画像を検索したり、分類したりすることを可能にした、対照学習(Contrastive Learning)ベースのモデルはどれか。

【正解の解説】

CLIP

CLIPは、画像とそれに関するテキストをセットで学習させることで、画像が何を表しているかを理解し、テキストから画像を検索したり分類したりすることを可能にする技術です。

スポンサーリンク

【その他の選択肢の解説】

BERT

BERTは、文章の中の言葉の前後関係を考慮することで、文脈を深く理解することに長けた自然言語処理のモデルです。

CycleGAN

CycleGANは、ペアになっていない2つの画像ドメイン間で、内容を保ったままスタイルや特徴を変換する生成モデルです。

VQ-VAE

VQ-VAEは、潜在空間の表現を離散化(数値の塊を特定の型に分類すること)し、データの圧縮と高精度な復元を実現するモデルです。