スポンサーリンク

問題の解答・解説ページ

このページは解説の閲覧モードです。
実力試しをしたい方は、下のボタンからクイズに挑戦してください!

この問題をクイズ形式で解く
問題 No.612
画像とテキストの対応関係を学習するモデルがある。このモデルが「ゼロショット分類」を実現できる理由はどれか。

【正解の解説】

画像とテキストを共通の埋め込み空間に配置することで、分類ラベルの記述から直接画像を判別できるため

CLIPなどのモデルは、画像とテキストを同じ「場所(埋め込み空間)」に配置します。これにより、「犬」という言葉と犬の画像が同じ場所にあると分かるため、見たことのないラベルであっても、言葉の概念を頼りに正しく画像を分類できます。

スポンサーリンク

【その他の選択肢の解説】

画像だけを学習し、後からテキストを割り当てたため

画像とテキストを別々に学習して後から組み合わせるだけでは、高度な関連付けは難しいです。

ラベル付き画像データのみを用いて分類器を学習したため

ラベル付きデータのみを使うと、学習していないラベルの画像は判別できません。

ニューラルネットワークを使わず、画像検索エンジンのみを利用しているため

ニューラルネットワークを高度に組み合わせることで、画像と文章の概念を結びつけています。