問題 No.612
画像とテキストの対応関係を学習するモデルがある。このモデルが「ゼロショット分類」を実現できる理由はどれか。
【正解の解説】
画像とテキストを共通の埋め込み空間に配置することで、分類ラベルの記述から直接画像を判別できるため
CLIPなどのモデルは、画像とテキストを同じ「場所(埋め込み空間)」に配置します。これにより、「犬」という言葉と犬の画像が同じ場所にあると分かるため、見たことのないラベルであっても、言葉の概念を頼りに正しく画像を分類できます。
スポンサーリンク
【その他の選択肢の解説】
画像だけを学習し、後からテキストを割り当てたため
画像とテキストを別々に学習して後から組み合わせるだけでは、高度な関連付けは難しいです。
ラベル付き画像データのみを用いて分類器を学習したため
ラベル付きデータのみを使うと、学習していないラベルの画像は判別できません。
ニューラルネットワークを使わず、画像検索エンジンのみを利用しているため
ニューラルネットワークを高度に組み合わせることで、画像と文章の概念を結びつけています。