画像とテキストという異なるモダリティを横断して処理するCLIPなどのモデルでは、「対照学習(コントラスティブラーニング)」という画期的なアプローチが使われている。インターネット上から収集した「画像と、その内容を説明するキャプションのペア」を大量に入力し、正しい画像とテキストの組み合わせの親近性(ベクトル空間上の距離)を近づけ、無関係なペアの距離を遠ざけるように学習させるベクトルの計算手法を何というか。 トップへ戻る 次へ進む スポンサーリンク