問題 No.100
従来のAIモデルは「画像だけ」「テキストだけ」のように、単一の種類(モーダリティ)のデータしか処理できなかった。これに対し、テキストによる指示(プロンプト)を入力するとそれに応じた高精度な画像を生成したり、逆に画像を見せるとその内容をテキストで詳しく説明してくれたりするような、複数の異なる種類の感覚データを統合して処理できるAIシステムを何というか。
【正解の解説】
マルチモーダルモデル
マルチモーダルモデルは、テキスト、画像、音声など異なる種類のデータ(モダリティ)を統合して理解・生成するモデルです。
スポンサーリンク
【その他の選択肢の解説】
マルチタスクモデル
マルチタスクモデルは、ひとつのモデルで複数の異なるタスク(分類と検出など)を同時にこなすモデルのことです。
アンサンブルモデル
アンサンブルモデルは、複数のモデルを組み合わせて、最終的な予測精度や信頼性を高める手法です。
クロスバリデーション
クロスバリデーションは、モデルの精度を正しく評価するためにデータを分割して繰り返し検証する手法のことです。