従来のAIモデルは「画像だけ」「テキストだけ」のように、単一の種類(モーダリティ)のデータしか処理できなかった。これに対し、テキストによる指示(プロンプト)を入力するとそれに応じた高精度な画像を生成したり、逆に画像を見せるとその内容をテキストで詳しく説明してくれたりするような、複数の異なる種類の感覚データを統合して処理できるAIシステムを何というか。 トップへ戻る 次へ進む スポンサーリンク