問題 No.1140
画像を入力として受け取り、その内容を説明するテキストを出力するタスクである「画像キャプション生成」の一般的なモデル構造に関する記述として【不適切なもの】はどれか。
【正解の解説】
入力された画像は一度音声データに変換されてから文章として翻訳される
スポンサーリンク
このページは解説の閲覧モードです。
実力試しをしたい方は、下のボタンからクイズに挑戦してください!
入力された画像は一度音声データに変換されてから文章として翻訳される