スポンサーリンク

問題の解答・解説ページ

このページは解説の閲覧モードです。
実力試しをしたい方は、下のボタンからクイズに挑戦してください!

この問題をクイズ形式で解く
問題 No.1140
画像を入力として受け取り、その内容を説明するテキストを出力するタスクである「画像キャプション生成」の一般的なモデル構造に関する記述として【不適切なもの】はどれか。

【正解の解説】

入力された画像は一度音声データに変換されてから文章として翻訳される

スポンサーリンク

【その他の選択肢の解説】

画像の特徴抽出にはCNNがよく用いられる

文章の生成にはRNNやTransformerがよく用いられる

エンコーダ・デコーダモデルの枠組みを用いて実装されることが多い