問題 No.70
従来の音声認識システムでは、「音響モデル(音声を音素に変換)」「発音辞書(音素を単語に変換)」「言語モデル(単語を正しい文章に整形)」といった複数の独立したモジュールを人間が組み合わせて構築していた。これに対し、生の音声データから最終的なテキストテキストを1つの巨大なニューラルネットワークだけで直接出力させるアプローチを何というか。
【正解の解説】
End-to-Endモデル
End-to-Endモデルとは、途中の細かい解析過程を人間が設計せず、入力から出力までを巨大なニューラルネットワークが直接学習する手法のことです。
スポンサーリンク
【その他の選択肢の解説】
パイプラインモデル
パイプラインモデルとは、ある処理をいくつかの独立した段階に分け、前の段階から次の段階へ順番に情報を渡して連携させる手法のことです。
ハイブリッドモデル
ハイブリッドモデルとは、複数の異なるアルゴリズムやアプローチを組み合わせて、お互いの弱点を補うように構成されたモデルのことです。
マルチモーダルモデル
マルチモーダルモデルとは、画像、音声、テキストなど異なる種類の情報を同時に処理し、それらの関係性を理解して出力を行うモデルのことです。