スポンサーリンク

問題番号: No.70 (しっかりモード)

従来の音声認識システムでは、「音響モデル(音声を音素に変換)」「発音辞書(音素を単語に変換)」「言語モデル(単語を正しい文章に整形)」といった複数の独立したモジュールを人間が組み合わせて構築していた。これに対し、生の音声データから最終的なテキストテキストを1つの巨大なニューラルネットワークだけで直接出力させるアプローチを何というか。

スポンサーリンク