スポンサーリンク

問題番号: No.792 (しっかりモード)

AIを用いた音声合成システム(テキストから人間の自然な話し声を生成する技術)において、従来の波形接続型や統計的パラメトリック型といった手法は、イントネーションが不自然で機械的な音声になりやすい欠点があった。これを解決するため、テキストのシーケンスを入力として受け取り、ニューラルネットワーク(Encoder-DecoderとAttention機構)を用いて直接、音声の特徴量(メルスペクトログラムなど)を生成する、Googleが開発したエンドツーエンドの音声合成モデルはどれか。

スポンサーリンク