問題 No.792
AIを用いた音声合成システム(テキストから人間の自然な話し声を生成する技術)において、従来の波形接続型や統計的パラメトリック型といった手法は、イントネーションが不自然で機械的な音声になりやすい欠点があった。これを解決するため、テキストのシーケンスを入力として受け取り、ニューラルネットワーク(Encoder-DecoderとAttention機構)を用いて直接、音声の特徴量(メルスペクトログラムなど)を生成する、Googleが開発したエンドツーエンドの音声合成モデルはどれか。
【正解の解説】
Tacotron
文字の情報を読み取り、音声の特徴量(スペクトログラム)へ直接変換するGoogle開発のモデルです。現在の音声合成の基盤となっています。
スポンサーリンク
【その他の選択肢の解説】
WaveNet
生の音声波形を直接生成するモデルです。非常に自然な音を作れますが、Tacotronのように文字から直接変換する仕組みとは異なります。
BERT
自然言語処理において、文脈を理解するための代表的な事前学習モデルです。音声合成専門ではありません。
CTC
音声認識において、文字と音声の対応を学習させる損失関数です。音声合成のためのモデルではありません。