スポンサーリンク

問題の解答・解説ページ

このページは解説の閲覧モードです。
実力試しをしたい方は、下のボタンからクイズに挑戦してください!

この問題をクイズ形式で解く
問題 No.792
AIを用いた音声合成システム(テキストから人間の自然な話し声を生成する技術)において、従来の波形接続型や統計的パラメトリック型といった手法は、イントネーションが不自然で機械的な音声になりやすい欠点があった。これを解決するため、テキストのシーケンスを入力として受け取り、ニューラルネットワーク(Encoder-DecoderとAttention機構)を用いて直接、音声の特徴量(メルスペクトログラムなど)を生成する、Googleが開発したエンドツーエンドの音声合成モデルはどれか。

【正解の解説】

Tacotron

文字の情報を読み取り、音声の特徴量(スペクトログラム)へ直接変換するGoogle開発のモデルです。現在の音声合成の基盤となっています。

スポンサーリンク

【その他の選択肢の解説】

WaveNet

生の音声波形を直接生成するモデルです。非常に自然な音を作れますが、Tacotronのように文字から直接変換する仕組みとは異なります。

BERT

自然言語処理において、文脈を理解するための代表的な事前学習モデルです。音声合成専門ではありません。

CTC

音声認識において、文字と音声の対応を学習させる損失関数です。音声合成のためのモデルではありません。