問題 No.618
テキストから人間の声に近い自然な音声を生成する音声合成タスクにおいて従来の隠れマルコフモデルを用いた手法では不自然な機械音になりがちであった。音声波形のサンプリング値を1つずつ自己回帰的に予測する際過去の広い範囲のデータを効率よく参照するために拡張畳み込みを採用し極めて高品質な音声生成を実現したモデルはどれか。
【正解の解説】
WaveNet
WaveNetは、音声波形を細かく区切って次々に予測していく深層学習モデルです。拡張畳み込みという仕組みで、過去の広い情報を効率よく取り込み、人間のような自然な音声を生成します。
スポンサーリンク
【その他の選択肢の解説】
サポートベクターマシン
サポートベクターマシンは、データを境界線で分けることで分類を行う手法です。音声波形の時系列生成には適していません。
音響モデル
音響モデルは、音声信号とテキストの音韻を対応付けるためのモデルです。WaveNetのような波形生成そのものを行う技術とは異なります。
フォルマント
フォルマントは、音声を特徴付ける共鳴周波数のことです。モデル名ではなく、音響学的な用語です。