問題 No.615
音声生成において、生の波形データを直接モデル化する手法がある。この手法で、非常に高精細な音声を生成できる理由はどれか。
【正解の解説】
1サンプル前の値から次の値を確率的に予測する自己回帰モデルを構成し、精緻な波形を描写できるため
WaveNetのような手法は、1つ前の音のデータをもとに次の音を非常に細かく予測します。この積み重ねにより、人間が聞いても違和感のない非常に高精細な音声を作り出せます。
スポンサーリンク
【その他の選択肢の解説】
音声を周波数領域に変換して学習するため
波形を周波数領域に変換する手法(スペクトログラムなど)もありますが、生の波形を直接扱う手法とは異なります。
人間の発声器官のシミュレーションを行っているため
人間の器官を模倣する手法もありますが、それが生の波形データを直接予測して高精細さを実現する直接の理由ではありません。
音声を圧縮した後に再構築するため
音声を圧縮してから再構築する手法も存在しますが、波形を自己回帰的に予測するモデルとは仕組みが異なります。