音声認識システムを構築する際、マイクから集音した生の音響信号(波形データ)をそのままディープラーニングに入力しても、不要な高周波成分や個人固有の声質のノイズが多く、言葉の意味の認識精度が上がらない。人間の耳が「低音の変化には非常に敏感だが、高音の変化には鈍感である」という知覚特性(メル尺度)に合わせ、音声から言語的な特徴のみを効率よく抽出した音響特徴量はどれか。 トップへ戻る 次へ進む スポンサーリンク