音声認識において、発話された音声データの時間的な長さ(フレーム数)と、対応するテキストの文字数は一般に一致せず、またどの音声区間がどの文字に対応するのか(アライメント)の正解ラベルを与えることは極めて困難である。この課題を解決するため、文字の間に空白(ブランク)のトークンを導入し、すべての可能なアライメントの確率を足し合わせることで、明示的な位置合わせのラベルなしでニューラルネットワークをエンドツーエンドで訓練可能にする損失関数・アルゴリズムはどれか。 トップへ戻る 次へ進む スポンサーリンク