問題 No.773
音声認識タスクにおいて、入力される音声波形のフレーム数と出力される文字数は一致しないため、どの音声部分がどの文字に対応するかを事前に厳密に紐付けることが難しい。この課題を解決するため、同じ文字の連続や空白記号の出力確率を考慮し、すべての可能な文字の並びのパターンを周辺化してモデルを直接エンドツーエンドで学習できるようにした損失関数はどれか。
【正解の解説】
CTC損失
CTC損失(Connectionist Temporal Classification loss)は、音声のような入力と出力の長さや対応が不明確なデータにおいて、すべての可能な対応付けを考慮し、自動的に位置合わせを行う手法です。
スポンサーリンク
【その他の選択肢の解説】
クロスエントロピー損失
交差エントロピー誤差関数(クロスエントロピー損失)は、主に分類問題において、予測された確率分布と実際の正解ラベルとの間のズレを測定するために用いられる関数です。
対照損失
対照損失(Contrastive Loss)は、似ているデータは近づけ、似ていないデータは遠ざけるように学習させるための損失関数です。
フーバー損失
フーバー損失(Huber Loss)は、回帰問題において、誤差が大きいときは絶対値、小さいときは二乗を使うことで、外れ値の影響を抑えつつ安定した学習を促す関数です。