スポンサーリンク

問題の解答・解説ページ

このページは解説の閲覧モードです。
実力試しをしたい方は、下のボタンからクイズに挑戦してください!

この問題をクイズ形式で解く
問題 No.636
音声認識システムにおいて、入力される音声の波形フレーム数と、出力されるテキストの文字数は一致しない。そのため、どのタイミングの音声がどの文字に対応するかを事前にラベル付けすることは困難である。このように入出力の長さが異なる系列データ同士のマッピングを、空白を表す特殊なラベルを用いて自動で整列させ、一気通貫で学習させる仕組みはどれか。

【正解の解説】

CTC

CTCは、音声の長さと文字数のズレを自動で補正し、どこにどの文字が対応するかを学習させることで、音声認識の精度を大きく向上させる仕組みです。

スポンサーリンク

【その他の選択肢の解説】

ニューラル機械翻訳

ニューラル機械翻訳は、AIを使ってある言語の文章を別の言語に翻訳する技術で、文章全体の意味を捉えることに長けています。

特異値分解

特異値分解は、複雑なデータから重要な成分だけを抜き出し、情報を整理・圧縮するための数学的な手法です。

Parts Affinity Fields

Parts Affinity Fieldsは、人間の身体の関節部位同士のつながりを推定し、複数人の姿勢を同時に高精度で検出するための技術です。