問題 No.72
自動運転システムやモバイル端末など、計算資源(メモリや電力)が極めて限定された環境にディープラーニングモデルを組み込みたい。ネットワークの構造(レイヤー数やノイズ)を削るのではなく、通常は「32ビット浮動小数点数(FP32)」で表現されているパラメータの数値を、「8ビット整数(INT8)」などの低い精度に落とすことで、メモリ容量を大幅に削減し計算を高速化する手法はどれか。
【正解の解説】
量子化
量子化とは、データを表現する際のビット数(精度の細かさ)を減らすことで、データ量を小さくし、計算を速くする手法のことです。
スポンサーリンク
【その他の選択肢の解説】
プルーニング
プルーニングとは、モデルの計算にあまり貢献していない重要度の低いパラメータやノードを削除し、モデルを軽量化する手法のことです。
知識留置
知識留置とは、今回の文脈では特定の用語として一般的に使用されておらず、知識を保持させ続けるような概念を指す言葉として扱われています。
ローカル展開
ローカル展開とは、開発したAIモデルをクラウド上ではなく、特定の端末やサーバーの現場環境にインストールして使用できるようにすることを指します。