問題 No.1378
強化学習において、エージェントは将来にわたって得られる報酬の合計(収益)を最大化するように行動を学習する。このとき、遠い将来に得られる報酬の不確実性を考慮し、現在の価値に換算するためにステップごとに掛け合わせる数理的パラメータ(通常0から1の間の値をとる)を何と呼ぶか。
【正解の解説】
割引率
割引率(0から1の値)は、将来の報酬を現在の価値に換算して目減りさせる係数です。1に近いほど将来を重視し、0に近いほど目先の利益を重視します。
スポンサーリンク
【その他の選択肢の解説】
学習率
学習率は、一度の更新でどれだけ重みを変化させるかという学習の「歩幅」を決めるパラメータです。
探索率
探索率は、強化学習において未知の行動をどれだけ積極的に試すかという割合を指します。
報酬の期待値
報酬の期待値は、ある行動をとったときに得られる報酬の予測される合計値そのものを指します。