強化学習において、エージェントは将来にわたって得られる報酬の合計(収益)を最大化するように行動を学習する。このとき、遠い将来に得られる報酬の不確実性を考慮し、現在の価値に換算するためにステップごとに掛け合わせる数理的パラメータ(通常0から1の間の値をとる)を何と呼ぶか。 トップへ戻る 次へ進む スポンサーリンク