スポンサーリンク

問題番号: No.1280 (しっかりモード)

マルコフ決定過程に基づく強化学習において、エージェントは将来にわたって得られる報酬の合計を最大化するように方策を学習する。このとき、遠い未来に得られる報酬の価値を現在の価値に換算する際、不確実性を考慮して少しずつ目減りさせるために掛け合わせるパラメータについて、不適切な記述はどれか。

スポンサーリンク