強化学習において、エージェントが「環境から得られる将来の報酬の総和を最大化する」ために、現在の方策のまま行動するか、新しい行動を試すかを選択するジレンマを何と呼ぶか。 トップへ戻る 次へ進む スポンサーリンク