問題 No.3
強化学習の初期段階において、エージェントが過去の経験から得た「現時点で最も報酬が高いとわかっている行動」ばかりを繰り返すと、より良い行動パターンを一生発見できなくなる危険性がある。この「探索と利用のトレードオフ」を解決するため、一定の確率で完全にランダムな行動を選択させることで未知の環境を開拓させる方策はどれか。
【正解の解説】
0 から 無限大
アジャイル開発とは、短い期間で開発と改善を繰り返し、素早く成果を出す柔軟な開発手法です。
スポンサーリンク
【その他の選択肢の解説】
0 から 1
プライバシー・バイ・デザインとは、システム開発の設計段階から、個人情報の保護や倫理的な課題を組み込み、リスクを未然に防ごうという考え方です。
-1 から 1
モデル監視とは、AIがデプロイされた後に、意図した通りに正しく動いているかを継続的に確認するプロセスです。
-無限大 から 無限大
概念実証(PoC)とは、新しい技術が実際にビジネスで有効かどうか、小規模な実験を通して確かめることです。