AI基礎

強化学習とは?

読み: きょうかがくしゅう英語: Reinforcement Learning更新日: 2026-06-23

強化学習とは、エージェントが環境で行動し、得られる報酬を最大化するように学習する方法です。

生成AIパスポートG検定AWS AI Practitioner

関連表記: 強化学習 / Reinforcement Learning / RL / 報酬

試験で問われるポイント

  • 教師あり学習の正解ラベルではなく、報酬を手がかりにします。
  • ゲームAI、ロボット制御、最適化問題などで使われます。
  • 生成AI文脈ではRLHFとの関係も押さえたい用語です。

具体例

ゲームで高得点を取る行動を試行錯誤しながら学ぶAIが例です。

混同しやすい点

  • 報酬を正解ラベルと同じ意味で扱う。
  • 強化学習は生成AIだけに使われると考える。

関連問題で復習

AWS AI PractitionerAI・機械学習の基礎

強化学習の学習の仕組みを説明するものとして、最も適切なものはどれですか。

G検定機械学習の概要・具体的手法

強化学習の基本構成として、最も適切なものはどれか。

G検定ディープラーニングの応用例

シミュレータでロボット歩行を学習し、実機へ移したい。深層強化学習の活用として最も適切なものはどれか。

生成AIパスポートAI(人工知能)

強化学習の説明として最も適切なものはどれか。

AWS AI Practitioner基盤モデルの活用

生成AIモデルの調整手法である「RLHF(人間のフィードバックによる強化学習)」の説明として、最も適切なものはどれですか。

DS検定データサイエンス

倉庫ロボットが荷物を運び、遅延と電池切れを避けながら長期的な得点を高める。強化学習の要素と教師あり学習との違いの説明として最も適切なものはどれか。

G検定機械学習の概要・具体的手法

強化学習の方法Aでは、状態と行動の組に対する将来報酬の見積りを更新し、その見積りを用いて行動を選ぶ。方法Bでは、経験した報酬を使って各行動を選ぶ確率を定めるパラメータを直接更新する。対応として正しいものはどれか。

生成AIパスポート生成AI(ジェネレーティブAI)

RLHFにおける「Human Feedback」の利用方法として最も適切なものはどれか。

関連用語