マルテクテクBETA 生成AIパスポート
トップ / 生成AIパスポート / 用語辞書 / Reinforcement Learning
Reinforcement Learning
Reinforcement Learning

Reinforcement Learning(強化学習)とは

ひとことで

AI(エージェント)が環境の中で行動し、その結果として得られる報酬が最大になるように、試行錯誤を通じて最適な行動の方針を学ぶ機械学習の手法。

たとえると

犬にお手を教えるとき、うまくできたらおやつをあげ、できなかったらあげない、を繰り返すようなものです。犬は正解を言葉で教わるのではなく、「どうするとおやつ(報酬)がもらえるか」を経験から学んでいきます。

現場ではこう使う

物流倉庫では、ピッキングロボットの動き方を強化学習で改善しています。ロボットはシミュレーション上で何度も経路を試し、短時間で正確に荷物を集められたときに高い報酬を受け取ります。試行錯誤を重ねた結果、人が設計したルールよりも効率の良い動き方を身につけました。

試験のポイント

EXAM POINT「報酬」「試行錯誤」「エージェントが環境の中で行動」と出てきたら強化学習です。囲碁や将棋のAI、ロボット制御などが代表例で、正解ラベルを与える教師あり学習との違いが問われます。生成AIでは、人の評価を報酬として使うRLHFにも強化学習の考え方が使われていることを押さえましょう。

混同しやすい用語との違い

  • Supervised Learning入力と正解の組で学ぶ。強化学習は正解ではなく報酬を手がかりに学ぶ
  • RLHF人の評価を報酬として使い、LLMの応答を人の好みに沿うよう調整する手法。強化学習の応用の一つ
  • AI AgentLLMを使って計画やツール利用を繰り返し、タスクを進める仕組み。強化学習でいう「エージェント」(行動する主体)とは文脈が異なる

関連用語

広告

Reinforcement Learning が出てくる 生成AIパスポート の問題に挑戦してみましょう。

無料で演習を始める