Reinforcement Learning
Reinforcement Learning
Reinforcement Learning(強化学習)とは
ひとことで
AI(エージェント)が環境の中で行動し、その結果として得られる報酬が最大になるように、試行錯誤を通じて最適な行動の方針を学ぶ機械学習の手法。
たとえると
犬にお手を教えるとき、うまくできたらおやつをあげ、できなかったらあげない、を繰り返すようなものです。犬は正解を言葉で教わるのではなく、「どうするとおやつ(報酬)がもらえるか」を経験から学んでいきます。
現場ではこう使う
物流倉庫では、ピッキングロボットの動き方を強化学習で改善しています。ロボットはシミュレーション上で何度も経路を試し、短時間で正確に荷物を集められたときに高い報酬を受け取ります。試行錯誤を重ねた結果、人が設計したルールよりも効率の良い動き方を身につけました。
試験のポイント
EXAM POINT「報酬」「試行錯誤」「エージェントが環境の中で行動」と出てきたら強化学習です。囲碁や将棋のAI、ロボット制御などが代表例で、正解ラベルを与える教師あり学習との違いが問われます。生成AIでは、人の評価を報酬として使うRLHFにも強化学習の考え方が使われていることを押さえましょう。
混同しやすい用語との違い
- Supervised Learning入力と正解の組で学ぶ。強化学習は正解ではなく報酬を手がかりに学ぶ
- RLHF人の評価を報酬として使い、LLMの応答を人の好みに沿うよう調整する手法。強化学習の応用の一つ
- AI AgentLLMを使って計画やツール利用を繰り返し、タスクを進める仕組み。強化学習でいう「エージェント」(行動する主体)とは文脈が異なる