Q-Learning
Q-Learning
Q-Learning(Q学習)とは
ひとことで
強化学習の代表的な手法の1つで、ある状態である行動をとったときに将来得られる報酬の見込み(Q値)を、試行錯誤を通じて更新しながら学ぶ。各状態でQ値が最も高い行動を選ぶことで、良い行動の方針を得る。
たとえると
初めての街で、交差点ごとに「ここを右に曲がるとおいしい店にたどり着けそうか」をメモ帳に点数で書き込み、歩くたびに点数を書き直していくようなものです。何度も歩くうちに、どの交差点でどちらへ曲がればよいかがわかってきます。
現場ではこう使う
物流倉庫では、搬送ロボットの経路選びを改善するためにQ学習をシミュレーション上で試しました。目的地に早く着くと報酬、棚にぶつかると罰則を与えて試行錯誤を重ねた結果、ロボットは混雑しやすい通路を避ける経路を選ぶようになりました。実機への導入は安全確認を経て段階的に進めることにしました。
試験のポイント
EXAM POINT「状態と行動の組み合わせの価値(Q値)を学習」「試行錯誤」「報酬」と出てきたらQ学習です。Q値をニューラルネットワークで近似したDQN(Deep Q-Network)が、ゲームで人間並みのプレイを実現したことも問われます。新しい行動を試す「探索」と、今の知識で最善の行動を選ぶ「活用」のバランスを取る考え方(ε-greedy法など)もセットで覚えましょう。
混同しやすい用語との違い
- Reinforcement Learning報酬を最大化するように学ぶ機械学習の分野全体。Q学習はその中の具体的な手法の1つ
- Supervised Learning正解ラベル付きのデータから学ぶ。Q学習は正解ではなく報酬をもとに学ぶ