RLHF
Reinforcement Learning from Human Feedback
RLHF(人間のフィードバックによる強化学習)とは
ひとことで
AIの複数の回答を人間が比較・評価し、その評価を学習した「報酬モデル」を使って、より人間にとって好ましい回答を出すようモデルを強化学習で調整する手法。LLMを、役に立ち安全な対話ができるよう整える段階で使われる。
たとえると
新人の文章を、先輩が「こっちの書き方の方が良い」と何度も見比べて評価してあげるようなものです。新人は評価が高くなる書き方を少しずつ身につけ、言葉づかいや配慮も、職場で求められる形に近づいていきます。
現場ではこう使う
あるAI開発チームは、事前学習を終えたモデルが、質問に対してそっけない回答や不適切な回答をすることに悩んでいました。そこで、同じ質問への複数の回答を評価者が比べて順位を付け、その評価をもとにモデルを調整しました。その結果、回答がより丁寧で役に立つものになり、危険な依頼を断る振る舞いも身につきました。
試験のポイント
EXAM POINT「人間の評価(フィードバック)を使って、回答を人間の好みや価値観に合わせる」と出てきたらRLHFです。大量のテキストで基礎能力を作る事前学習の後に行われる調整の段階である点、人間の評価をもとに「報酬モデル」を作り、それを報酬として強化学習を行う流れを押さえましょう。正解ラベル付きのデータで学ぶ教師あり学習や、一般的な強化学習との違い(報酬の基準が人間の評価)も区別のポイントです。
混同しやすい用語との違い
- Pre-training大量のテキストで言語の基礎能力を作る最初の学習。RLHFはその後に行う調整
- Supervised Learning正解付きのデータで学ぶ手法。RLHFは人間が回答を比べた評価から作った報酬モデルを手がかりに学ぶ
- Fine-tuning追加データでモデルを調整すること全般。RLHFは人間の評価を使う調整方法の1つ