「人間のフィードバックによる強化学習(RLHF)とは何か」というテーマは、単なるAIの流行語として扱うのではなく、実際の意思決定と結び付けることで理解しやすくなります。このAI Tools Radarガイドでは、実務上の考え方、重要なトレードオフ、ツールやワークフローの導入前に確認すべき問いに焦点を当てます。

人間のフィードバックによる強化学習(RLHF)は、大規模言語モデルを、流暢ではあるものの信頼性に欠ける文章生成器から、指示に従うアシスタントへ変えた手法です。モデルの出力に対する人の評価を集め、その評価を予測する別のモデルを訓練し、強化学習を使って元のモデルをより高く評価される応答へ導きます。

OpenAIがChatGPTの開発に採用したことで、この手法は広く知られるようになりました。RLHFがなければ、初期のモデルは文法的に正しくても、無関係、反復的、または安全でない文章を生成することがよくありました。人のフィードバックを加えることで、開発者はモデルの挙動を利用者の期待に合わせる実用的な方法を得ました。

要点。 • RLHFは3段階のパイプラインです。教師あり微調整から始まり、人の評価で訓練した報酬モデルを加え、PPOによる強化学習で終わります。 • 唯一の正解源は人の評価者であり、報酬モデルはその選好を模倣することを学ぶだけです。 • 最終的な最適化段階では、ラベル付き文章データを追加せずに応答品質を改善できます。 • RLHFには限界があり、評価者の偏りを取り込む可能性があるほか、事実の正確性を保証しません。 • 現在、多くの公開チャットシステムがRLHFに依存しているため、大規模モデルを扱う人はこの手順を理解すべきです。

人間のフィードバックによる強化学習(RLHF)の定義。

RLHFは、言語モデルの出力を人の判断に合わせる訓練技法です。実演データを使う教師あり学習と、人の選好に基づいて応答を採点する報酬モデルに導かれる強化学習を組み合わせます(Ouyangほか、2022年)。この手法は3つの要素で定義されます。第1に、すでに文章を生成できる初期モデルが必要です。第2に、人が出力を順位付けしたデータで訓練する別の報酬モデルが必要です。第3に、一般にはPPO(Schulmanほか、2017年)という強化学習アルゴリズムを使い、元のモデルを更新して、出力の報酬スコアを高めます。

この手法は、固定ラベルではなく、学習した選好関数を最適化する点で標準的な教師あり微調整と異なります。また、報酬信号が人工的に設計した環境ではなく、人のデータから得られる点で、純粋な強化学習とも異なります。

人間のフィードバックによる強化学習(RLHF)の仕組み。

プロセスは順番に進む3つの段階で構成され、それぞれが前の段階を基盤とします。

第1段階:実演データによる教師あり微調整。 InstructGPTの論文では、40人のラベル作成者が1万2000件の実演応答を書きました。その後、標準的な教師あり学習を使い、この新しいデータセットで基盤モデルを微調整します。その結果、元の事前訓練済みモデルより一貫性があり、指示に従う文章を生成するモデルが得られます。AnthropicのConstitutional AIは、AIが生成した批評を加えることでこの段階を拡張し、人が書く実演への依存を減らします。

第2段階:報酬モデルの訓練。 微調整したモデルが、同じプロンプトに対して複数の回答候補を生成します。人の評価者が、それらを良いものから悪いものへ順位付けします。この順位が、どの応答を人が好むか予測することだけを目的とした第2のモデルの訓練データになります。報酬モデルは文章を生成せず、単一の数値スコアだけを出力します。

第3段階:PPOによる強化学習。 報酬モデルをフィードバック源として、PPOにより元のモデルを更新します。各ラウンドでモデルが応答をサンプリングし、報酬モデルが採点し、PPOがモデルの重みを調整して、高得点の出力が生じる確率を高めます。KLペナルティ項により、モデルが教師あり学習後の開始地点から離れすぎないようにします。

アラインメント改善の大半は、この最終段階で起こります。実演データに明示されていなかった応答スタイルを、モデルが探索できるためです。

人間のフィードバックによる強化学習(RLHF)と、教師あり微調整のみの場合の比較。

訓練信号 • RLHF:新しい応答を採点する、学習済みの報酬モデルを使います。 • 教師あり微調整:人が作成した固定ラベルだけを使います。

データ効率 • RLHF:完全な実演より安価に収集できる順位データで品質を改善できます。 • 教師あり微調整:すべてのプロンプトに対して完全な正解応答が必要です。

過剰最適化のリスク • RLHF:報酬モデルが弱い場合、評価者の選好に過剰適合する可能性があります。 • 教師あり微調整:ラベル付きデータセットに存在するパターンに限定されます。

各アプローチを選ぶ場面 高品質な実演データが豊富なら、教師あり微調整を使います。提示した例を超えてモデルを汎化させる必要があり、完全な回答を書くより一対比較の順位を集める方が速い場合は、RLHFへ移行します。

人の順位付けと報酬スコアの具体例。

プロンプト:「10歳の子どもに量子コンピューティングを説明してください」。 回答A:「量子コンピューティングでは、回転中のコインのように、2つの状態を同時に取れる小さな粒子を使います」(評価順位:1位、報酬モデルのスコア:0.92)。 回答B:「重ね合わせを含む量子力学の原理に基づくコンピューターの一種です」(評価順位:2位、報酬モデルのスコア:0.71)。 回答C:「量子ビットは、計算において通常のビットより優れています」(評価順位:3位、報酬モデルのスコア:0.45)。

報酬ハッキングは、当初評価者が高く採点した、長いものの中身がない回答を生成するなど、モデルが報酬モデルの欠陥を悪用したときに起こります。モード崩壊は、PPO訓練によって、無関係なプロンプトにも同じ高得点の表現を繰り返すようになり、出力の多様性が低下する現象です。

顧客サポートチームは、RLHFで訓練したモデルを使い、企業のトーン指針に合う返信を生成します。研究者は同じパイプラインを科学文章作成アシスタントに適用し、専門家が示した引用の正確性に関する選好を要約に反映させます。モデルプロバイダーの安全チームは、方針違反と方針準拠の応答ペアで報酬モデルを訓練し、有害または偏った出力を減らすためにRLHFを利用します。

人間のフィードバックによる強化学習(RLHF)に関するよくある質問。

回答:いいえ。報酬モデルが学習するのは、スタイル、有用性、安全性に関する人の選好だけです。評価者が不正確さを明示的に低く評価しない限り、事実を検証することはありません。

回答:報酬モデルの段階では通常、順位付けされた比較が数万件必要です。正確な件数は、応答の多様性と評価者の一貫性によって異なります。

回答:望ましくない応答の頻度は減りますが、完全には排除できません。評価者間の意見の相違と報酬モデルの誤りにより、リスクが残ります。

回答:多くの公開システムはPPOを使っていますが、研究者は別の報酬モデルを省くDPOなどの代替手法も試しています。PPOは安定しており、十分に理解されているため、現在も標準です。

質問:RLHFはモデルの重みを永続的に変更しますか?

回答:はい。利用者向けに公開される最終モデルには、PPO段階で更新された重みが含まれます。推論時に外部の報酬モデルが動作することはありません。

実用性を判断する基準は、情報源、コスト、失敗の可能性を隠すことなく、繰り返し行う作業を改善できるかどうかです。代表的なタスクから始め、間違いが重大になる場面には人による確認を残し、モデルや製品の変化に応じて結果を再評価しましょう。

編集方針

一次情報、製品ドキュメント、実際の利用シーンをもとに、あなたのワークフローに合うツールかどうかを判断しやすくする記事を作成しています。

ツールディレクトリを見る