当你把“什么是人类反馈强化学习(RLHF)?”与实际决策联系起来理解,而不是把它当作又一个 AI 流行词时,这个概念会更容易使用。本篇 AI Tools Radar 指南聚焦其运作原理、重要取舍,以及在采用工具或工作流前值得提出的问题。

人类反馈强化学习(RLHF)将大语言模型从流畅但不可靠的文本生成器转变为能遵循指令的助手。它通过收集人类对模型输出的评分、训练一个预测这些评分的独立模型,再利用强化学习推动原始模型向高评分回复靠近。

在 OpenAI 使用它创建 ChatGPT 后,这一方法广为人知。没有 RLHF 时,早期模型常生成语法正确却无关、重复或不安全的文本。加入人类反馈,为开发者提供了使模型行为与用户期望对齐的实用途径。

要点。 • RLHF 是一条三步流程:从监督微调开始,加入基于人工评分训练的奖励模型,最后通过 PPO 进行强化学习。 • 人工评分者提供唯一的事实来源;奖励模型只是学习模仿他们的偏好。 • 最终优化阶段无需更多标注文本数据就能改善回复质量。 • RLHF 有局限:它可能编码评分者偏见,也不保证事实准确性。 • 使用大模型的人应了解这些步骤,因为大多数公开聊天系统现在都依赖它们。

人类反馈强化学习的定义。

人类反馈强化学习是一种使语言模型输出与人类判断对齐的训练技术。它将演示数据上的监督学习与由奖励模型引导的强化学习结合,奖励模型会根据人类偏好给回复评分(Ouyang 等人,2022)。该方法由三部分定义:首先需要能生成文本的初始模型;其次需要在人工输出排序上训练的独立奖励模型;最后使用强化学习算法(最常见是 PPO,Schulman 等人,2017)更新原始模型,使输出获得更高奖励分数。

它不同于标准监督微调,因为它优化的是学得的偏好函数而非固定标签;它也不同于纯强化学习,因为奖励信号来自人类数据而不是工程化环境。

人类反馈强化学习如何工作。

流程包含三个连续阶段,每个阶段都建立在前一阶段之上。

阶段 1:在演示数据上进行监督微调。 在 InstructGPT 论文中,40 名标注者写了 12000 个演示回复。随后使用标准监督学习在这个新数据集上微调基础模型。结果模型生成的文本比原始预训练版本更连贯、更能遵循指令。Anthropic 的 Constitutional AI 则在此阶段加入 AI 生成的批评,以减少对人工演示的依赖。

阶段 2:训练奖励模型。 微调后的模型会为同一提示词生成多个候选回复。人工评分者将这些回复从最好排到最差。这些排序成为第二个模型的训练数据,它的唯一职责是预测人类会偏好哪个回复。奖励模型不生成文本,只输出一个标量分数。

阶段 3:使用 PPO 进行强化学习。 原始模型用 PPO 更新,同时将奖励模型视为反馈来源。每一轮中,模型采样回复,奖励模型评分,PPO 调整模型权重以提高高分输出的概率。KL 惩罚项可防止模型偏离监督学习的起点太远。

大部分对齐改进发生在最后阶段。它允许模型探索演示数据中从未明确展示过的回复风格。

人类反馈强化学习与仅监督微调的比较。

训练信号 • RLHF:使用为新回复评分的学习型奖励模型。 • 监督微调:仅使用固定的人工编写标签。

数据效率 • RLHF:可借助收集成本低于完整演示的排序数据改善质量。 • 监督微调:每个提示词都需要完整正确的回复。

过度优化风险 • RLHF:若奖励模型较弱,可能过拟合评分者偏好。 • 监督微调:仅限于标注集合中的模式。

何时选择各方法 当高质量演示数据充足时使用监督微调;当需要模型泛化到提供示例之外,且收集两两排序快于编写完整答案时,转向 RLHF。

人工排序与奖励分数示例。

提示词:“向 10 岁孩子解释量子计算。” 回复 A:“量子计算使用能同时处于两种状态的微小粒子,就像旋转的硬币。”(评分者排序:1;奖励模型分数:0.92) 回复 B:“它是一种基于量子力学原理(包括叠加态)的计算机。”(评分者排序:2;奖励模型分数:0.71) 回复 C:“量子比特在计算上比普通比特更好。”(评分者排序:3;奖励模型分数:0.45)

奖励黑客行为发生于模型利用奖励模型缺陷时,例如生成冗长却空洞、但评分者最初给了高分的答案。当 PPO 训练导致模型在无关提示词中反复使用同样的高分措辞、降低输出多样性时,就会出现模式坍缩。

客户支持团队使用经 RLHF 训练的模型生成符合公司语气指南的回复。研究人员将同一流程应用于科学写作助手,使摘要遵循领域专家表达的引文准确性偏好。模型提供商的安全团队依赖 RLHF,通过在违反政策与遵守政策的回复对上训练奖励模型,减少有毒或有偏见输出。

关于人类反馈强化学习的常见问题。

答:不能。奖励模型只学习人类对风格、有帮助程度和安全性的偏好。除非评分者明确惩罚不准确性,否则它不会验证事实。

答:奖励模型阶段通常需要数万条排序比较。确切数量取决于回复多样性和评分者一致性。

答:它会减少不受欢迎回复的出现频率,但无法完全消除。评分者分歧和奖励模型错误会留下残余风险。

答:多数公开系统使用 PPO,但研究人员也测试了跳过独立奖励模型的 DPO 等替代方案。PPO 仍是默认选择,因为它稳定且得到充分理解。

问:RLHF 会永久改变模型权重吗?

答:会。发布给用户的最终模型包含在 PPO 阶段更新后的权重。推理时不会运行外部奖励模型。

实际检验标准是:这种方法能否改善某项可重复的工作,同时不掩盖其来源、成本或失效模式。先从一项有代表性的任务开始;在错误影响重大的地方保留人工检查点;并随着模型和产品变化重新评估结果。

我们的编辑方法

我们会结合一手资料、产品文档与实际使用场景,帮助你更清楚地判断工具是否适合你的工作流。

浏览工具目录