¿Qué es el aprendizaje por refuerzo con retroalimentación humana (RLHF)? resulta más útil cuando el concepto se vincula a una decisión real, en lugar de tratarse como otra palabra de moda de la IA. Esta guía de AI Tools Radar se centra en la idea operativa, las concesiones que importan y las preguntas que conviene plantearse antes de adoptar una herramienta o un flujo de trabajo.

El aprendizaje por refuerzo con retroalimentación humana (RLHF) es el método que convirtió los modelos de lenguaje grandes, de generadores de texto fluidos pero poco fiables, en asistentes que siguen instrucciones. Funciona recopilando valoraciones humanas sobre las salidas del modelo, entrenando un modelo aparte para predecir esas valoraciones y utilizando después aprendizaje por refuerzo para orientar el modelo original hacia respuestas mejor valoradas.

Este enfoque se hizo ampliamente conocido después de que OpenAI lo utilizara para crear ChatGPT. Sin RLHF, los modelos anteriores solían producir texto gramaticalmente correcto pero irrelevante, repetitivo o inseguro. Añadir retroalimentación humana dio a los desarrolladores una forma práctica de alinear el comportamiento del modelo con las expectativas de los usuarios.

Ideas clave. • RLHF es una canalización de tres pasos que comienza con ajuste supervisado, añade un modelo de recompensa entrenado con valoraciones humanas y termina con aprendizaje por refuerzo mediante PPO. • Los evaluadores humanos proporcionan la única fuente de verdad; el modelo de recompensa solo aprende a imitar sus preferencias. • La fase final de optimización mejora la calidad de respuesta sin requerir más datos de texto etiquetados. • RLHF tiene límites: puede codificar sesgos de los evaluadores y no garantiza la exactitud factual. • Cualquiera que trabaje con modelos grandes debería comprender estos pasos, porque la mayoría de los sistemas de chat públicos depende ahora de ellos.

Definición de aprendizaje por refuerzo con retroalimentación humana (RLHF).

El aprendizaje por refuerzo con retroalimentación humana (RLHF) es una técnica de entrenamiento que alinea las salidas de un modelo de lenguaje con los juicios humanos. Combina aprendizaje supervisado sobre datos de demostración con aprendizaje por refuerzo guiado por un modelo de recompensa que puntúa las respuestas según las preferencias humanas (Ouyang et al., 2022). Tres elementos definen el enfoque. Primero, requiere un modelo inicial que ya pueda generar texto. Segundo, necesita un modelo de recompensa separado entrenado con clasificaciones humanas de salidas. Tercero, usa un algoritmo de aprendizaje por refuerzo, con mayor frecuencia PPO (Schulman et al., 2017), para actualizar el modelo original de modo que sus salidas reciban puntuaciones de recompensa más altas.

El método se diferencia del ajuste supervisado estándar porque optimiza para una función de preferencias aprendida, no para etiquetas fijas. También se diferencia del aprendizaje por refuerzo puro porque la señal de recompensa procede de datos humanos, no de un entorno diseñado.

Cómo funciona el aprendizaje por refuerzo con retroalimentación humana (RLHF).

El proceso sigue tres etapas secuenciales. Cada etapa se apoya en la anterior.

Etapa 1: ajuste supervisado con datos de demostración. En el artículo de InstructGPT, 40 etiquetadores redactaron 12.000 respuestas de demostración. Después, el modelo base se ajusta con este nuevo conjunto de datos mediante aprendizaje supervisado estándar. El resultado es un modelo que produce texto más coherente y que sigue mejor las instrucciones que la versión original preentrenada. La IA constitucional de Anthropic amplía esta etapa con críticas generadas por IA para reducir la dependencia de demostraciones escritas por humanos.

Etapa 2: entrenamiento del modelo de recompensa. El modelo ajustado genera varias respuestas candidatas para el mismo prompt. Los evaluadores humanos clasifican esas respuestas de mejor a peor. Estas clasificaciones se convierten en datos de entrenamiento para un segundo modelo cuya única tarea es predecir qué respuesta preferiría una persona. El modelo de recompensa no genera texto; solo produce una puntuación escalar.

Etapa 3: aprendizaje por refuerzo con PPO. El modelo original se actualiza mediante PPO y trata el modelo de recompensa como fuente de retroalimentación. En cada ronda, el modelo genera muestras de respuestas, el modelo de recompensa las puntúa y PPO ajusta los pesos del modelo para aumentar la probabilidad de salidas con puntuación alta. Un término de penalización KL evita que el modelo se aleje demasiado de su punto de partida supervisado.

Esta etapa final es donde se produce la mayor parte de la mejora de alineación. Permite al modelo explorar estilos de respuesta que nunca se mostraron explícitamente en los datos de demostración.

El aprendizaje por refuerzo con retroalimentación humana (RLHF) frente al ajuste supervisado por sí solo.

Señal de entrenamiento • RLHF: usa un modelo de recompensa aprendido que puntúa respuestas nuevas. • Ajuste supervisado: usa solo etiquetas fijas escritas por humanos.

Eficiencia de datos • RLHF: puede mejorar la calidad con datos de clasificación que son más baratos de recoger que demostraciones completas. • Ajuste supervisado: requiere respuestas completas y correctas para cada prompt.

Riesgo de sobreoptimización • RLHF: puede sobreajustarse a las preferencias de los evaluadores si el modelo de recompensa es débil. • Ajuste supervisado: se limita a patrones presentes en el conjunto etiquetado.

Cuándo elegir cada enfoque Usa ajuste supervisado cuando abunden los datos de demostración de alta calidad. Pasa a RLHF cuando necesites que el modelo generalice más allá de los ejemplos proporcionados y cuando recopilar clasificaciones por pares sea más rápido que escribir respuestas completas.

Ejemplo trabajado de clasificación humana y puntuaciones de recompensa.

Prompt: «Explica la computación cuántica a un niño de 10 años». Respuesta A: «La computación cuántica usa partículas diminutas que pueden estar en dos estados a la vez, como una moneda que gira». (Clasificación del evaluador: 1; puntuación del modelo de recompensa: 0,92) Respuesta B: «Es un tipo de ordenador basado en principios de mecánica cuántica, incluida la superposición». (Clasificación del evaluador: 2; puntuación del modelo de recompensa: 0,71) Respuesta C: «Los bits cuánticos son mejores que los bits normales para los cálculos». (Clasificación del evaluador: 3; puntuación del modelo de recompensa: 0,45)

La manipulación de recompensa ocurre cuando el modelo explota defectos del modelo de recompensa, por ejemplo generando respuestas extensas pero vacías que los evaluadores inicialmente puntuaron alto. El colapso de modos aparece cuando el entrenamiento con PPO hace que el modelo repita la misma redacción de alta puntuación en prompts no relacionados, reduciendo la diversidad de salida.

Los equipos de atención al cliente usan modelos entrenados con RLHF para producir respuestas que se ajustan a las pautas de tono de la empresa. Los investigadores aplican la misma canalización a asistentes de escritura científica para que los resúmenes respeten las preferencias de exactitud de las citas expresadas por expertos del área. Los equipos de seguridad de los proveedores de modelos dependen de RLHF para reducir salidas tóxicas o sesgadas al entrenar modelos de recompensa con pares que vulneran o cumplen las políticas.

Preguntas frecuentes sobre el aprendizaje por refuerzo con retroalimentación humana (RLHF).

R: No. El modelo de recompensa solo aprende preferencias humanas sobre estilo, utilidad y seguridad. No verifica hechos, a menos que los evaluadores penalicen explícitamente las inexactitudes.

R: La etapa de modelo de recompensa suele requerir decenas de miles de comparaciones clasificadas. El número exacto depende de la diversidad de las respuestas y de la coherencia de los evaluadores.

R: Reduce la frecuencia de respuestas no deseadas, pero no puede eliminarlas por completo. El desacuerdo entre evaluadores y los errores del modelo de recompensa dejan un riesgo residual.

R: La mayoría de los sistemas públicos usa PPO, pero los investigadores han probado alternativas como DPO que omiten el modelo de recompensa separado. PPO sigue siendo la opción predeterminada porque es estable y se entiende bien.

P: ¿RLHF cambia los pesos del modelo de forma permanente?

R: Sí. El modelo final que se entrega a los usuarios contiene los pesos actualizados durante la etapa PPO. No se ejecuta ningún modelo de recompensa externo en el momento de la inferencia.

La prueba práctica consiste en comprobar si este enfoque mejora una parte repetible del trabajo sin ocultar sus fuentes, costes ni modos de fallo. Empieza con una tarea representativa, conserva un punto de control humano donde los errores importen y vuelve a evaluar el resultado a medida que cambien los modelos y los productos.

Nuestro enfoque editorial

Combinamos fuentes primarias, documentación de producto y casos de uso reales para ayudarte a valorar si una herramienta encaja en tu flujo de trabajo.

Explorar el directorio de herramientas