Che cos'è l'apprendimento per rinforzo dal feedback umano (RLHF)? è più facile da usare quando il concetto viene collegato a una decisione reale, anziché trattato come l'ennesima parola d'ordine dell'IA. Questa guida di AI Tools Radar si concentra sull'idea operativa, sui compromessi che contano e sulle domande da porsi prima di adottare uno strumento o un flusso di lavoro.

L'RLHF, apprendimento per rinforzo dal feedback umano, è il metodo che ha trasformato i grandi modelli linguistici da generatori di testo fluenti ma inaffidabili in assistenti che seguono le istruzioni. Funziona raccogliendo valutazioni umane sugli output del modello, addestrando un modello separato a prevedere tali valutazioni e usando poi l'apprendimento per rinforzo per spingere il modello originale verso risposte con valutazioni più alte.

Questo approccio è diventato ampiamente noto dopo che OpenAI lo ha usato per creare ChatGPT. Senza RLHF, i modelli precedenti producevano spesso testo grammaticalmente corretto ma irrilevante, ripetitivo o non sicuro. L'aggiunta del feedback umano ha dato agli sviluppatori un modo pratico per allineare il comportamento del modello alle aspettative degli utenti.

Punti chiave. • L'RLHF è una pipeline in tre fasi: inizia con il fine-tuning supervisionato, aggiunge un modello di ricompensa addestrato sulle valutazioni umane e termina con l'apprendimento per rinforzo tramite PPO. • I valutatori umani forniscono l'unica fonte di verità; il modello di ricompensa impara semplicemente a imitarne le preferenze. • L'ottimizzazione finale migliora la qualità delle risposte senza richiedere più dati testuali etichettati. • L'RLHF ha limiti: può incorporare i pregiudizi dei valutatori e non garantisce l'accuratezza fattuale. • Chi lavora con modelli di grandi dimensioni dovrebbe comprenderne le fasi, poiché oggi la maggior parte dei sistemi chat pubblici vi si basa.

Definizione di apprendimento per rinforzo dal feedback umano (RLHF).

L'RLHF è una tecnica di addestramento che allinea gli output dei modelli linguistici ai giudizi umani. Combina apprendimento supervisionato su dati dimostrativi con apprendimento per rinforzo guidato da un modello di ricompensa che assegna punteggi alle risposte in base alle preferenze umane (Ouyang e altri, 2022). Tre elementi definiscono l'approccio. Primo, richiede un modello iniziale che sappia già generare testo. Secondo, necessita di un modello di ricompensa separato, addestrato sulle classifiche umane degli output. Terzo, usa un algoritmo di apprendimento per rinforzo, più spesso PPO (Schulman e altri, 2017), per aggiornare il modello originale affinché i suoi output ricevano punteggi di ricompensa più alti.

Il metodo differisce dal fine-tuning supervisionato standard perché ottimizza una funzione di preferenza appresa, anziché etichette fisse. Differisce anche dall'apprendimento per rinforzo puro perché il segnale di ricompensa proviene da dati umani e non da un ambiente progettato.

Come funziona l'apprendimento per rinforzo dal feedback umano (RLHF).

Il processo segue tre fasi sequenziali. Ogni fase si basa sulla precedente.

Fase 1: fine-tuning supervisionato su dati dimostrativi. Nel paper InstructGPT, 40 annotatori hanno scritto 12.000 risposte dimostrative. Il modello di base viene quindi sottoposto a fine-tuning su questo nuovo dataset mediante apprendimento supervisionato standard. Il risultato è un modello che produce testo più coerente e più aderente alle istruzioni rispetto alla versione preaddestrata originale. L'IA costituzionale di Anthropic estende questa fase con critiche generate dall'IA per ridurre la dipendenza da dimostrazioni scritte da umani.

Fase 2: addestramento del modello di ricompensa. Il modello sottoposto a fine-tuning genera più risposte candidate per lo stesso prompt. I valutatori umani ordinano queste risposte dalla migliore alla peggiore. Tali classifiche diventano dati di addestramento per un secondo modello, il cui unico compito è prevedere quale risposta preferirebbe un umano. Il modello di ricompensa non genera testo; produce solo un punteggio scalare.

Fase 3: apprendimento per rinforzo con PPO. Il modello originale viene aggiornato con PPO, trattando il modello di ricompensa come fonte di feedback. A ogni ciclo il modello campiona risposte, il modello di ricompensa le valuta e PPO modifica i pesi del modello per aumentare la probabilità di output con punteggio elevato. Un termine di penalità KL impedisce al modello di allontanarsi troppo dal punto di partenza supervisionato.

Questa fase finale è quella in cui si verifica la maggior parte del miglioramento dell'allineamento. Consente al modello di esplorare stili di risposta mai mostrati esplicitamente nei dati dimostrativi.

Confronto fra RLHF e solo fine-tuning supervisionato.

Segnale di addestramento • RLHF: usa un modello di ricompensa appreso che assegna punteggi a nuove risposte. • Fine-tuning supervisionato: usa soltanto etichette fisse scritte da umani.

Efficienza dei dati • RLHF: può migliorare la qualità con dati di classificazione più economici da raccogliere rispetto a dimostrazioni complete. • Fine-tuning supervisionato: richiede risposte complete e corrette per ogni prompt.

Rischio di sovraottimizzazione • RLHF: può adattarsi eccessivamente alle preferenze dei valutatori se il modello di ricompensa è debole. • Fine-tuning supervisionato: è limitato agli schemi presenti nell'insieme etichettato.

Quando scegliere ciascun approccio Usa il fine-tuning supervisionato quando sono abbondanti dati dimostrativi di alta qualità. Passa all'RLHF quando serve che il modello generalizzi oltre gli esempi forniti e quando raccogliere classifiche a coppie è più rapido che scrivere risposte complete.

Esempio svolto di classificazione umana e punteggi di ricompensa.

Prompt: «Spiega il calcolo quantistico a un bambino di 10 anni». Risposta A: «Il calcolo quantistico usa particelle piccolissime che possono trovarsi in due stati insieme, come una moneta che gira». (Posizione del valutatore: 1; punteggio del modello di ricompensa: 0,92) Risposta B: «È un tipo di computer basato sui principi della meccanica quantistica, inclusa la sovrapposizione». (Posizione del valutatore: 2; punteggio del modello di ricompensa: 0,71) Risposta C: «I bit quantistici sono migliori dei bit normali per i calcoli». (Posizione del valutatore: 3; punteggio del modello di ricompensa: 0,45)

Il reward hacking si verifica quando il modello sfrutta difetti del modello di ricompensa, ad esempio generando risposte prolisse ma vuote che inizialmente i valutatori hanno giudicato molto bene. Il collasso di modalità appare quando l'addestramento PPO fa ripetere al modello la stessa formulazione con punteggio elevato su prompt non correlati, riducendo la diversità dell'output.

I team di assistenza clienti usano modelli addestrati con RLHF per produrre risposte in linea con le linee guida di tono aziendali. I ricercatori applicano la stessa pipeline agli assistenti di scrittura scientifica, così i riassunti rispettano preferenze di accuratezza nelle citazioni espresse da esperti di dominio. I team di sicurezza dei fornitori di modelli si affidano all'RLHF per ridurre output tossici o distorti, addestrando modelli di ricompensa su coppie che violano o rispettano le politiche.

Domande comuni sull'apprendimento per rinforzo dal feedback umano (RLHF).

R: No. Il modello di ricompensa apprende solo preferenze umane su stile, utilità e sicurezza. Non verifica i fatti, a meno che i valutatori non penalizzino esplicitamente le inesattezze.

R: La fase del modello di ricompensa richiede di solito decine di migliaia di confronti classificati. Il numero esatto dipende dalla diversità delle risposte e dalla coerenza dei valutatori.

R: Riduce la frequenza delle risposte indesiderate, ma non può eliminarle completamente. Il disaccordo tra valutatori e gli errori del modello di ricompensa lasciano un rischio residuo.

R: La maggior parte dei sistemi pubblici usa PPO, ma i ricercatori hanno testato alternative come DPO, che saltano il modello di ricompensa separato. PPO resta l'impostazione predefinita perché è stabile e ben compresa.

D: L'RLHF modifica permanentemente i pesi del modello?

R: Sì. Il modello finale rilasciato agli utenti contiene i pesi aggiornati durante la fase PPO. Nessun modello di ricompensa esterno viene eseguito al momento dell'inferenza.

Il test pratico è capire se questo approccio migliora una parte ripetibile del lavoro senza nasconderne fonti, costi o modalità di errore. Parti da un compito rappresentativo, mantieni un controllo umano dove gli errori contano e rivaluta il risultato man mano che modelli e prodotti cambiano.

Il nostro metodo editoriale

Uniamo fonti primarie, documentazione dei prodotti e scenari d'uso reali per aiutarti a capire se uno strumento è adatto al tuo flusso di lavoro.

Esplora la directory degli strumenti