Uczenie ze wzmocnieniem na podstawie informacji zwrotnej od ludzi, czyli RLHF, łatwiej zrozumieć, gdy powiąże się tę koncepcję z realną decyzją, zamiast traktować jako kolejne modne hasło. Ten przewodnik AI Tools Radar skupia się na praktycznej idei, istotnych kompromisach i pytaniach, które warto zadać przed wdrożeniem narzędzia lub procesu pracy.

RLHF to metoda, która zmieniła duże modele językowe z płynnych, lecz zawodnych generatorów tekstu w asystentów wykonujących instrukcje. Zbiera oceny ludzi dotyczące wyników modelu, trenuje osobny model do przewidywania tych ocen, a następnie wykorzystuje uczenie ze wzmocnieniem, aby kierować pierwotny model ku wyżej ocenianym odpowiedziom.

Podejście stało się szeroko znane, gdy OpenAI wykorzystało je do stworzenia ChatGPT. Bez RLHF wcześniejsze modele często generowały tekst poprawny gramatycznie, ale nieistotny, powtarzalny lub niebezpieczny. Informacja zwrotna od ludzi zapewniła programistom praktyczny sposób dopasowania zachowania modelu do oczekiwań użytkowników.

Najważniejsze wnioski. • RLHF jest trzyetapowym procesem: zaczyna się od nadzorowanego dostrajania, dodaje model nagrody trenowany na ocenach ludzi i kończy uczeniem ze wzmocnieniem przez PPO. • Jedynym źródłem prawdy są osoby oceniające; model nagrody uczy się jedynie naśladować ich preferencje. • Końcowa optymalizacja poprawia jakość odpowiedzi bez potrzeby dodawania oznaczonych danych tekstowych. • RLHF ma ograniczenia: może utrwalać uprzedzenia oceniających i nie gwarantuje poprawności faktów. • Każdy pracujący z dużymi modelami powinien rozumieć te kroki, ponieważ korzysta z nich większość publicznych systemów czatowych.

Definicja RLHF.

RLHF to technika treningowa dopasowująca wyniki modelu językowego do ludzkich ocen. Łączy nadzorowane uczenie na danych demonstracyjnych z uczeniem ze wzmocnieniem kierowanym przez model nagrody, który ocenia odpowiedzi według preferencji ludzi (Ouyang i in., 2022). Podejście definiują trzy elementy. Po pierwsze, wymaga początkowego modelu zdolnego już generować tekst. Po drugie, potrzebuje osobnego modelu nagrody trenowanego na ludzkich rankingach wyników. Po trzecie, wykorzystuje algorytm uczenia ze wzmocnieniem, najczęściej PPO (Schulman i in., 2017), do aktualizacji pierwotnego modelu, aby jego wyniki otrzymywały wyższe nagrody.

Metoda różni się od standardowego nadzorowanego dostrajania, ponieważ optymalizuje wyuczoną funkcję preferencji, a nie stałe etykiety. Różni się też od czystego uczenia ze wzmocnieniem, gdyż sygnał nagrody pochodzi z danych ludzkich, a nie zaprojektowanego środowiska.

Jak działa RLHF.

Proces obejmuje trzy następujące po sobie etapy. Każdy opiera się na poprzednim.

Etap 1: nadzorowane dostrajanie na danych demonstracyjnych. W pracy o InstructGPT 40 osób przygotowało 12 tysięcy przykładowych odpowiedzi. Model podstawowy został następnie dostrojony na tym zbiorze za pomocą standardowego uczenia nadzorowanego. Rezultatem jest model tworzący bardziej spójny tekst i lepiej wykonujący instrukcje niż pierwotna wersja po pretreningu. Constitutional AI firmy Anthropic rozszerza ten etap o krytykę generowaną przez AI, ograniczając zależność od demonstracji pisanych przez ludzi.

Etap 2: trening modelu nagrody. Dostrojony model generuje kilka odpowiedzi kandydujących dla tego samego promptu. Ludzie szeregują je od najlepszej do najgorszej. Rankingi stają się danymi treningowymi dla drugiego modelu, którego jedynym zadaniem jest przewidzenie odpowiedzi preferowanej przez człowieka. Model nagrody nie generuje tekstu, lecz zwraca jedną wartość liczbową.

Etap 3: uczenie ze wzmocnieniem za pomocą PPO. Pierwotny model jest aktualizowany przez PPO, a model nagrody stanowi źródło informacji zwrotnej. W każdej rundzie model losuje odpowiedzi, model nagrody je ocenia, a PPO zmienia wagi, aby zwiększyć prawdopodobieństwo wyników o wysokiej ocenie. Składnik kary KL zapobiega zbyt dużemu oddaleniu od punktu początkowego po treningu nadzorowanym.

Na tym końcowym etapie zachodzi większość poprawy dopasowania. Pozwala on modelowi odkrywać style odpowiedzi, których nie pokazano bezpośrednio w danych demonstracyjnych.

RLHF w porównaniu z samym nadzorowanym dostrajaniem.

Sygnał treningowy • RLHF: wykorzystuje wyuczony model nagrody oceniający nowe odpowiedzi. • Nadzorowane dostrajanie: używa wyłącznie stałych etykiet napisanych przez ludzi.

Efektywność danych • RLHF: może poprawiać jakość za pomocą rankingów, których zebranie jest tańsze niż pełnych demonstracji. • Nadzorowane dostrajanie: wymaga kompletnych prawidłowych odpowiedzi dla każdego promptu.

Ryzyko nadmiernej optymalizacji • RLHF: przy słabym modelu nagrody może nadmiernie dopasować się do preferencji oceniających. • Nadzorowane dostrajanie: ogranicza się do wzorców występujących w oznaczonym zbiorze.

Kiedy wybrać każde podejście Użyj nadzorowanego dostrajania, gdy masz dużo wysokiej jakości demonstracji. Przejdź do RLHF, gdy model ma uogólniać poza podane przykłady, a zbieranie porównań parami jest szybsze niż pisanie pełnych odpowiedzi.

Przykład rankingu ludzi i ocen modelu nagrody.

Prompt: „Wyjaśnij obliczenia kwantowe dziesięciolatkowi”. Odpowiedź A: „Obliczenia kwantowe wykorzystują maleńkie cząstki, które mogą być jednocześnie w dwóch stanach, jak obracająca się moneta” (miejsce 1, ocena modelu nagrody: 0,92). Odpowiedź B: „To rodzaj komputera oparty na zasadach mechaniki kwantowej, w tym superpozycji” (miejsce 2, ocena: 0,71). Odpowiedź C: „Bity kwantowe są lepsze od zwykłych bitów w obliczeniach” (miejsce 3, ocena: 0,45).

Hakowanie nagrody występuje, gdy model wykorzystuje wady modelu nagrody, na przykład tworzy rozwlekłe, lecz puste odpowiedzi, które początkowo były wysoko oceniane. Załamanie różnorodności pojawia się, gdy trening PPO skłania model do powtarzania tego samego wysoko ocenianego sformułowania w niepowiązanych promptach.

Zespoły obsługi klienta używają modeli po RLHF do tworzenia odpowiedzi zgodnych z tonem firmy. Badacze stosują ten proces w asystentach pisania naukowego, aby podsumowania przestrzegały preferencji ekspertów dotyczących poprawności cytowań. Zespoły bezpieczeństwa dostawców modeli wykorzystują RLHF do ograniczania toksycznych lub stronniczych wyników, trenując modele nagrody na parach naruszających zasady i zgodnych z nimi.

Najczęstsze pytania o RLHF.

Odpowiedź: nie. Model nagrody uczy się wyłącznie ludzkich preferencji dotyczących stylu, pomocności i bezpieczeństwa. Nie sprawdza faktów, chyba że oceniający wyraźnie karzą nieścisłości.

Odpowiedź: etap modelu nagrody zwykle wymaga dziesiątek tysięcy uszeregowanych porównań. Dokładna liczba zależy od różnorodności odpowiedzi i spójności oceniających.

Odpowiedź: zmniejsza częstotliwość niepożądanych wyników, ale nie eliminuje ich całkowicie. Rozbieżności między oceniającymi i błędy modelu nagrody pozostawiają ryzyko.

Odpowiedź: większość publicznych systemów korzysta z PPO, lecz badacze testują alternatywy, takie jak DPO, które pomijają osobny model nagrody. PPO pozostaje standardem, ponieważ jest stabilne i dobrze poznane.

Pytanie: czy RLHF trwale zmienia wagi modelu?

Odpowiedź: tak. Końcowy model udostępniany użytkownikom zawiera wagi zaktualizowane podczas etapu PPO. W czasie wnioskowania nie działa żaden zewnętrzny model nagrody.

Praktyczny sprawdzian polega na ustaleniu, czy to podejście usprawnia powtarzalny fragment pracy, nie ukrywając źródeł, kosztów ani możliwych awarii. Zacznij od reprezentatywnego zadania, pozostaw kontrolę człowieka tam, gdzie błędy mają znaczenie, i oceniaj wyniki ponownie wraz ze zmianami modeli i produktów.

Jak pracuje redakcja

Łączymy źródła pierwotne, dokumentację produktów i rzeczywiste scenariusze użycia, aby ułatwić Ci ocenę, czy dane narzędzie pasuje do Twojego sposobu pracy.

Przeglądaj katalog narzędzi