인간 피드백 기반 강화학습(RLHF)을 이해하려면 이를 또 하나의 AI 유행어로 다루기보다 실제 의사결정과 연결해 보는 편이 쉽습니다. 이 AI Tools Radar 가이드는 핵심 작동 원리와 중요한 절충점, 도구나 워크플로를 도입하기 전에 물어야 할 질문에 초점을 맞춥니다.

인간 피드백 기반 강화학습(RLHF)은 대규모 언어 모델을 유창하지만 신뢰하기 어려운 텍스트 생성기에서 지시를 따르는 도우미로 바꾼 방법입니다. 모델 출력에 대한 사람의 평가를 수집하고, 그 평가를 예측하는 별도의 모델을 학습한 다음, 강화학습으로 원래 모델이 더 높은 평가를 받는 응답을 생성하도록 유도합니다.

이 접근법은 OpenAI가 ChatGPT를 만드는 데 사용하면서 널리 알려졌습니다. RLHF가 없던 초기 모델은 문법적으로는 맞지만 관련성이 없거나 반복적이고 안전하지 않은 텍스트를 자주 생성했습니다. 인간 피드백을 더함으로써 개발자는 모델의 행동을 사용자 기대에 맞출 실용적인 수단을 얻었습니다.

핵심 요점. • RLHF는 지도 미세 조정으로 시작해 인간 평가로 학습한 보상 모델을 추가하고, PPO를 통한 강화학습으로 마무리하는 3단계 파이프라인입니다. • 유일한 기준은 인간 평가자가 제공하며, 보상 모델은 그들의 선호를 모방하도록 학습할 뿐입니다. • 마지막 최적화 단계는 라벨이 붙은 텍스트 데이터를 더 요구하지 않고 응답 품질을 높입니다. • RLHF에는 한계가 있습니다. 평가자의 편향이 반영될 수 있으며 사실의 정확성을 보장하지 않습니다. • 현재 대부분의 공개 대화형 시스템이 이 방법에 의존하므로 대규모 모델을 다루는 사람이라면 이 단계를 이해해야 합니다.

인간 피드백 기반 강화학습(RLHF)의 정의.

인간 피드백 기반 강화학습(RLHF)은 언어 모델의 출력을 인간의 판단에 맞추는 학습 기법입니다. 시범 데이터에 대한 지도학습과 인간의 선호에 따라 응답에 점수를 매기는 보상 모델이 이끄는 강화학습을 결합합니다(Ouyang 외, 2022). 이 접근법은 세 요소로 정의됩니다. 첫째, 이미 텍스트를 생성할 수 있는 초기 모델이 필요합니다. 둘째, 출력에 대한 인간의 순위 평가로 학습한 별도의 보상 모델이 필요합니다. 셋째, 대부분 PPO(Schulman 외, 2017) 같은 강화학습 알고리즘으로 원래 모델을 업데이트해 출력이 더 높은 보상 점수를 받게 합니다.

이 방법은 고정된 라벨이 아니라 학습된 선호 함수를 최적화한다는 점에서 일반적인 지도 미세 조정과 다릅니다. 또한 보상 신호가 설계된 환경이 아닌 인간 데이터에서 나온다는 점에서 순수 강화학습과도 다릅니다.

인간 피드백 기반 강화학습(RLHF)의 작동 방식.

과정은 순차적인 세 단계로 진행되며, 각 단계는 이전 단계를 기반으로 합니다.

1단계: 시범 데이터로 지도 미세 조정. InstructGPT 논문에서는 라벨 작업자 40명이 시범 응답 1만 2천 개를 작성했습니다. 이후 표준 지도학습으로 기본 모델을 이 새 데이터셋에 맞게 미세 조정합니다. 그 결과 원래의 사전 학습 모델보다 더 일관되고 지시를 잘 따르는 텍스트를 생성하는 모델이 만들어집니다. Anthropic의 Constitutional AI는 인간이 작성한 시범에 대한 의존도를 줄이기 위해 AI가 생성한 비평을 이 단계에 추가합니다.

2단계: 보상 모델 학습. 미세 조정된 모델이 같은 프롬프트에 여러 후보 응답을 생성합니다. 인간 평가자는 이 응답을 가장 좋은 것부터 가장 나쁜 것까지 순위를 매깁니다. 이 순위는 사람이 어떤 응답을 선호할지 예측하는 일만 담당하는 두 번째 모델의 학습 데이터가 됩니다. 보상 모델은 텍스트를 생성하지 않고 하나의 수치 점수만 출력합니다.

3단계: PPO를 이용한 강화학습. 보상 모델을 피드백의 원천으로 삼아 PPO로 원래 모델을 업데이트합니다. 매 회차마다 모델이 응답을 샘플링하고 보상 모델이 점수를 매기면, PPO가 높은 점수의 출력이 나올 가능성을 높이도록 모델 가중치를 조정합니다. KL 페널티 항은 모델이 지도학습을 마친 출발점에서 지나치게 멀어지지 않도록 막습니다.

정렬 개선의 대부분은 이 마지막 단계에서 이루어집니다. 모델은 시범 데이터에 명시적으로 등장하지 않은 응답 방식도 탐색할 수 있습니다.

인간 피드백 기반 강화학습(RLHF)과 지도 미세 조정만 사용한 방식의 비교.

학습 신호 • RLHF: 새로운 응답에 점수를 매기는 학습된 보상 모델을 사용합니다. • 지도 미세 조정: 사람이 작성한 고정 라벨만 사용합니다.

데이터 효율성 • RLHF: 완전한 시범 응답보다 저렴하게 수집할 수 있는 순위 데이터로 품질을 높일 수 있습니다. • 지도 미세 조정: 모든 프롬프트에 완전하고 올바른 응답이 필요합니다.

과도한 최적화의 위험 • RLHF: 보상 모델이 약하면 평가자의 선호에 과적합될 수 있습니다. • 지도 미세 조정: 라벨 데이터셋에 포함된 패턴으로 제한됩니다.

각 접근법을 선택할 때 고품질 시범 데이터가 풍부하면 지도 미세 조정을 사용하세요. 모델이 제공된 예시를 넘어 일반화해야 하고, 완전한 답변을 작성하는 것보다 쌍별 순위를 수집하는 편이 빠르다면 RLHF로 전환하세요.

인간 순위 평가와 보상 점수의 예시.

프롬프트: “10살 아이에게 양자 컴퓨팅을 설명해 주세요.” 응답 A: “양자 컴퓨팅은 팽이가 도는 동전처럼 동시에 두 상태에 있을 수 있는 아주 작은 입자를 사용해요.” (평가 순위: 1위, 보상 모델 점수: 0.92) 응답 B: “중첩을 비롯한 양자역학 원리에 기반한 컴퓨터의 한 종류입니다.” (평가 순위: 2위, 보상 모델 점수: 0.71) 응답 C: “양자 비트는 계산에서 일반 비트보다 더 좋습니다.” (평가 순위: 3위, 보상 모델 점수: 0.45)

보상 해킹은 평가자에게 처음에는 높은 점수를 받았던 장황하지만 내용 없는 답변을 생성하는 등 모델이 보상 모델의 허점을 이용할 때 발생합니다. 모드 붕괴는 PPO 학습으로 모델이 서로 무관한 프롬프트에도 같은 고득점 표현을 반복해 출력의 다양성이 줄어드는 현상입니다.

고객 지원팀은 RLHF로 학습된 모델을 사용해 회사의 어조 지침에 맞는 답변을 만듭니다. 연구자들은 같은 파이프라인을 과학 글쓰기 도우미에 적용해 요약문이 분야 전문가가 제시한 인용 정확성 선호를 따르게 합니다. 모델 제공업체의 안전팀은 정책 위반 응답과 정책 준수 응답의 쌍으로 보상 모델을 학습해 유해하거나 편향된 출력을 줄이는 데 RLHF를 활용합니다.

인간 피드백 기반 강화학습(RLHF)에 관한 자주 묻는 질문.

A: 아닙니다. 보상 모델은 문체와 유용성, 안전성에 관한 인간의 선호만 학습합니다. 평가자가 부정확한 내용을 명시적으로 감점하지 않는 한 사실을 검증하지 않습니다.

A: 보상 모델 단계에는 보통 수만 건의 순위 비교가 필요합니다. 정확한 수량은 응답의 다양성과 평가자의 일관성에 따라 달라집니다.

A: 원치 않는 응답의 빈도를 줄이지만 완전히 없애지는 못합니다. 평가자 간 의견 차이와 보상 모델의 오류로 위험이 일부 남습니다.

A: 대부분의 공개 시스템은 PPO를 사용하지만, 연구자들은 별도의 보상 모델을 생략하는 DPO 같은 대안도 시험했습니다. PPO는 안정적이고 충분히 연구되었기 때문에 여전히 기본 선택으로 쓰입니다.

Q: RLHF는 모델 가중치를 영구적으로 바꾸나요?

A: 그렇습니다. 사용자에게 공개되는 최종 모델에는 PPO 단계에서 업데이트된 가중치가 포함됩니다. 추론 시점에는 외부 보상 모델이 실행되지 않습니다.

실용성을 판단하는 기준은 출처와 비용, 실패 가능성을 감추지 않으면서 이 접근법이 반복 업무를 실제로 개선하는지 여부입니다. 대표적인 과제 하나로 시작하고, 실수가 중요한 영향을 미치는 지점에는 사람의 확인 절차를 두며, 모델과 제품이 변함에 따라 결과를 다시 평가하세요.

편집 원칙

1차 자료, 제품 문서, 실제 활용 사례를 바탕으로 해당 도구가 여러분의 업무 흐름에 맞는지 더 쉽게 판단할 수 있도록 돕습니다.

도구 디렉터리 둘러보기