본문 바로가기
SEO·GEO 용어사전

RLHF

마지막 업데이트

RLHF는 사람들이 선호하는 답을 하도록 AI 모델을 다듬는 후속 학습 방법입니다. Reinforcement Learning from Human Feedback, 인간 피드백 기반 강화학습의 약자입니다. 초기 ChatGPT는 RLHF로 학습됐다고 OpenAI가 밝혔으며, RLHF는 지시 따르기와 선호 정렬에 쓰이는 여러 후속 학습 방법 중 하나입니다. 현재 제품에는 다른 후속 학습과 시스템 지침, 안전 장치도 함께 영향을 줄 수 있습니다.

이 글은 OpenAI의 InstructGPT와 ChatGPT 공식 발표, Anthropic의 공식 연구 발표를 기준으로 작성했습니다.

시연, 보상 모델, 강화학습의 3단계

대표적인 구현은 OpenAI가 2022년 InstructGPT에서 공개한 3단계 절차입니다.

  1. 사람이 작성한 모범 답변(시연 데이터)으로 모델을 지도학습합니다
  2. 모델이 낸 여러 답변에 사람이 순위를 매긴 데이터로, 좋은 답을 점수화하는 보상 모델을 학습시킵니다
  3. 그 보상 모델의 점수를 보상 삼아 강화학습으로 모델을 다듬습니다

OpenAI는 초기 ChatGPT를 InstructGPT와 같은 주요 방법인 RLHF로 학습했다고 밝혔습니다. 공개 설명만으로 세부 절차가 완전히 같다고 단정할 수는 없습니다. InstructGPT 연구에서는 13억 파라미터 모델의 답변이 1,750억 파라미터 GPT-3 답변보다 사람들에게 더 선호됐습니다. 이 결과는 해당 연구의 모델과 평가 조건에서 나온 수치입니다.

만능이 아니라는 데이터

RLHF가 답변을 개선한다는 통설에는 단서가 필요합니다. OpenAI 자체 발표의 수치를 보면, 사실 왜곡(할루시네이션) 지표에서 GPT-3보다 InstructGPT가 크게 나아졌지만, 강화학습까지 마친 최종 모델이 지도학습만 한 중간 단계보다 이 지표에서는 오히려 나빴습니다. 선호에 맞추는 학습이 모든 품질 차원을 고르게 올리는 것은 아니라는 뜻입니다. OpenAI의 2025년 할루시네이션 논문도 RLHF 계열 기법을 오류를 줄이는 데 기여했지만 완전히 없애지는 못한 후속 학습으로 인용합니다. RLHF가 원인이라는 말도, 해결책이라는 말도 데이터보다 센 주장입니다.

RLHF에서 RLAIF로

Anthropic은 RLHF 연구 뒤 Constitutional AI에서 사람 대신 AI 피드백을 활용하는 RLAIF를 공개했습니다. 연구의 흐름과 개별 제품의 실제 학습법은 구분해야 합니다. 개별 Claude 버전에 어떤 후속 학습법이 쓰였는지는 해당 모델의 공식 공개 범위만 확인할 수 있습니다.

RLHF가 아닌 후속 학습과의 경계

방식핵심 차이
지도 미세조정사람이 만든 모범 답변을 직접 학습
RLHF사람의 선호 비교로 보상 모델을 만들고 강화학습
RLAIF사람 대신 AI 피드백을 선호 신호로 활용
DPO별도 보상 모델과 강화학습 단계 없이 선호 쌍을 직접 최적화하는 방식

사람의 피드백이 데이터에 들어갔다고 모두 RLHF는 아닙니다. 선호 데이터를 어떤 학습 목표와 절차에 쓰는지 확인해야 합니다. 제공사가 현재 모델의 후속 학습 방법을 공개하지 않았다면 제품의 말투만 보고 RLHF라고 단정하지 않습니다.

검색 실무자에게 갖는 의미

이 용어의 실무 가치는 해석력입니다. AI 답변이 왜 단정보다 균형 잡힌 어투를 쓰는지, 왜 어떤 요청을 거절하는지, 왜 브랜드 설명에 특유의 톤이 실리는지가 후속 학습의 결과라는 것을 알면, AI 답변을 관찰할 때 모델의 성격과 웹 정보의 문제를 구분해 읽을 수 있습니다.

경계선도 명확합니다. RLHF는 모델사가 학습 시점에 내부에서 수행하는 절차라 외부 브랜드가 개입할 통로가 없습니다. LLM 글에서 정리한 원칙 그대로, 학습 경로는 통제 대상이 아니고 브랜드가 움직일 수 있는 것은 그라운딩과 인용이 참조하는 웹 정보 쪽입니다. RLHF에 브랜드를 반영해 준다는 류의 제안이 있다면 성립하지 않는 구조입니다.

자주 묻는 질문

지도 미세조정과는 뭐가 다른가요?

지도 미세조정은 모범 입출력 예시를 직접 학습하고, RLHF는 답변들 사이의 선호를 점수화한 보상 모델을 거쳐 강화학습으로 다듬습니다. 파인튜닝은 더 넓은 말이라 RLHF와 다른 선호 최적화 방법까지 포함해 쓰일 수 있습니다.

ChatGPT가 정말 이 방법으로 만들어졌나요?

OpenAI 공식 발표에는 초기 ChatGPT가 InstructGPT와 같은 주요 방법인 RLHF로 학습됐다고 적혀 있습니다. 공개된 범위 밖의 세부 절차까지 같다고 단정하지는 않습니다.

Claude도 RLHF로 만들어졌나요?

Anthropic은 RLHF 연구 뒤 Constitutional AI에서 RLAIF를 공개했습니다. 다만 이 연구 흐름만으로 모든 Claude 버전의 실제 학습법을 단정할 수는 없습니다. 각 모델이 공식적으로 공개한 범위를 확인해야 합니다.

브랜드가 RLHF를 활용할 방법이 있나요?

공개 챗봇의 RLHF 과정에 외부 브랜드가 직접 참여할 수 있는 일반 공개 절차는 확인되지 않습니다. 자사 모델을 개발하는 조직이라면 자체 선호 데이터를 이용한 후속 학습을 검토할 수 있지만, 이는 공개 AI 답변 노출과 다른 작업입니다.

함께 알아두면 좋은 용어

참고 문서