instructGPT1 RLHF란? 사람의 선호를 보상으로 바꾸는 InstructGPT 학습 구조 좋은 답은 하나로 정해지지 않는 경우가 많다. 같은 질문에 사실관계가 맞는 답이 둘이라도 하나는 핵심부터 말하고, 다른 하나는 장황하거나 무례할 수 있다. 지도 미세조정(SFT)은 모범 답안을 그대로 따라 쓰게 만들 수 있지만, 여러 답 중 사람이 어느 쪽을 더 좋아하는지까지 표현하기는 어렵다. InstructGPT식 RLHF(Reinforcement Learning from Human Feedback)는 이 상대적인 판단으로 보상 모델을 학습하고, 그 보상을 강화학습으로 최적화하는 구조다. RLHF 전체가 반드시 이 조합을 사용하는 것은 아니다.쉽게 말하면 신입 상담원을 훈련하는 과정과 닮았다. 먼저 모범 상담문을 보여 준다. 다음에는 같은 문의에 대한 답변 두 개를 선임자가 비교해 더 나은 쪽을 고른.. 2026. 7. 28. 이전 1 다음