선호 최적화1 DPO란? RLHF 없이 chosen·rejected 데이터로 AI 선호를 학습하는 방법 좋은 답과 나쁜 답을 한 쌍씩 모아 두었는데, 굳이 별도의 보상 모델을 만들고 복잡한 강화학습까지 돌려야 할까? DPO(Direct Preference Optimization)는 이 질문에서 출발한다. 결론부터 말하면 DPO는 사람의 선호가 필요 없는 방법이 아니다. 사람이 고른 chosen과 비선호 답인 rejected를 그대로 언어모델의 학습 손실로 바꿔, 보상 모델과 PPO 루프를 생략하는 방법이다.용어 먼저 보기로그확률은 모델이 어떤 답을 얼마나 낼 법하다고 보는지를 로그 값으로 표현한 것이다. β(베타)는 선호 반영 강도와 기준 모델에서 벗어나는 정도를 조절한다. KL은 새 모델과 기준 모델의 분포 차이를 재는 값이며, Bradley–Terry 모형은 두 답의 점수 차이로 선호 확률을 표현한다... 2026. 7. 28. 이전 1 다음