DPO2 DPO란? RLHF 없이 chosen·rejected 데이터로 AI 선호를 학습하는 방법 좋은 답과 나쁜 답을 한 쌍씩 모아 두었는데, 굳이 별도의 보상 모델을 만들고 복잡한 강화학습까지 돌려야 할까? DPO(Direct Preference Optimization)는 이 질문에서 출발한다. 결론부터 말하면 DPO는 사람의 선호가 필요 없는 방법이 아니다. 사람이 고른 chosen과 비선호 답인 rejected를 그대로 언어모델의 학습 손실로 바꿔, 보상 모델과 PPO 루프를 생략하는 방법이다.용어 먼저 보기로그확률은 모델이 어떤 답을 얼마나 낼 법하다고 보는지를 로그 값으로 표현한 것이다. β(베타)는 선호 반영 강도와 기준 모델에서 벗어나는 정도를 조절한다. KL은 새 모델과 기준 모델의 분포 차이를 재는 값이며, Bradley–Terry 모형은 두 답의 점수 차이로 선호 확률을 표현한다... 2026. 7. 28. LLM 포스트 트레이닝이란? 프리트레이닝·파인튜닝과 차이부터 전체 과정까지 같은 거대언어모델이라도 ‘다음 단어를 잘 잇는 모델’과 ‘질문 의도를 파악해 쓸 만한 답을 주는 모델’ 사이에는 큰 간격이 있다. 인터넷 문서를 대규모로 읽힌 모델이 곧바로 친절한 상담원이나 안전한 코딩 도우미가 되는 것은 아니다. 이 간격을 줄이는 학습이 LLM 포스트 트레이닝(post-training)이다.핵심 관점프리트레이닝이 언어와 세상에 관한 넓은 확률 지도를 만든다면, 포스트 트레이닝은 그 지도를 어떤 방식으로 꺼내 쓰게 할지 조정한다. 따라서 포스트 트레이닝의 성패는 모델 크기만이 아니라 시범 답변, 선호 데이터, 평가 기준의 품질에 달려 있다.먼저 ‘학습’이 무엇인지부터언어모델은 문장을 그대로 외우는 문서함이 아니다. 텍스트를 토큰(token)이라는 작은 단위로 나눈 뒤, 앞에 나온 토큰을.. 2026. 7. 27. 이전 1 다음