🚀 AI 연구소103 GRPO와 RLVR 차이: DeepSeek-R1은 어떻게 검증 가능한 보상으로 추론을 배웠나 DeepSeek-R1을 설명하는 글에서 “GRPO가 정답을 자동 채점해 추론을 만들었다”는 문장을 자주 본다. 절반만 맞다. RLVR는 무엇을 보상할지 정하는 피드백 방식이고, GRPO는 그 보상을 이용해 모델을 어떻게 업데이트할지 정하는 최적화 알고리즘이다. 시험으로 치면 RLVR는 정답지와 채점기, GRPO는 같은 문제를 푼 학생들의 점수를 비교해 다음 수업 방향을 정하는 규칙이다.평가 용어 먼저 보기pass@k는 같은 문제에 k번 답했을 때 한 번 이상 성공한 비율이다. avg@32는 문제마다 32개 답을 뽑아 계산한 평균 성능이다. OOD는 학습 때와 분포가 다른 문제를 뜻한다. advantage는 한 답이 같은 그룹의 평균보다 얼마나 좋거나 나쁜지 나타내는 학습 신호다.이 둘을 분리해야 중요한 .. 2026. 7. 29. DPO란? RLHF 없이 chosen·rejected 데이터로 AI 선호를 학습하는 방법 좋은 답과 나쁜 답을 한 쌍씩 모아 두었는데, 굳이 별도의 보상 모델을 만들고 복잡한 강화학습까지 돌려야 할까? DPO(Direct Preference Optimization)는 이 질문에서 출발한다. 결론부터 말하면 DPO는 사람의 선호가 필요 없는 방법이 아니다. 사람이 고른 chosen과 비선호 답인 rejected를 그대로 언어모델의 학습 손실로 바꿔, 보상 모델과 PPO 루프를 생략하는 방법이다.용어 먼저 보기로그확률은 모델이 어떤 답을 얼마나 낼 법하다고 보는지를 로그 값으로 표현한 것이다. β(베타)는 선호 반영 강도와 기준 모델에서 벗어나는 정도를 조절한다. KL은 새 모델과 기준 모델의 분포 차이를 재는 값이며, Bradley–Terry 모형은 두 답의 점수 차이로 선호 확률을 표현한다... 2026. 7. 28. RLHF란? 사람의 선호를 보상으로 바꾸는 InstructGPT 학습 구조 좋은 답은 하나로 정해지지 않는 경우가 많다. 같은 질문에 사실관계가 맞는 답이 둘이라도 하나는 핵심부터 말하고, 다른 하나는 장황하거나 무례할 수 있다. 지도 미세조정(SFT)은 모범 답안을 그대로 따라 쓰게 만들 수 있지만, 여러 답 중 사람이 어느 쪽을 더 좋아하는지까지 표현하기는 어렵다. InstructGPT식 RLHF(Reinforcement Learning from Human Feedback)는 이 상대적인 판단으로 보상 모델을 학습하고, 그 보상을 강화학습으로 최적화하는 구조다. RLHF 전체가 반드시 이 조합을 사용하는 것은 아니다.쉽게 말하면 신입 상담원을 훈련하는 과정과 닮았다. 먼저 모범 상담문을 보여 준다. 다음에는 같은 문의에 대한 답변 두 개를 선임자가 비교해 더 나은 쪽을 고른.. 2026. 7. 28. SFT란? LLM이 지시를 따르고 도구를 쓰게 만드는 지도 미세조정 사전학습을 마친 언어모델은 문장을 이어 쓰는 능력은 뛰어나지만, 사용자의 요청을 ‘업무 지시’로 받아들이는 법까지 저절로 익히지는 않는다. 질문을 받았는데 웹 문서처럼 말을 이어 가거나, 계산기가 필요한 순간에도 그럴듯한 숫자를 만들어 낼 수 있다. SFT(Supervised Fine-Tuning, 지도 미세조정)는 이 간극을 입력과 모범 출력의 짝으로 메운다. 핵심은 지식을 새로 주입하는 것보다 “이 상황에서는 어떤 형식과 행동이 정답인가”를 반복해서 보여 주는 데 있다.여기서 자주 생기는 오해가 있다. SFT와 LoRA를 같은 종류의 기술로 보는 것이다. 둘은 답하는 질문이 다르다. SFT는 무엇을 정답으로 삼아 학습할 것인가라는 학습 목적이고, LoRA와 QLoRA는 그 목적을 달성할 때 어떤 파라.. 2026. 7. 28. 이전 1 2 3 4 5 ··· 26 다음