DAPO1 GRPO와 RLVR 차이: DeepSeek-R1은 어떻게 검증 가능한 보상으로 추론을 배웠나 DeepSeek-R1을 설명하는 글에서 “GRPO가 정답을 자동 채점해 추론을 만들었다”는 문장을 자주 본다. 절반만 맞다. RLVR는 무엇을 보상할지 정하는 피드백 방식이고, GRPO는 그 보상을 이용해 모델을 어떻게 업데이트할지 정하는 최적화 알고리즘이다. 시험으로 치면 RLVR는 정답지와 채점기, GRPO는 같은 문제를 푼 학생들의 점수를 비교해 다음 수업 방향을 정하는 규칙이다.평가 용어 먼저 보기pass@k는 같은 문제에 k번 답했을 때 한 번 이상 성공한 비율이다. avg@32는 문제마다 32개 답을 뽑아 계산한 평균 성능이다. OOD는 학습 때와 분포가 다른 문제를 뜻한다. advantage는 한 답이 같은 그룹의 평균보다 얼마나 좋거나 나쁜지 나타내는 학습 신호다.이 둘을 분리해야 중요한 .. 2026. 7. 29. 이전 1 다음