포스트 트레이닝1 AI 에이전트 포스트 트레이닝: 도구 호출 궤적을 SFT·DPO·RL로 학습하는 법 AI 에이전트가 도구 이름을 알고 있다는 것과 실제 일을 끝낸다는 것은 다르다. “가격을 확인해 달라”는 요청에 검색 도구를 한 번 부르는 모델은 만들기 쉽다. 하지만 검색 결과가 비어 있을 때 조건을 바꾸고, 권한 오류가 나면 멈추고, 최신 정보를 다시 확인한 뒤, 중복 결제 없이 작업을 마치는 모델은 훨씬 어렵다. 에이전트 포스트 트레이닝의 대상은 예쁜 최종 문장 하나가 아니라 이런 상호작용의 전 과정이다.포스트 트레이닝은 사전학습이 끝난 모델의 행동을 특정 목적에 맞게 다듬는 단계다. 여기에는 정답 행동을 모방하는 SFT, 더 나은 행동과 나쁜 행동을 비교하는 DPO 계열, 실제 또는 모의 환경에서 보상을 최대화하는 강화학습(RL)이 포함된다. 세 방법은 유행에 따라 순서대로 갈아타는 기술이 아니다.. 2026. 7. 29. 이전 1 다음