본문 바로가기

SFT2

AI 에이전트 포스트 트레이닝: 도구 호출 궤적을 SFT·DPO·RL로 학습하는 법 AI 에이전트가 도구 이름을 알고 있다는 것과 실제 일을 끝낸다는 것은 다르다. “가격을 확인해 달라”는 요청에 검색 도구를 한 번 부르는 모델은 만들기 쉽다. 하지만 검색 결과가 비어 있을 때 조건을 바꾸고, 권한 오류가 나면 멈추고, 최신 정보를 다시 확인한 뒤, 중복 결제 없이 작업을 마치는 모델은 훨씬 어렵다. 에이전트 포스트 트레이닝의 대상은 예쁜 최종 문장 하나가 아니라 이런 상호작용의 전 과정이다.포스트 트레이닝은 사전학습이 끝난 모델의 행동을 특정 목적에 맞게 다듬는 단계다. 여기에는 정답 행동을 모방하는 SFT, 더 나은 행동과 나쁜 행동을 비교하는 DPO 계열, 실제 또는 모의 환경에서 보상을 최대화하는 강화학습(RL)이 포함된다. 세 방법은 유행에 따라 순서대로 갈아타는 기술이 아니다.. 2026. 7. 29.
SFT란? LLM이 지시를 따르고 도구를 쓰게 만드는 지도 미세조정 사전학습을 마친 언어모델은 문장을 이어 쓰는 능력은 뛰어나지만, 사용자의 요청을 ‘업무 지시’로 받아들이는 법까지 저절로 익히지는 않는다. 질문을 받았는데 웹 문서처럼 말을 이어 가거나, 계산기가 필요한 순간에도 그럴듯한 숫자를 만들어 낼 수 있다. SFT(Supervised Fine-Tuning, 지도 미세조정)는 이 간극을 입력과 모범 출력의 짝으로 메운다. 핵심은 지식을 새로 주입하는 것보다 “이 상황에서는 어떤 형식과 행동이 정답인가”를 반복해서 보여 주는 데 있다.여기서 자주 생기는 오해가 있다. SFT와 LoRA를 같은 종류의 기술로 보는 것이다. 둘은 답하는 질문이 다르다. SFT는 무엇을 정답으로 삼아 학습할 것인가라는 학습 목적이고, LoRA와 QLoRA는 그 목적을 달성할 때 어떤 파라.. 2026. 7. 28.