본문 바로가기

🚀 AI 연구소102

맥북 프로는 AI 개발에 적합한가요? M1~M5·메모리 몇 GB가 맞을까? (2026) 맥북 프로는 AI 개발에 적합합니다. ChatGPT·Claude API를 붙이는 앱, RAG, 에이전트, Python 실험은 M1 이후 맥에서도 충분하고, 로컬 LLM까지 돌리려면 칩 세대보다 통합 메모리 용량을 먼저 봐야 합니다. 반대로 CUDA 전용 학습 코드를 오래 돌리는 것이 주업무라면 맥북은 보조 개발기로 쓰고 NVIDIA GPU 서버나 클라우드를 함께 쓰는 편이 낫습니다.구매 기준만 먼저 말하면 API 중심 개발은 16GB, 7~9B 로컬 모델과 Docker를 함께 쓰면 24GB, 14B급 모델·여러 컨테이너·긴 컨텍스트까지 고려하면 32~48GB가 현실적인 출발점입니다.AI 개발 종류부터 나누면 답이 달라진다‘AI 개발’은 한 가지 작업이 아닙니다. 모델을 외부 API로 호출하는 앱 개발, .. 2026. 8. 3.
AI 에이전트 포스트 트레이닝: 도구 호출 궤적을 SFT·DPO·RL로 학습하는 법 AI 에이전트가 도구 이름을 알고 있다는 것과 실제 일을 끝낸다는 것은 다르다. “가격을 확인해 달라”는 요청에 검색 도구를 한 번 부르는 모델은 만들기 쉽다. 하지만 검색 결과가 비어 있을 때 조건을 바꾸고, 권한 오류가 나면 멈추고, 최신 정보를 다시 확인한 뒤, 중복 결제 없이 작업을 마치는 모델은 훨씬 어렵다. 에이전트 포스트 트레이닝의 대상은 예쁜 최종 문장 하나가 아니라 이런 상호작용의 전 과정이다.포스트 트레이닝은 사전학습이 끝난 모델의 행동을 특정 목적에 맞게 다듬는 단계다. 여기에는 정답 행동을 모방하는 SFT, 더 나은 행동과 나쁜 행동을 비교하는 DPO 계열, 실제 또는 모의 환경에서 보상을 최대화하는 강화학습(RL)이 포함된다. 세 방법은 유행에 따라 순서대로 갈아타는 기술이 아니다.. 2026. 7. 29.
지식 증류란? 큰 AI를 작은 모델로 옮기는 방법과 PUBG Ally 8B→2B 사례 큰 AI가 잘하는 일을 작은 모델에서도 재현하려면 어떻게 해야 할까. 흔히 “큰 모델의 답을 모아 작은 모델을 파인튜닝하면 된다”고 설명하지만, 실제 지식 증류에는 서로 다른 정보량을 가진 여러 방법이 있다. 최종 정답만 따라 쓰게 할 수도 있고, 다음 단어 후보 전체의 확률 분포를 옮길 수도 있으며, 추론 과정이나 도구 호출의 순서까지 학습시킬 수도 있다. 중요한 것은 모델을 단순히 작게 만드는 일이 아니라, 서비스에 필요한 행동을 어느 정도까지 보존할지 정하는 일이다.배포 용어 먼저 보기GGUF는 모델 가중치와 메타데이터를 담는 파일 형식이고, Q4_K_M은 그 가중치를 4비트 계열로 압축하는 양자화 방식이다. KV 캐시는 이미 처리한 토큰의 중간 계산을 재사용하는 메모리다. CiG(CUDA in G.. 2026. 7. 29.
GRPO와 RLVR 차이: DeepSeek-R1은 어떻게 검증 가능한 보상으로 추론을 배웠나 DeepSeek-R1을 설명하는 글에서 “GRPO가 정답을 자동 채점해 추론을 만들었다”는 문장을 자주 본다. 절반만 맞다. RLVR는 무엇을 보상할지 정하는 피드백 방식이고, GRPO는 그 보상을 이용해 모델을 어떻게 업데이트할지 정하는 최적화 알고리즘이다. 시험으로 치면 RLVR는 정답지와 채점기, GRPO는 같은 문제를 푼 학생들의 점수를 비교해 다음 수업 방향을 정하는 규칙이다.평가 용어 먼저 보기pass@k는 같은 문제에 k번 답했을 때 한 번 이상 성공한 비율이다. avg@32는 문제마다 32개 답을 뽑아 계산한 평균 성능이다. OOD는 학습 때와 분포가 다른 문제를 뜻한다. advantage는 한 답이 같은 그룹의 평균보다 얼마나 좋거나 나쁜지 나타내는 학습 신호다.이 둘을 분리해야 중요한 .. 2026. 7. 29.