본문 바로가기

🚀 AI 연구소103

Continued Pretraining이란? 도메인 지식을 추가하는 학습과 파인튜닝의 차이 범용 LLM에 사내 기술 문서를 몇 개 보여줬는데도 전문 용어를 자꾸 일반적인 뜻으로 해석한다면, 문제는 답변 형식이 아니라 모델이 익힌 텍스트 세계에 있을 수 있다. ‘질문에는 이렇게 답하라’고 가르치는 파인튜닝만으로는 부족한 경우다. Continued Pretraining, 우리말로 계속 사전학습은 이미 만들어진 모델이 특정 도메인의 언어 분포를 다시 익히게 하는 방법이다.한 문장으로 구분하면계속 사전학습은 정답 표시가 없는 전문 문서를 읽으며 “이 분야에서는 어떤 말이 어떤 맥락에 이어지는가”를 학습하고, 지도 미세조정은 질문과 모범 답을 보며 “이 요청에는 어떤 형태로 답해야 하는가”를 학습한다.Continued Pretraining의 정확한 뜻계속 사전학습(Continued Pretraining.. 2026. 7. 27.
LLM 포스트 트레이닝이란? 프리트레이닝·파인튜닝과 차이부터 전체 과정까지 같은 거대언어모델이라도 ‘다음 단어를 잘 잇는 모델’과 ‘질문 의도를 파악해 쓸 만한 답을 주는 모델’ 사이에는 큰 간격이 있다. 인터넷 문서를 대규모로 읽힌 모델이 곧바로 친절한 상담원이나 안전한 코딩 도우미가 되는 것은 아니다. 이 간격을 줄이는 학습이 LLM 포스트 트레이닝(post-training)이다.핵심 관점프리트레이닝이 언어와 세상에 관한 넓은 확률 지도를 만든다면, 포스트 트레이닝은 그 지도를 어떤 방식으로 꺼내 쓰게 할지 조정한다. 따라서 포스트 트레이닝의 성패는 모델 크기만이 아니라 시범 답변, 선호 데이터, 평가 기준의 품질에 달려 있다.먼저 ‘학습’이 무엇인지부터언어모델은 문장을 그대로 외우는 문서함이 아니다. 텍스트를 토큰(token)이라는 작은 단위로 나눈 뒤, 앞에 나온 토큰을.. 2026. 7. 27.
opencodex란? Codex에 Kimi·Grok·GLM을 붙이는 로컬 프록시 실전 화면 정리 Codex는 좋은데, 모델이 OpenAI 쪽으로만 묶여 있으면 아쉽다. 더 싼 모델, 더 긴 컨텍스트, 다른 코딩 특화 모델을 같은 워크플로 안에서 돌리고 싶을 때 쓰는 로컬 프록시가 있다. 이름이 opencodex다.이 글은 2026년 7월 23일 기준, 실제 로컬 대시보드 opencodex v2.7.31 화면을 기준으로 정리한다. 설치 튜토리얼 전체가 아니라 “이게 뭐고, 화면에 뭐가 보이고, 언제 쓰는지”에 초점을 둔다. 한 줄 결론opencodex는 Codex CLI/앱 앞에 두는 로컬 라우팅 프록시다. OpenAI 네이티브 모델뿐 아니라 Kimi, xAI, Z.ai 같은 프로바이더 모델을 Codex 모델 선택기에 붙여 쓸 수 있다. 계정 풀 로테이션, 사용량 집계, 서브에이전트 모델 우선순위까지.. 2026. 7. 27.
Arize AI Builder Meetup 후기: AI 도입의 병목은 모델이 아니라 평가·권한·운영이었다 AI 에이전트 발표라면 보통 더 좋은 모델, 더 정교한 프롬프트, 더 많은 자동화를 기대한다. 2026년 7월 서울에서 열린 Arize AI Builder Meetup의 세 발표는 오히려 그다음을 이야기했다.이미 만들 수 있는데 왜 현장에서는 잘 작동하지 않는가. 환각을 줄였는데 왜 고객은 더 싫어하는가. 같은 개발자가 사이드 프로젝트에서는 빠른데 회사에서는 느린 이유는 무엇인가. PoC가 성공했는데 왜 실제 배포와 사용으로 이어지지 않는가.세 발표를 관통한 문장은 이것이었다.이제 병목은 AI를 만드는 기술보다, AI가 실제로 일할 수 있는 평가·맥락·권한·운영 환경에 있다.공식 행사 페이지에 확인되는 세션과 연사는 다음과 같다.세션연사Arize Observe 2026 후기: 지속 가능한 AI Agent.. 2026. 7. 26.