본문 바로가기
🚀 AI 연구소/AI 활용 가이드

로컬 LLM 구축·추천: 맥·윈도우에서 어떤 툴, 몇 GB RAM이 필요할까? (2026)

by 노마드데이터랩 2025. 3. 25.

로컬 LLM 구축이 처음이라면 화면에서 모델을 고르고 싶을 때는 LM Studio, 자동화와 로컬 API가 필요할 때는 Ollama를 선택하면 됩니다. 16GB 메모리에서는 7~9B Q4 모델부터 시작하고, 24GB는 14B Q4, 32GB 이상은 30B급 Q4를 시험하되 긴 컨텍스트는 메모리를 더 쓴다는 점을 감안해야 합니다.

로컬 LLM은 질문과 모델 계산을 내 맥이나 윈도우 PC에서 처리하는 방식입니다. 다만 모델 다운로드, 웹 검색, 클라우드 연동, MCP 도구를 켜면 네트워크 통신이 생길 수 있으므로 “로컬 설치=모든 데이터가 무조건 외부로 나가지 않음”은 아닙니다.

로컬 LLM 툴 추천: 네 가지의 역할이 다르다

아래 표는 같은 종류의 앱 네 개를 비교한 것이 아닙니다. LM Studio와 Ollama는 모델 실행·관리를 쉽게 만들고, llama.cpp는 더 낮은 단계의 실행 엔진이며, Open WebUI는 그 위에 붙이는 브라우저 화면에 가깝습니다.

도구 잘 맞는 사람 장점 주의할 점
LM Studio 처음 설치하는 사용자 GUI에서 모델 검색·다운로드·채팅·로컬 서버 실행 Intel Mac 미지원, 메모리 여유가 적으면 작은 모델과 짧은 컨텍스트 필요
Ollama 개발·자동화·에이전트 연동 CLI와 로컬 API가 단순하고 macOS·Windows·Linux 지원 모델 선택과 로그 확인에 터미널이 더 편함
llama.cpp 성능 측정과 세부 튜닝이 필요한 사용자 GGUF, CLI·서버, 다양한 CPU·GPU 백엔드와 세밀한 옵션 설치와 플래그가 초보자에게 복잡할 수 있음
Open WebUI 브라우저 UI·지식베이스·여러 사용자 Ollama뿐 아니라 OpenAI 호환 API에도 연결 가능 자체 모델 실행기가 아니므로 Ollama·LM Studio·llama.cpp 같은 백엔드가 따로 필요

선택 규칙은 간단합니다. 개인 PC에서 모델을 비교해 볼 목적이면 LM Studio, VS Code나 스크립트에서 호출할 목적이면 Ollama, 하드웨어별 속도와 양자화 옵션을 직접 만질 목적이면 llama.cpp가 낫습니다. Open WebUI는 실행기가 정해진 뒤 웹 화면이 필요할 때 추가하는 선택입니다.

몇 GB RAM이 필요한가: Q4 모델 크기부터 계산하기

모델이 메모리에 들어갈지 대략 판단하는 계산은 직접 해볼 수 있습니다.

모델 가중치 하한 ≈ 파라미터 수 × 양자화 비트 ÷ 8

예를 들어 8B 모델을 4비트(Q4)로 줄이면 8 billion × 4bit ÷ 8 = 약 4GB입니다. 여기에 실행 프로그램, 운영체제, KV 캐시와 컨텍스트가 더해지므로 4GB 메모리 PC에서 4GB 모델이 편하게 돌아간다는 뜻은 아닙니다.

Q4 모델 규모 가중치 계산값 현실적인 시작점 적합한 용도
7~9B 약 3.5~4.5GB 16GB 시스템 메모리 요약·일반 채팅·가벼운 코딩
14B 약 7GB 24GB 전후 조금 더 나은 추론·코딩 품질 탐색
30~32B 약 15~16GB 32GB 이상, 짧은 컨텍스트부터 품질을 우선한 실험

이 표는 보장 사양이 아니라 시작점입니다. 같은 8B라도 컨텍스트 길이, GPU 오프로딩, KV 캐시 형식, 다른 앱의 메모리 사용량에 따라 필요한 여유가 달라집니다. 모델 페이지에 표시된 실제 GGUF·MLX 파일 크기와 앱의 예상 메모리 표시를 마지막으로 확인해야 합니다.

맥과 윈도우에서 먼저 확인할 사양

2026년 8월 1일 기준 LM Studio 공식 요구사항은 Mac에서 Apple Silicon과 macOS 14 이상을 요구하고 16GB 이상 메모리를 권장합니다. 8GB Mac도 작은 모델과 짧은 컨텍스트로 시도할 수 있지만 Intel Mac은 현재 지원하지 않습니다.

Windows용 LM Studio는 x64와 ARM을 지원하며, x64 CPU에는 AVX2가 필요합니다. 공식 권장은 RAM 16GB와 전용 VRAM 4GB 이상입니다. 그래픽카드 메모리와 시스템 메모리의 차이가 헷갈리면 VRAM이란? RAM과 차이, AI에 몇 GB 필요한지를 먼저 보면 됩니다.

Ollama 공식 빠른 시작은 macOS·Windows·Linux를 지원합니다. Windows는 공식 Windows 문서 기준 Windows 10 22H2 이상이 필요하고, 설치 파일만 약 4GB의 공간을 요구합니다. 모델 저장 공간은 별도이며 여러 모델을 받으면 수십~수백 GB가 될 수 있습니다.

로컬 LLM 구축 순서: 모델보다 툴과 메모리를 먼저 정한다

  1. 용도를 한 문장으로 고릅니다. 문서 요약, 한국어 채팅, 코딩 보조, 로컬 API 중 하나를 우선순위 1순위로 둡니다.
  2. 툴을 고릅니다. GUI 테스트는 LM Studio, 개발 연동은 Ollama가 가장 짧은 출발점입니다.
  3. 7~9B Q4 한 개만 받습니다. 처음부터 큰 모델 여러 개를 받으면 저장 공간만 늘고 비교 기준이 흐려집니다.
  4. 같은 질문 10개로 품질과 속도를 기록합니다. 정답률, 첫 응답 대기시간, 초당 토큰, 메모리 사용량을 보고 다음 크기로 올릴지 결정합니다.
  5. 외부 연결을 점검합니다. 웹 검색, 클라우드 모델, 원격 MCP, 텔레메트리를 켰다면 로컬 처리 범위를 다시 확인합니다.

Ollama를 에이전트와 묶는 실제 흐름은 같은 로컬 LLM 클러스터의 맥북에서 OpenManus와 Ollama를 연동하는 방법에서 이어서 볼 수 있습니다. 더 낮은 단계의 제어가 필요하면 llama.cpp 공식 저장소, 브라우저 화면이 필요하면 Open WebUI 공식 시작 문서를 확인하는 편이 안전합니다.

로컬 LLM의 한계: 무료 ChatGPT가 되는 것은 아니다

  • 품질: 내 PC에 들어가는 작은 모델은 대형 클라우드 모델보다 복잡한 추론·코딩·도구 사용에서 약할 수 있습니다.
  • 비용: API 요금은 줄어도 PC 구매비, 전기, 저장 공간, 업데이트 시간은 남습니다.
  • 보안: 모델을 로컬에서 돌려도 연결한 검색·플러그인·원격 API가 데이터를 보낼 수 있습니다.
  • 파인튜닝: 실행과 학습은 다른 작업입니다. 로컬 실행 도구를 설치했다고 내 데이터로 파인튜닝이 자동으로 되는 것은 아닙니다.

결론적으로 16GB PC라면 LM Studio 또는 Ollama에 7~9B Q4 모델 하나를 올려 실제 질문 10개로 검증하는 것이 가장 안전한 시작입니다. 그 결과가 부족할 때만 24GB·32GB 하드웨어나 더 큰 모델을 검토하면 과잉 구매와 불필요한 설치를 피할 수 있습니다.

공식 자료

댓글