커뮤니티 입장하기

올라마(Ollama)와 llama.cpp, 로컬 모델을 실행하는 도구

llama.cpp는 GGUF 형식의 모델을 여러 종류의 하드웨어에서 실행하는 C/C++ 엔진이고, 올라마는 그 엔진 위에 모델 내려받기와 실행과 API 제공을 명령 몇 줄로 묶은 프로그램입니다. 둘 다 MIT 라이선스이고 맥과 윈도우와 리눅스에서 돌아갑니다.

같은 말:올라마 사용법Ollama 설치llama.cpp 뜻LM Studio로컬 LLM 실행

새로 올라온 개념이에요. 먼저 읽어 보고 퀴즈도 풀어 보세요
Share
목차
  1. 🤔 모델 파일을 받았는데 어떻게 실행하는지 모를 때
  2. 🔑 llama.cpp와 올라마의 정의
  3. 💻 올라마로 시작하는 명령
  4. 🔌 다른 프로그램에 연결하는 API
  5. 🛠️ llama.cpp를 직접 쓰는 경우
  6. 🐢 느릴 때 확인하는 순서
  7. ⚠️ 자주 하는 실수
  8. ❓ 자주 묻는 질문
  9. 📋 3줄 요약
  10. 참고 자료

🤔 모델 파일을 받았는데 어떻게 실행하는지 모를 때

허깅페이스에서 가중치 파일을 내려받는 데까지는 갔는데, 그 파일을 더블클릭해서 열 수는 없습니다. 모델 파일은 숫자 묶음일 뿐이라 그것을 메모리에 올리고 질문을 받아 답을 내는 프로그램이 따로 있어야 합니다. 로컬 AI 이야기에 llama.cpp와 올라마와 LM Studio라는 이름이 늘 함께 나오는 이유입니다.

세 이름이 각각 무엇을 하는지, 서로 어떤 관계인지, 처음 시작할 때 어느 것을 고르고 명령을 어떻게 입력하는지를 정리했습니다.

🔑 llama.cpp와 올라마의 정의

llama.cpp는 GGUF 형식의 모델을 여러 종류의 하드웨어에서 실행하는 C/C++ 엔진이고, 올라마(Ollama)는 그 엔진 위에 모델 내려받기와 실행과 API 제공을 명령 몇 줄로 묶은 프로그램입니다.

둘의 관계는 엔진과 완성차에 가깝습니다. llama.cpp는 모델을 실제로 계산하는 부분이고, 올라마는 그 계산 부분을 안에 두고 모델 저장소와 명령어와 API를 붙여 바로 쓸 수 있게 만든 것입니다. 올라마 공식 저장소는 지원하는 백엔드로 llama.cpp를 적어 두고 있습니다.

항목llama.cpp올라마
만든 사람게오르기 게르가노프와 기여자들Ollama 팀
라이선스MITMIT
운영체제맥, 윈도우, 리눅스 등맥, 윈도우, 리눅스, 도커
지원 하드웨어애플 Metal, 엔비디아 CUDA, AMD HIP, 인텔 SYCL, Vulkan 등같은 백엔드를 안에서 씀
모델 파일GGUF를 직접 지정이름으로 저장소에서 내려받음
쓰는 방법명령줄 도구와 서버명령어 몇 개와 API
맞는 사람실행 옵션을 직접 만지려는 경우명령 두세 줄로 시작하려는 경우

llama.cpp 저장소는 자기 목표를 다양한 하드웨어에서 최소한의 설정으로 LLM 추론을 돌리는 것이라고 적고 있고, 1.5비트부터 8비트까지의 정수 양자화와 VRAM보다 큰 모델을 CPU와 GPU에 나눠 올리는 혼합 실행을 지원합니다. 명령줄 도구 llama-cli와 OpenAI 호환 API를 열어 주는 llama-server가 들어 있습니다. 2026년 9월 28일에 확인한 저장소 기준입니다.

LM Studio는 세 번째 이름인데, 같은 llama.cpp 계열 엔진 위에 화면을 붙인 프로그램입니다. 터미널이 낯설면 이쪽이 편하고, 엔비디아가 IFA에서 발표한 최적화도 올라마와 LM Studio 두 프로그램이 함께 지원합니다.

💻 올라마로 시작하는 명령

맥 기준으로 설치부터 대화까지는 이렇습니다. 홈브루가 있으면 한 줄로 설치되고, 없으면 공식 사이트의 설치 파일을 씁니다.

brew install ollama ollama serve

ollama serve가 실행 중이면 다른 터미널 창에서 모델을 받습니다. 모델 이름 뒤의 콜론 뒤가 태그이고, 태그를 생략하면 기본 태그가 내려옵니다.

ollama pull qwen3.8:27b ollama run qwen3.8:27b

run은 모델이 없으면 받고 있으면 바로 대화 창을 엽니다. 자주 쓰는 명령을 모으면 이렇습니다.

명령하는 일
ollama pull 이름모델을 내려받습니다
ollama run 이름대화를 시작합니다. 없으면 받습니다
ollama list내려받은 모델과 크기를 보여 줍니다
ollama ps지금 메모리에 올라온 모델과 실행 장치를 보여 줍니다
ollama show 이름모델의 기능과 라이선스와 컨텍스트 길이를 보여 줍니다
ollama rm 이름모델을 지웁니다

이 가운데 가장 먼저 익힐 것은 ollama ps입니다. PROCESSOR 열에 GPU라고 나오면 정상이고 100% CPU라고 나오면 모델이 GPU에 다 올라가지 못한 상태입니다. 준이아빠블로그에서 24GB 맥에 27B를 올렸을 때 이 열에서 100% CPU를 확인했고, 그 이유는 맥에서 로컬 AI에 있습니다.

🔌 다른 프로그램에 연결하는 API

올라마가 실행 중이면 localhost의 11434번 포트로 API가 열립니다. 터미널에서 대화하는 것 말고 코딩 도구나 자동화 스크립트가 이 주소로 요청을 보내면 로컬 모델이 답합니다.

curl http://localhost:11434/api/chat -d '{ "model": "qwen3.8:27b", "messages": [{"role": "user", "content": "안녕하세요"}] }'

올라마는 OpenAI 호환 형식의 API도 함께 제공하므로, OpenAI API로 만들어진 프로그램은 주소와 모델 이름만 바꿔 붙일 수 있습니다. llama.cpp의 llama-server도 같은 방식입니다. 코덱스 CLI처럼 OpenAI 형식으로 부르는 도구는 이 주소를 지정하면 되고, 클로드 코드는 올라마가 따로 제공하는 앤트로픽 호환 API 주소(ANTHROPIC_BASE_URL=http://localhost:11434)를 지정해 연결합니다. 2026년 9월 28일 올라마 문서 기준이며, 연결 절차는 코딩 에이전트와 로컬 모델 연결에서 다룹니다. API가 무엇인지 알고 있으면 이 연결이 어떻게 되는지 바로 잡힙니다.

한 가지 알아 둘 점이 있습니다. 올라마 공식 문서는 2026년 9월 기준으로 로컬 모델과 함께 클라우드 모델도 제공한다고 적었습니다. 같은 명령으로 부르더라도 클라우드 모델은 요청이 올라마 서버로 나가므로, 자료가 밖으로 나가지 않는 것이 목적이라면 로컬에 내려받은 모델을 쓰고 있는지 ollama list로 확인합니다.

🛠️ llama.cpp를 직접 쓰는 경우

올라마로 충분한데 llama.cpp를 직접 쓰는 이유는 셋입니다.

  • 실행 옵션을 세밀하게 만질 때: GPU에 올릴 층 수, 컨텍스트 길이, 여러 GPU에 나누는 비율 같은 옵션을 직접 지정합니다. 그래픽카드 두 장에 가중치를 나눠 올리는 것도 llama.cpp의 옵션으로 합니다.
  • 새 모델 구조를 먼저 써야 할 때: 새 구조의 모델은 llama.cpp에 지원이 먼저 들어가는 경우가 많습니다. Qwen3.8-Flash-Next는 가중치 공개 다음 날 llama.cpp에 지원이 반영됐습니다.
  • 여러 대에 나눠 올릴 때: RPC 백엔드로 한 모델을 여러 컴퓨터의 메모리에 나눠 올릴 수 있습니다. DGX 스파크 두 대를 묶는 커뮤니티 기록에 이 방식이 쓰였습니다.

빌드는 저장소 안내대로 하면 되고, 맥에서는 Metal이 기본으로 켜집니다. 엔비디아 카드에서는 CUDA 옵션을 켜서 빌드합니다. 처음 시작하는 단계라면 올라마로 모델이 돌아가는 것을 먼저 확인하고, 옵션이 필요해질 때 넘어와도 늦지 않습니다.

🐢 느릴 때 확인하는 순서

답이 비정상적으로 느리면 순서대로 봅니다.

  1. ollama ps로 실행 장치를 봅니다. CPU라면 모델이 GPU 메모리에 다 올라가지 못한 것입니다. 더 작은 양자화판이나 더 작은 모델로 바꿉니다. 양자화 이름은 양자화에 있습니다.
  2. 생각 과정이 켜져 있는지 봅니다. Qwen3.8처럼 생각 모드가 기본인 모델은 답하기 전에 추론 토큰을 길게 만듭니다. 짧은 답이 필요하면 끕니다.
  3. 컨텍스트 길이를 봅니다. 길게 잡을수록 KV 캐시가 커져 메모리와 시간이 더 듭니다.
  4. 대역폭을 봅니다. GPU에서 도는데도 느리면 장비의 메모리 대역폭이 상한입니다. 하드웨어 기초의 계산으로 기대치를 확인합니다.

⚠️ 자주 하는 실수

  • ollama serve 없이 run부터 칩니다: 맥 앱으로 설치했으면 자동으로 떠 있지만, 홈브루로 설치했으면 서버를 먼저 띄웁니다.
  • 내려받기 크기와 목록 크기가 달라 당황합니다: 27B가 받을 때는 18GB, ollama list에서는 17GB로 보이는데 두 화면의 단위가 달라서이고 파일은 같습니다.
  • API 주소를 밖에 열어 둡니다: 11434번 포트를 공유기에서 인터넷으로 열면 아무나 모델을 부를 수 있습니다. 밖에서 쓰려면 원격 접속의 방법을 씁니다.
  • 클라우드 모델을 로컬로 착각합니다: 올라마의 클라우드 모델은 요청이 밖으로 나갑니다.

❓ 자주 묻는 질문

올라마와 LM Studio 가운데 무엇으로 시작하나요?

터미널이 익숙하면 올라마, 화면이 편하면 LM Studio입니다. 둘 다 같은 계열의 엔진을 쓰고 GGUF 모델을 읽으므로 결과에 큰 차이가 없습니다. 다른 프로그램에 연결하거나 집 컴퓨터에 두고 밖에서 붙을 계획이면 명령과 API가 단순한 올라마 쪽이 다루기 쉽습니다.

허깅페이스에서 받은 GGUF 파일을 올라마에서 쓸 수 있나요?

쓸 수 있습니다. 올라마는 자기 저장소의 모델 말고도 허깅페이스의 GGUF 저장소를 주소로 지정해 내려받는 방법을 지원합니다. 다만 처음에는 올라마 저장소에 있는 이름으로 시작하는 편이 태그와 기본 설정이 맞춰져 있어 편합니다.

윈도우에서도 같은 명령인가요?

같습니다. 올라마는 윈도우 설치 파일을 제공하고 명령은 파워셸에서 그대로 씁니다. 엔비디아 카드가 있으면 CUDA로 실행되고, 2026년 IFA에서 발표된 최적화도 윈도우의 올라마와 LM Studio에 적용됩니다.

vLLM은 무엇이 다른가요?

vLLM은 여러 요청을 묶어 처리하는 서빙용 도구라 한 사람이 쓰는 개인 장비보다 여러 사람이 동시에 부르는 서버에 맞습니다. Qwen3.8 27B 모델 카드도 개인 실행에는 llama.cpp와 올라마와 LM Studio를, 서비스 배포에는 vLLM과 SGLang을 권합니다. 집에서 혼자 쓰는 단계라면 올라마로 충분합니다.

📋 3줄 요약

  1. llama.cpp는 GGUF 모델을 Metal과 CUDA와 Vulkan 등 여러 하드웨어에서 실행하는 MIT 라이선스 C/C++ 엔진이고, 올라마는 그 엔진을 바탕으로 내려받기와 실행과 API를 명령 몇 줄로 묶은 프로그램입니다.

  2. 올라마는 ollama pull로 모델을 받고 ollama run으로 대화하며 ollama ps로 GPU에서 도는지 확인하고, 실행 중에는 localhost 11434번 포트로 다른 프로그램이 부를 수 있는 API가 열립니다.

  3. 처음에는 올라마나 LM Studio로 시작하고, 실행 옵션을 세밀하게 만지거나 새 모델 구조를 먼저 써야 할 때 llama.cpp를 직접 씁니다.

참고 자료

Share

제대로 이해했는지 한 문제로 확인해 볼까요?

답을 고르면 바로 풀이가 나와요.

올라마로 모델을 올린 뒤 답이 몇 분씩 걸릴 때 가장 먼저 확인할 명령과 볼 곳은 무엇일까요?

9개념 / 클래스큐원(Qwen) 모델 패밀리 구분, 3.8과 Max와 Flash와 이미지와 TTS