Qwen3.8 27B 로컬 실행 결과: 24GB 맥에서는 CPU로 떨어집니다
Qwen3.8 27B는 알리바바 Qwen 팀이 2026년 8월 공개한 Apache 2.0 오픈 웨이트 모델입니다. 메모리 24GB 맥미니 M4 프로에 직접 설치해 돌려 보니 GPU에 올라가지 못하고 CPU로 실행됐고, 그때 측정한 속도를 그대로 정리했습니다.

Qwen3.8 27B를 내려받기 전에 확인할 것
내 컴퓨터에서 도는 AI 모델이 늘고 있습니다. 클라우드에 보내지 못하는 자료를 다룰 때, 또는 토큰 요금 없이 계속 돌려야 할 때 쓰는 방식입니다.
문제는 사양입니다. 모델 파일 크기와 내 컴퓨터 메모리를 견주면 될 것 같지만, 그 계산이 맞지 않습니다. 파일이 메모리보다 작아도 GPU에 올라가지 못하는 경우가 있습니다.
Qwen3.8 27B는 알리바바 Qwen 팀이 2026년 8월 공개한 Apache 2.0 오픈 웨이트 모델입니다. 가중치를 내려받아 자기 컴퓨터에서 제한 없이 실행할 수 있습니다.
메모리 24GB 맥미니 M4 프로에 직접 설치해 돌려 봤습니다. 결론부터 적으면 이 기기에서는 GPU가 아니라 CPU에서 실행됐고, 실용적인 속도가 나오지 않았습니다. 18GB를 내려받기 전에 알면 시간을 아낄 수 있는 내용이라 측정한 값을 그대로 정리했습니다.
Qwen3.8 27B가 어떤 모델인지
같은 이름을 쓰는 모델이 둘이라 먼저 구분하겠습니다. 준이아빠블로그에서 앞서 다룬 Qwen3.8-Max (Max 사양과 가격 바로가기)와는 다른 모델입니다.
| Qwen3.8-Max | Qwen3.8 27B | |
|---|---|---|
| 구조 | 2조 4천억 파라미터 MoE | 273억 파라미터 |
| 실행 방식 | 클라우드 API | 내 컴퓨터 |
| 가중치 | 2026년 8월 4일 기준 미공개 | Apache 2.0으로 공개 |
| 비용 | 토큰당 과금 | 전기값 |
Apache 2.0은 가중치를 내려받아 고치고 상업적으로 써도 되는 라이선스입니다. 자체 서버에 올려 쓰는 선택지가 열린다는 뜻이라, 클라우드에 자료를 보내기 어려운 곳에서 볼 만한 모델이라고 할 수 있습니다.
공식 모델 카드에 적힌 사양은 이렇습니다.
| 항목 | 값 |
|---|---|
| 파라미터 | 27.3B (은닉 차원 5120, 64개 층) |
| 입력 | 텍스트, 이미지, 영상 |
| 컨텍스트 | 262,144 토큰, YaRN으로 100만까지 확장 |
| 양자화 | Q4_K_M (Ollama 기본 태그) |
| 설치 크기 | 17GB |
벤치마크는 SWE-bench Pro 61.7, GPQA Diamond 89.2, OSWorld 84.3으로 발표됐습니다. 알리바바가 직접 낸 수치이므로 참고용으로만 봅니다.

설치와 내려받기
Ollama를 쓰면 명령 두 줄로 끝납니다. Ollama는 로컬 모델을 내려받아 실행해 주는 프로그램입니다.
brew install ollama
ollama serve다른 터미널 창에서 모델을 받습니다.
ollama pull qwen3.8:27b18GB를 받는 동안 기다립니다. 이 컴퓨터에서는 40분쯤 걸렸습니다. 회선에 따라 달라집니다.
받고 나면 목록에 나옵니다. 표시 크기는 17GB입니다.

모델이 어떤 기능을 갖췄는지는 ollama show로 봅니다. 이미지를 읽는 기능(vision)과 도구 호출(tools), 생각 과정(thinking)이 함께 들어 있고, 라이선스가 Apache 2.0으로 적혀 있습니다.

실행하자 CPU로 떨어졌습니다
여기서 예상과 다른 일이 생겼습니다. 모델을 올린 뒤 ollama ps로 확인하니 실행 장치가 CPU였습니다.

PROCESSOR 열의 100% CPU가 그 표시입니다. 애플 실리콘에서 GPU를 쓰고 있으면 이 열에 GPU라고 나옵니다.
실행 기록을 열어 보면 모델 전체가 CPU 쪽으로 올라간 것이 보입니다.
load_tensors: CPU model buffer size = 16021.46 MiB
llama_kv_cache: CPU KV buffer size = 256.00 MiB
clip_ctx: CLIP using CPU backend이미지를 읽는 모듈(CLIP)까지 CPU로 갔습니다.
왜 24GB로 모자랐는지
메모리가 24GB인데 모델이 17GB이니 7GB가 남는 것처럼 보입니다. 그런데 그 7GB를 모델이 다 쓸 수 있는 것은 아닙니다.
애플 실리콘은 메모리 하나를 CPU와 GPU가 나눠 씁니다. 창고 하나를 두 사람이 함께 쓰되 한쪽이 채울 수 있는 칸수가 정해져 있듯, macOS는 GPU에 내줄 수 있는 몫에 한도를 둡니다. 기본값은 대략 전체의 75%이고, 24GB 기기에서는 약 18GB입니다.
여기에 실제로 필요한 양을 더해 보면 이렇습니다.
| 항목 | 크기 |
|---|---|
| 모델 본체 | 약 15.6GB |
| 순환 메모리 버퍼 | 약 0.73GB |
| KV 캐시 (컨텍스트 4096 기준) | 0.25GB |
| 계산용 버퍼와 비전 모듈 | 약 0.5GB |
| 합계 | 약 17GB |
18GB 한도에 17GB가 들어가니 될 것 같지만, 여유가 거의 없어 실제로는 들어가지 못했습니다.
여기서 확인해 둘 점이 있습니다. 모델이 한도를 넘긴 만큼만 CPU로 가는 것이 아닙니다. 창고 칸이 하나라도 모자라면 짐을 통째로 다른 곳에 두게 되듯, 한도를 넘으면 모델 전체가 CPU에서 실행됩니다. 조금 모자란 것과 많이 모자란 것의 결과가 같습니다.
실제로 잰 속도
CPU에서 도는 27B 모델이 얼마나 느린지 재 봤습니다. 질문은 1+1은? 한 줄이고, 생각 과정을 끄고 출력을 40토큰으로 제한한 조건입니다.
| 항목 | 값 |
|---|---|
| 질문 | 1+1은? |
| 전체 소요 | 218.2초 |
| 출력 | 10토큰 |
| 생성 속도 | 초당 0.08토큰 |
한 문장을 답하는 데 3분 38초가 걸렸습니다. 초당 0.08토큰이면 300토큰짜리 답변 하나에 한 시간이 넘습니다.
앞서 생각 과정을 켜고 세 문장짜리 한국어 질문을 던졌을 때는 10분을 기다려도 답이 나오지 않아 중간에 멈췄습니다. 실무에 쓸 수 있는 속도가 아닙니다.
더 작은 것으로 맞출 수 없는 이유
보통은 양자화를 낮춰 파일 크기를 줄입니다. 이 모델에는 그 방법이 없습니다.
Ollama에 올라온 27B 계열 태그를 보면 가장 작은 것이 18GB입니다.
| 태그 | 크기 |
|---|---|
qwen3.8:27b (기본) | 18GB |
qwen3.8:27b-q4_K_M | 18GB |
qwen3.8:27b-nvfp4 | 18GB |
qwen3.8:27b-q8_0 | 30GB |
qwen3.8:27b-bf16 | 56GB |
기본 태그가 이미 Q4_K_M입니다. 더 줄인 태그가 없습니다. Qwen3.8은 27B 한 가지 크기로만 나와 있어서 같은 계열의 더 작은 모델로 바꾸는 선택지도 없습니다.
그래서 어떤 기기가 필요한가요?
측정한 기기가 한 대뿐이라 단정하기는 어렵습니다. 다만 나온 값으로 추정하면 이렇게 볼 수 있습니다.
| 메모리 | 예상 |
|---|---|
| 16GB | 실행 자체가 어렵습니다 |
| 24GB | 여기서 측정한 경우입니다. CPU로 실행되어 실용성이 없습니다 |
| 32GB | GPU 한도가 약 24GB가 되므로 여유가 생깁니다 |
| 48GB 이상 | 컨텍스트를 늘려도 여유가 있습니다 |
macOS의 GPU 할당 한도는 sysctl 설정으로 올릴 수 있다고 알려져 있습니다. 다만 이 글에서는 확인하지 않았으므로 된다고 적지 않겠습니다. 시스템 설정을 바꾸는 일이라 되돌리는 방법까지 알고 하시는 편이 안전합니다.
그러면 24GB 맥에서는 로컬 모델을 못 쓰나요?
27B급이 어려울 뿐입니다. 파일 크기가 GPU 한도 안에 넉넉히 들어가는 모델이라면 같은 기기에서도 GPU로 실행될 것으로 보입니다. 다만 이번에는 27B만 측정했으므로 다른 크기의 결과는 확인하지 않았습니다.
판단 기준을 하나로 정리하면 이렇습니다. 모델 파일 크기가 기기 메모리의 절반을 넘으면 내려받기 전에 확인합니다. 24GB 기기에서는 12GB 안쪽이 무난한 편입니다.
클라우드 대신 로컬 모델을 쓰는 경우는 언제인가요?
속도만 놓고 보면 클라우드 쪽이 앞섭니다. 그런데도 로컬을 보는 이유가 있습니다.
- 밖으로 내보내면 안 되는 자료를 다룰 때입니다. 계약서, 고객 명단, 사내 문서가 여기 해당합니다.
- 같은 작업을 아주 많이 반복할 때입니다. 토큰 요금이 쌓이는 구간에서는 전기값이 더 쌉니다.
- 인터넷이 끊긴 곳에서 써야 할 때입니다.
이 세 가지에 해당하지 않으면 클라우드 쪽이 편합니다. 코덱스 CLI나 클로드 코드를 쓰는 방법은 코덱스 CLI 사용법 (빈 폴더에서 도구 만들기 바로가기)과 두 도구 비교 (같은 일을 시켜 비교한 결과 바로가기)에 정리해 두었습니다.
3줄 요약
- Qwen3.8 27B는 알리바바 Qwen 팀이 2026년 8월 공개한 Apache 2.0 오픈 웨이트 모델입니다. 설치 크기는 17GB이고 텍스트, 이미지, 영상을 읽습니다.
- 메모리 24GB 맥미니 M4 프로에서는 GPU 할당 한도를 넘겨 전체가 CPU에서 실행됐습니다.
1+1은?한 줄에 218초, 초당 0.08토큰이 나왔습니다. - Q4_K_M이 이미 가장 작은 양자화라 줄여서 맞출 방법이 없습니다. 모델 파일이 기기 메모리의 절반을 넘으면 내려받기 전에 확인하는 편이 낫습니다.
Sources
이 글이 도움이 되셨다면 공유해 주세요
메신저로 바로 보내거나 링크를 복사할 수 있습니다.

Written by
데이터로 설명하는 마케터
디지털마케터 뉴스레터
GA4, SEO, AI 마케팅 실무 인사이트를 월 1~2회 이메일로 보내드립니다.
다음으로 읽어볼 글

코덱스 CLI와 클로드 코드는 터미널에서 파일을 직접 읽고 만드는 코딩 도구입니다. 두 도구에 똑같은 규격서를 주고 같은 도구를 만들게 해서 걸린 시간, 결과물 규모, 안전장치가 어떻게 다른지 측정했습니다.
2026. 8. 16.
코덱스 CLI는 터미널에서 파일을 직접 읽고 만드는 코딩 도구입니다. 빈 폴더에서 시작해 내 글이 AI 답변에 인용되기 쉬운지 확인하는 GEO 점검 도구가 나올 때까지, 시킬 말 전문과 명령을 그대로 정리했습니다.
2026. 8. 16.
AI 배포 경쟁은 같은 모델을 몇 개의 화면에 넣어 두느냐로 우열이 정해지는 경쟁입니다. 2026년 8월 12일부터 15일 사이에 나온 발표 다섯 건을 놓고, 각 회사가 모델을 어디까지 밀어 넣었는지 공식 자료 기준으로 정리했습니다.
2026. 8. 15.
클로드 코드를 설치했는데 검은 PowerShell 창이 부담스러운 분을 위해, VS Code를 설치하고 그 안 터미널에서 클로드 코드를 실행하는 순서를 화면 그림과 함께 정리했습니다. 승인 질문을 건너뛰는 bypass 모드까지 담았습니다.
2026. 8. 12.메모리 24GB 맥에서 17GB 모델을 실행하면 어떻게 될까요?