커뮤니티 입장하기

맥에서 로컬 AI 돌리기, 애플 실리콘 메모리와 되는 모델 크기

애플 실리콘 맥은 CPU와 GPU가 통합 메모리 하나를 나눠 쓰는 구조라 그래픽카드 없이도 로컬 AI를 돌릴 수 있고, 돌아가는 모델 크기는 사양표의 메모리가 아니라 macOS가 GPU에 내주는 몫이 정합니다. 24GB 맥에서는 4비트 8B급이 편하고 27B급은 GPU 한도에 걸립니다.

같은 말:맥 로컬 LLM맥미니 AI애플 실리콘 LLM맥 스튜디오 로컬 AIM4 로컬 모델

새로 올라온 개념이에요. 먼저 읽어 보고 퀴즈도 풀어 보세요
Share
목차
  1. 🤔 그래픽카드가 없는 맥으로 로컬 AI가 되는지 물었을 때
  2. 🔑 맥에서 로컬 AI가 돌아가는 원리
  3. 🧮 GPU에 내주는 몫이 사양표보다 작습니다
  4. 📏 메모리 용량별로 편하게 돌아가는 모델 크기
  5. 🖥️ 맥 스튜디오 M5 Max와 M5 Ultra의 위치
  6. 🔧 맥에서 실제로 되는 것
  7. ⚠️ 자주 하는 실수
  8. ❓ 자주 묻는 질문
  9. 📋 3줄 요약
  10. 참고 자료

🤔 그래픽카드가 없는 맥으로 로컬 AI가 되는지 물었을 때

로컬 AI 이야기에는 엔비디아 그래픽카드가 늘 따라 나오는데, 맥에는 그래픽카드를 꽂을 수 없습니다. 그런데도 로컬 모델용으로 맥 스튜디오가 자주 언급되고, 반대로 24GB 맥미니에 모델을 올렸다가 한 문장에 몇 분씩 걸렸다는 이야기도 있습니다.

둘 다 맞는 이야기이고, 어느 쪽이 되는지는 메모리 용량과 macOS가 GPU에 내주는 몫이 정합니다. 애플 실리콘 맥에서 로컬 AI가 돌아가는 원리, 메모리 용량별로 편하게 돌아가는 모델 크기, 준이아빠블로그에서 24GB 맥미니로 직접 확인한 결과를 정리했습니다.

🔑 맥에서 로컬 AI가 돌아가는 원리

애플 실리콘 맥은 CPU와 GPU가 통합 메모리 하나를 나눠 쓰는 구조라 그래픽카드 없이도 로컬 AI를 돌릴 수 있고, 돌아가는 모델 크기는 사양표의 메모리가 아니라 macOS가 GPU에 내주는 몫이 정합니다.

2020년 이후의 M 시리즈 칩은 CPU와 GPU가 한 칩에 들어 있고 메모리도 하나를 함께 씁니다. 그래픽카드 방식에서는 카드에 붙은 VRAM만 GPU 메모리인데, 맥에서는 기기 메모리 대부분을 GPU가 쓸 수 있습니다. 32GB VRAM 카드가 소비자용 가운데 큰 편인 것과 견주면, 128GB 맥은 같은 돈으로 훨씬 넓은 작업대를 갖는 셈입니다. 이 구조는 하드웨어 기초에서 그래픽카드 방식과 나란히 다뤘습니다.

실행 도구 쪽도 준비되어 있습니다. llama.cpp는 애플의 GPU 프레임워크인 Metal을 기본으로 지원하고, 올라마는 맥 설치 파일을 제공합니다. 애플이 만든 MLX 프레임워크용 모델도 따로 있어서 올라마 라이브러리에는 27b-mlx처럼 MLX 판 태그가 함께 올라옵니다.

🧮 GPU에 내주는 몫이 사양표보다 작습니다

여기서 24GB 맥미니의 일이 생깁니다. 메모리가 24GB인데 모델이 17GB이니 7GB가 남는 것처럼 보이지만, 그 7GB를 모델이 다 쓸 수 있는 것은 아닙니다. macOS는 GPU에 내줄 수 있는 몫에 한도를 두는데, 기본값은 대략 전체의 75%이고 24GB 기기에서는 약 18GB입니다.

준이아빠블로그에서 메모리 24GB 맥미니 M4 프로에 Qwen3.8 27B를 올렸을 때 필요한 양은 이랬습니다.

항목크기
모델 본체약 15.6GB
순환 메모리 버퍼약 0.73GB
KV 캐시 (컨텍스트 4096 기준)0.25GB
계산용 버퍼와 비전 모듈약 0.5GB
합계약 17GB

18GB 한도에 17GB가 들어가니 될 것 같지만 여유가 거의 없어 실제로는 들어가지 못했고, 모델 전체가 CPU에서 실행됐습니다. 한도를 넘긴 만큼만 CPU로 가는 것이 아니라 통째로 가므로, 조금 모자란 것과 많이 모자란 것의 결과가 같습니다. 그 상태에서 1+1은? 한 줄에 답하는 데 218초가 걸렸고 생성 속도는 초당 0.08토큰이었습니다.

GPU 한도는 시스템 설정으로 올릴 수 있다고 알려져 있지만, 준이아빠블로그에서 직접 확인하지는 않았으므로 된다고 적지 않겠습니다. 시스템 값을 바꾸는 일이라 되돌리는 방법까지 알고 하시는 편이 안전합니다.

📏 메모리 용량별로 편하게 돌아가는 모델 크기

측정한 기기가 한 대라 단정하기는 어렵지만, 4비트 기준 필요 메모리와 GPU 한도를 놓고 어림하면 이렇게 볼 수 있습니다.

통합 메모리GPU 몫 (약 75%)편하게 돌아가는 범위비고
16GB약 12GB4비트 8B급 (약 6GB)27B는 실행 자체가 어려움
24GB약 18GB4비트 8B에서 12B급, 파일 12GB 안쪽27B는 여기서 측정한 대로 CPU로 떨어짐
32GB약 24GB4비트 27B급 (약 17GB)컨텍스트를 길게 잡으면 빠듯함
64GB약 48GB4비트 70B급 (약 42GB)밀집 70B는 대역폭 때문에 속도가 느린 편
128GB약 96GB100B급 MoE (약 60에서 70GB)맥 스튜디오 M5 Max 최대 구성
512GB약 384GB397B급 MoE (약 215GB)맥 스튜디오 M5 Ultra, 10월 말 출하

판단 기준을 하나로 줄이면 모델 파일 크기가 기기 메모리의 절반을 넘으면 내려받기 전에 확인한다입니다. 크기를 고르는 방법은 모델 크기 고르기에서, 파일을 줄이는 방법은 양자화에서 이어집니다.

🖥️ 맥 스튜디오 M5 Max와 M5 Ultra의 위치

애플이 2026년 8월 25일 발표하고 9월 22일 출하한 맥 스튜디오는 로컬 AI용으로 나온 장비 가운데 메모리와 대역폭이 모두 높은 편입니다. 애플 뉴스룸 기준 수치입니다.

항목맥 스튜디오 M5 Max맥 스튜디오 M5 Ultra
통합 메모리최대 128GB최대 512GB
메모리 대역폭614GB/s1.2TB/s
시작 가격2,499달러5,499달러
출하2026년 9월 22일2026년 9월 22일, 512GB 구성은 10월 말

같은 128GB인 DGX 스파크와 견주면 대역폭이 두 배 넘게 높아 같은 모델에서 답이 더 빨리 나옵니다. 512GB 구성은 2026년 9월 기준 개인이 살 수 있는 장비 가운데 메모리가 가장 큰 축이라, 그 위 구간은 맥만 남습니다. 애플은 이 구성으로 대형 오픈 웨이트 모델을 기기 안에서 통째로 돌릴 수 있다고 밝혔는데 파라미터 수를 적지는 않았습니다.

맥이 약한 대목도 적어 둡니다. 긴 문서를 통째로 넣는 작업에서는 대역폭이 아니라 연산 성능이 먼저 걸리는데, 메모리 512GB 맥 스튜디오를 에이전트 서빙에 쓰다가 프리필이 느려 DGX 스파크로 옮겼다는 홈랩 구성 사례가 있습니다. 컴피UI 공식 문서도 최근의 큰 이미지 생성 모델은 애플 GPU로는 실용적인 속도가 나오지 않는다며 맥 이용자에게 클라우드를 권합니다. 짧은 대화와 문서 정리에는 맥이 편하고, 긴 입력을 자주 넣거나 이미지 생성이 목적이면 다른 장비를 함께 봅니다.

🔧 맥에서 실제로 되는 것

준이아빠블로그에서 24GB 맥미니로 확인한 범위입니다.

  • 작은 언어 모델: 파일이 12GB 안쪽인 모델은 같은 기기에서 GPU로 실행될 것으로 보입니다. 다만 27B만 측정했으므로 다른 크기의 결과는 확인하지 않았습니다.
  • 음성 합성 모델: Qwen3-TTS 1.7B 모델은 파일이 약 4GB라 제로샷 목소리 복제가 여유 있게 돌아갔고, 0.6B 모델의 미세조정까지 됐습니다. 공식 문서는 엔비디아 CUDA만 다루지만 파이토치의 device_map을 mps로 바꾸면 그대로 동작했습니다. 과정은 Qwen3-TTS 목소리 복제 기록에 있습니다.
  • 집에 두는 실행체: 맥미니는 전력이 낮고 조용해서 24시간 켜 두는 실행체로 맞습니다. 밖에서 붙는 구성은 원격 접속에서 다룹니다.

⚠️ 자주 하는 실수

  • 사양표 메모리와 파일 크기만 비교합니다: GPU 몫은 기본값 기준 75% 안팎이고 버퍼가 더 붙습니다. 절반 규칙으로 봅니다.
  • 더 작은 양자화판을 찾으면 된다고 봅니다: Qwen3.8 27B는 올라마 기본 태그가 이미 4비트라 더 줄인 태그가 없었습니다. 모델에 따라 그 방법이 없습니다.
  • 맥이면 모든 로컬 작업이 편하다고 봅니다: 긴 입력의 프리필과 큰 이미지 생성 모델은 맥이 약한 편입니다.
  • 인텔 맥에서 같은 결과를 기대합니다: 통합 메모리 구조는 M 시리즈부터입니다.

❓ 자주 묻는 질문

24GB 맥에서는 로컬 모델을 쓸 수 없나요?

27B급이 어려울 뿐입니다. 파일이 GPU 한도 안에 넉넉히 들어가는 모델이라면 같은 기기에서도 GPU로 실행될 것으로 보이고, 24GB 기기에서는 12GB 안쪽이 무난한 편입니다. 4비트 8B급이 여기 해당합니다.

맥북으로도 되나요?

통합 메모리 용량이 같으면 맥북도 같은 범위입니다. 다만 노트북은 오래 돌리면 발열로 속도가 내려갈 수 있고, 뚜껑을 덮으면 작업이 멈추는 설정이 기본이라 종일 켜 두는 실행체로는 맥미니나 맥 스튜디오 쪽이 맞습니다.

로컬 AI용으로 맥을 산다면 메모리를 얼마로 잡아야 하나요?

돌릴 모델 크기에서 거꾸로 정합니다. 27B급이면 32GB부터 여유가 생기고, 70B급이면 64GB가 하한이며, 100B급 MoE를 한 대에 올리려면 128GB가 필요합니다. 128GB 구성은 메모리 부품값 상승으로 여러 제품에서 가격이 오른 상태라, 32GB와 64GB에서 먼저 시험해 보고 올리는 편이 부담이 적습니다.

맥과 DGX 스파크 가운데 무엇이 나은가요?

같은 128GB에서는 맥 스튜디오 M5 Max가 대역폭이 두 배 넘게 높아 답이 빠르고 윈도우 없이 macOS로 씁니다. DGX 스파크는 여러 대를 직접 묶는 포트가 있어 128GB를 넘기는 길이 열려 있고 미세조정 지원을 엔비디아가 공식으로 안내합니다. 짧은 대화와 문서 작업이면 맥, 300B 이상 모델이나 미세조정이면 DGX 스파크 쪽입니다. 장비별 비교는 DGX 스파크에 있습니다.

📋 3줄 요약

  1. 애플 실리콘 맥은 CPU와 GPU가 통합 메모리를 나눠 쓰므로 그래픽카드 없이 로컬 AI가 돌아가지만 macOS가 GPU에 내주는 몫은 기본값 기준 전체의 75% 안팎이라 24GB 기기에서는 약 18GB입니다.

  2. 24GB 맥미니 M4 프로에서 4비트 27B 모델은 GPU에 올라가지 못해 CPU로 실행됐고 한 문장을 답하는 데 218초가 걸렸으므로 24GB에서는 12GB 안쪽 모델이 무난합니다.

  3. 2026년 9월 22일 출하된 맥 스튜디오는 M5 Max가 128GB에 614GB/s로 2,499달러부터, M5 Ultra가 512GB에 1.2TB/s로 5,499달러부터이며 512GB 구성은 10월 말에 나옵니다.

참고 자료

Share

제대로 이해했는지 한 문제로 확인해 볼까요?

답을 고르면 바로 풀이가 나와요.

통합 메모리 24GB 맥에서 17GB짜리 4비트 27B 모델이 CPU로 실행된 이유는 무엇일까요?

7개념 / 클래스양자화(Quantization) 뜻과 GGUF, 4비트가 뜻하는 것