로컬 AI 하드웨어 기초, VRAM과 통합 메모리와 대역폭
로컬 AI가 돌아가는지는 GPU가 쓸 수 있는 메모리 용량이 정하고, 답이 나오는 속도는 메모리 대역폭이 정합니다. 그래픽카드는 카드에 붙은 VRAM이 그 한도이고, 애플 실리콘과 DGX 스파크 같은 통합 메모리 구조는 CPU와 나눠 쓰는 메모리 전체가 한도입니다.
같은 말:VRAM 뜻통합 메모리메모리 대역폭로컬 LLM 사양GPU 메모리
목차
🤔 메모리가 24GB인데 17GB 모델이 안 올라갈 때
모델 파일이 17GB이고 컴퓨터 메모리가 24GB면 7GB가 남으니 될 것 같은데, 실제로 올려 보면 GPU가 아니라 CPU에서 실행되어 한 문장에 몇 분씩 걸리는 일이 있습니다. 반대로 메모리가 128GB나 되는 장비를 샀는데 32GB짜리 그래픽카드보다 답이 느리게 나오기도 합니다.
두 경우 모두 사양표의 어느 숫자가 무엇을 정하는지 몰라서 생기는 일입니다. 로컬 AI에서 메모리 용량과 메모리 대역폭과 연산 성능이 각각 무엇을 정하는지, 그래픽카드와 통합 메모리 구조가 어떻게 다른지를 정리했습니다.
🔑 로컬 AI 하드웨어의 세 가지 숫자
로컬 AI가 돌아가는지는 GPU가 쓸 수 있는 메모리 용량이 정하고, 답이 나오는 속도는 메모리 대역폭이 정하며, 긴 입력을 읽는 속도는 연산 성능이 정합니다.
사양표에서 볼 숫자는 셋입니다.
| 숫자 | 단위 | 정하는 것 | 비유 |
|---|---|---|---|
| 메모리 용량 | GB | 어떤 크기의 모델까지 올라가는지 | 물탱크의 크기 |
| 메모리 대역폭 | GB/s | 토큰을 하나씩 만드는 속도 | 물탱크에서 나오는 수도관의 굵기 |
| 연산 성능 | TOPS, 페타플롭 | 긴 입력을 한꺼번에 읽는 속도 | 물을 끌어올리는 펌프의 힘 |
세 가지 가운데 먼저 보는 것은 용량입니다. 모델은 실행하는 동안 가중치 전체가 GPU가 쓰는 메모리에 한 번에 올라가 있어야 합니다. 탱크가 모자라면 관이 굵어도 소용이 없습니다.
🎮 그래픽카드의 VRAM과 통합 메모리의 차이
GPU가 쓰는 메모리는 컴퓨터 구조에 따라 두 가지로 나뉩니다.
- 그래픽카드 방식: 카드에 붙은 전용 메모리인 VRAM(Video RAM)이 한도입니다. 컴퓨터 본체의 메모리가 64GB여도 모델은 카드의 VRAM에 들어가야 합니다. 소비자용 카드 가운데 큰 편인 RTX 5090이 32GB이고, 워크스테이션용 RTX PRO 6000이 96GB입니다.
- 통합 메모리 방식: CPU와 GPU가 메모리 하나를 나눠 씁니다. 애플 실리콘 맥과 엔비디아 DGX 스파크, 2026년 10월 출시 예정인 RTX 스파크가 이 구조입니다. 같은 총 메모리라면 GPU가 쓸 수 있는 몫이 그래픽카드 방식보다 훨씬 넓습니다.
통합 메모리라고 해서 사양표의 용량을 모델이 다 쓰는 것은 아닙니다. macOS는 GPU에 내줄 수 있는 몫에 한도를 두는데 기본값은 대략 전체의 75%이고, 24GB 기기에서는 약 18GB입니다. 준이아빠블로그에서 24GB 맥에 Qwen3.8 27B를 올렸을 때 모델 본체와 버퍼를 합친 약 17GB가 이 18GB 한도에 여유 없이 걸려 모델 전체가 CPU로 갔습니다. 한도를 넘긴 만큼만 CPU로 가는 것이 아니라 모델 전체가 CPU에서 실행되므로, 조금 모자란 것과 많이 모자란 것의 결과가 같습니다.
엔비디아도 RTX 스파크 포팅 가이드에서 128GB 가운데 GPU가 쓸 수 없는 CPU 전용 영역을 따로 둔다고 밝히고 있어서, 이 구조에서는 사양표 용량의 8할 안팎을 실제 한도로 잡는 편이 안전합니다. 장비마다 다른 이 배정 방식은 DGX 스파크와 맥에서 로컬 AI에서 이어서 다룹니다.
📐 모델에 필요한 메모리를 어림하는 방법
필요한 용량은 파라미터 수와 정밀도로 정해집니다. 파라미터는 모델이 학습하면서 맞춰 둔 숫자 하나하나이고, 27B는 그 숫자가 273억 개라는 뜻입니다. 정밀도는 숫자 하나를 몇 비트로 저장하는지이고, 개인 장비에서는 대개 4비트로 압축해서 씁니다. 압축 방법은 양자화에서 따로 다룹니다.
4비트 기준 어림셈은 파라미터 수에 0.5바이트를 곱한 값에 실행 도구와 컨텍스트용 여유를 더하는 것입니다.
| 모델 크기 | 4비트 가중치 | 여유를 더한 필요 메모리 (추정) |
|---|---|---|
| 8B | 약 4GB | 약 6GB |
| 27B | 약 13.5GB | 약 17GB |
| 70B | 약 35GB | 약 42GB |
| 120B | 약 60GB | 약 70GB |
27B의 17GB는 준이아빠블로그에서 Qwen3.8 27B를 내려받았을 때의 실제 파일 크기와 거의 같았습니다. 컨텍스트를 길게 잡으면 대화 내용을 저장하는 KV 캐시가 커지므로 여유를 더 둡니다. 어느 크기를 골라야 하는지는 모델 크기 고르기에서 장비별로 정리합니다.
🚰 대역폭이 답하는 속도를 정하는 이유
모델이 답을 만드는 과정은 두 단계로 나뉩니다. 입력한 내용 전체를 한 번에 읽어 내부 상태를 만드는 프리필(prefill)과, 토큰을 하나씩 만들어 내는 디코드(decode)입니다. 디코드에서는 토큰 하나를 만들 때마다 가중치 전체를 메모리에서 한 번씩 읽어야 하므로, 초당 토큰 수의 상한은 대역폭을 가중치 크기로 나눈 값에 가깝습니다.
4비트 27B 모델의 가중치 13.5GB를 기준으로 장비별 상한을 계산하면 이렇습니다.
| 장비 | 메모리 | 대역폭 (제조사 표기) | 초당 토큰 상한 (계산값) |
|---|---|---|---|
| DGX 스파크 | 128GB 통합 | 273GB/s | 약 20 |
| 맥 스튜디오 M5 Max | 최대 128GB 통합 | 614GB/s | 약 45 |
| 맥 스튜디오 M5 Ultra | 최대 512GB 통합 | 1.2TB/s | 약 89 |
| RTX 5090 | 32GB VRAM | 1,792GB/s | 약 133 |
오른쪽 열은 계산으로 나온 상한이고 실제 속도는 이보다 낮습니다. 공개된 실측에서 역산하면 달성률이 6할에서 9할 사이였습니다. 표에서 볼 것은 절대값이 아니라 순서입니다. DGX 스파크는 RTX 5090보다 메모리가 네 배 크지만 대역폭은 6분의 1이라, 큰 모델을 올릴 수 있는 장비와 빨리 답하는 장비가 이렇게 나뉩니다. 대역폭 수치는 2026년 9월 28일에 확인한 각 제조사 공식 페이지와 준이아빠블로그의 장비 비교 글 기준입니다.
MoE(Mixture of Experts, 전문가 혼합) 구조의 모델에서는 두 값이 서로 다른 역할을 맡습니다. 파라미터를 잔뜩 갖춰 두되 토큰 하나를 처리할 때는 일부만 계산에 넣는 방식이라, 전체 파라미터는 메모리에 다 올라가야 하지만 토큰마다 읽는 것은 활성 파라미터뿐입니다. 이름이 397B-A17B라면 397B가 메모리를 정하고 17B가 속도를 정합니다. 메모리가 크고 대역폭이 낮은 장비에 활성 파라미터가 작은 MoE 모델이 상대적으로 맞는 이유가 여기에 있습니다.
⚙️ 긴 입력에서는 연산 성능이 먼저 걸립니다
대역폭은 응답의 한쪽만 정합니다. 짧게 묻고 길게 답을 받는 대화라면 디코드가 대부분이지만, 저장소 전체를 읽히거나 긴 문서를 통째로 넣는 작업이라면 프리필이 시간을 잡아먹습니다. 프리필은 연산량이 많아 계산 성능이 한계를 정하고, 입력이 두 배로 늘면 어텐션 연산은 네 배 가까이 늘어납니다.
| 작업 성격 | 주로 걸리는 단계 | 먼저 볼 숫자 |
|---|---|---|
| 짧은 질문과 대화 | 디코드 | 메모리 대역폭 |
| 긴 문서 요약, 저장소 읽기 | 프리필 | 연산 성능 |
| 큰 모델을 올리는 것 자체 | 해당 없음 | 메모리 용량 |
이 구분이 장비 선택을 뒤집기도 합니다. 대역폭만 보면 통합 메모리를 크게 단 맥이 DGX 스파크보다 두 배 넘게 앞서는데, 메모리 512GB 맥 스튜디오를 에이전트 서빙에 쓰다가 프리필이 느려 DGX 스파크로 옮겼다는 홈랩 구성 사례가 있습니다. 긴 입력을 자주 넣는 작업에서 대역폭이 아니라 연산 성능이 먼저 걸린 것으로 보입니다. 개인 사례이므로 그대로 따를 일은 아니지만, 장비를 고르는 기준이 용량 하나가 아니라는 점은 참고할 만합니다.
⚠️ 자주 하는 실수
- 파일 크기와 메모리 용량만 비교합니다: GPU에 배정되는 몫은 사양표 용량보다 작습니다. 파일 크기가 기기 메모리의 절반을 넘으면 내려받기 전에 확인합니다.
- 메모리가 크면 빠를 것이라고 봅니다: 용량은 올라가는지를 정하고 속도는 대역폭이 정합니다. 128GB 장비가 32GB 카드보다 느린 것이 정상입니다.
- CPU 코어 수나 저장 장치 용량을 봅니다: 둘 다 로컬 AI 속도와 거의 관계가 없습니다. 저장 장치는 모델을 처음 불러올 때만 영향을 줍니다.
- 총 파라미터로 속도를 짐작합니다: MoE 모델은 활성 파라미터가 속도를 정합니다. 총 파라미터가 15배 큰 MoE 모델이 작은 밀집 모델보다 두 배 빨랐던 실측이 있습니다.
❓ 자주 묻는 질문
본체 메모리를 늘리면 그래픽카드에서 더 큰 모델이 돌아가나요?
돌아가지 않습니다. 그래픽카드 방식에서는 카드의 VRAM만 GPU 메모리로 쓰이고, 본체 메모리는 CPU 몫입니다. 실행 도구에 따라 VRAM에 안 들어가는 나머지를 본체 메모리로 넘기는 기능이 있지만 그 부분은 CPU가 계산하므로 속도가 크게 떨어집니다. 더 큰 모델이 목표면 VRAM이 큰 카드나 통합 메모리 장비로 가야 합니다.
그래픽카드 두 장을 꽂으면 VRAM이 합쳐지나요?
실행 도구가 가중치를 두 장에 나눠 올리는 방식으로는 됩니다. 다만 RTX 5090은 카드끼리 직접 잇는 NVLink를 지원하지 않아 두 장 사이의 데이터가 메인보드의 PCIe를 거치고, 카드 두 장분의 전원과 케이스 공간이 필요합니다. 두 장을 합쳐도 64GB라 100B급 MoE 모델을 겨우 올리는 정도입니다.
대역폭이 낮은 장비는 쓸모가 없나요?
돌리는 모델의 구조에 따라 다릅니다. 2026년에 공개된 큰 모델 상당수가 MoE 구조라 토큰마다 읽는 양이 총 파라미터보다 훨씬 작고, 이 구조에서는 메모리가 크고 대역폭이 낮은 장비의 약점이 덜 드러납니다. DGX 스파크 한 대에서 총 117B인 MoE 모델이 7.6B 밀집 모델보다 두 배 빠른 디코드 속도를 낸 공개 벤치 기록이 있습니다.
노트북으로도 로컬 AI가 되나요?
메모리에 따라 됩니다. 통합 메모리 24GB 맥북이면 4비트 8B급은 여유 있게 돌아가고, 27B급은 위에서 본 대로 GPU 한도에 걸립니다. 그래픽카드가 들어간 윈도우 노트북은 VRAM이 데스크톱 카드보다 작은 편이라 돌릴 수 있는 범위가 좁습니다. 2026년 10월 출시 예정인 RTX 스파크 노트북이 통합 메모리 128GB로 나오면 이 범위가 달라질 수 있는데, 실측은 출시 뒤에 확인해야 합니다.
📋 3줄 요약
-
로컬 AI가 돌아가는지는 GPU가 쓸 수 있는 메모리 용량이 정하고, 그래픽카드는 VRAM이 그 한도이며 통합 메모리 구조는 CPU와 나눠 쓰는 메모리에서 GPU에 배정되는 몫이 한도입니다.
-
4비트로 압축한 모델의 필요 메모리는 파라미터 수에 0.5바이트를 곱한 값에 여유를 더한 것이라 27B는 약 17GB, 120B는 약 70GB입니다.
-
답이 나오는 속도의 상한은 메모리 대역폭을 가중치 크기로 나눈 값이라 273GB/s인 DGX 스파크보다 1,792GB/s인 RTX 5090이 같은 모델에서 훨씬 빠르고, 긴 문서를 넣는 작업에서는 연산 성능이 먼저 걸립니다.
참고 자료

제대로 이해했는지 한 문제로 확인해 볼까요?
답을 고르면 바로 풀이가 나와요.
같은 4비트 27B 모델을 돌릴 때 RTX 5090 데스크톱이 DGX 스파크보다 답을 훨씬 빨리 내는 이유는 무엇일까요?

