로컬 모델 크기 고르기, 8B와 27B와 70B가 뜻하는 것
모델 이름의 8B와 27B와 70B는 파라미터 수를 10억 개 단위로 적은 것이고, 4비트로 압축했을 때 필요한 메모리는 대략 그 숫자의 절반에 여유를 더한 GB입니다. 어떤 크기를 고를지는 장비의 GPU 메모리 몫에서 거꾸로 정하고, 파일 크기가 기기 메모리의 절반을 넘으면 내려받기 전에 확인합니다.
같은 말:LLM 파라미터 뜻7B 모델70B 모델 사양로컬 모델 추천모델 크기 메모리
목차
🤔 모델 이름의 숫자가 무엇을 뜻하는지 모를 때
로컬 모델을 고르려고 목록을 열면 8B, 27B, 70B, 397B-A17B 같은 숫자가 이름에 붙어 있습니다. 클수록 좋을 것 같아 큰 것을 받았다가 내 컴퓨터에 올라가지 않거나, 반대로 작은 것을 받았다가 답이 아쉬운 일이 생깁니다.
이 숫자가 무엇이고 내 장비에서 어디까지 올라가는지, 큰 모델이 항상 나은 것은 아닌 이유, 그리고 크기를 고르는 순서를 정리했습니다. 수치는 2026년 9월 28일에 확인한 각 모델 카드와 제조사 페이지 기준입니다.
🔑 모델 크기의 정의
모델 이름의 8B와 27B와 70B는 파라미터 수를 10억 개 단위로 적은 것이고, 4비트로 압축했을 때 필요한 메모리는 대략 그 숫자의 절반에 여유를 더한 GB입니다.
파라미터는 모델이 학습하면서 맞춰 둔 숫자 하나하나입니다. B는 billion의 머리글자라 27B는 273억 개, 70B는 700억 개입니다. 나사가 많은 기계일수록 세밀하게 맞출 수 있지만 덩치가 커지듯, 파라미터가 많은 모델도 섬세해지는 만큼 무거워집니다.
숫자를 메모리로 바꾸는 어림셈은 하드웨어 기초에서 쓴 것과 같습니다. 개인 장비에서는 대개 4비트로 압축해 쓰고, 4비트에서 파라미터 하나는 0.5바이트라 파라미터 수에 0.5를 곱하면 가중치 크기가 나옵니다. 여기에 실행 도구와 컨텍스트용 여유를 더합니다.
| 모델 크기 | 4비트 가중치 | 필요 메모리 (추정) | 16비트 원본 |
|---|---|---|---|
| 8B | 약 4GB | 약 6GB | 약 16GB |
| 27B | 약 13.5GB | 약 17GB | 약 54GB |
| 35B-A3B | 약 17.5GB | 약 20GB | 약 70GB |
| 70B | 약 35GB | 약 42GB | 약 140GB |
| 120B | 약 60GB | 약 70GB | 약 240GB |
| 235B | 약 118GB | 약 130GB | 약 470GB |
| 397B-A17B | 약 200GB | 약 215GB | 약 800GB |
이름에 A가 붙은 MoE(전문가 혼합) 모델은 앞의 총 파라미터가 메모리를 정하고 A 뒤의 활성 파라미터가 속도를 정합니다. 397B-A17B는 메모리로는 397B 모델이고 속도로는 17B 모델에 가깝습니다. 압축 수준에 따라 크기가 어떻게 바뀌는지는 양자화에 있습니다.
🖥️ 장비별로 올라가는 모델의 경계
장비의 GPU 메모리 몫과 위 표를 맞추면 경계가 보입니다. 2026년 9월 기준 공개된 큐원과 GLM 모델을 4비트 필요 메모리 순으로 놓은 표입니다.
| 모델 (총, 활성) | 라이선스 | 4비트 필요 메모리 | 32GB (RTX 5090) | 96GB (RTX PRO 6000) | 128GB (DGX 스파크, 맥 M5 Max) | 256GB (DGX 스파크 2대) | 512GB (맥 M5 Ultra) |
|---|---|---|---|---|---|---|---|
| Qwen3.8 27B (조밀형) | Apache 2.0 | 약 17GB | O | O | O | O | O |
| Qwen3.6 35B-A3B | Apache 2.0 | 약 20GB | O | O | O | O | O |
| GLM-4.5 Air 106B-A12B | MIT | 약 60GB | X | O | O | O | O |
| Qwen3.5 122B-A10B | Apache 2.0 | 약 70GB | X | O | O | O | O |
| Qwen3.8 Flash-Next (임베딩 포함 약 180B) | Qwen 커뮤니티 | 약 112GB | X | X | O | O | O |
| GLM-5.3 Flash 320B-A18B | MIT | 약 175GB | X | X | X | O | O |
| Qwen3.5 397B-A17B | Apache 2.0 | 약 215GB | X | X | X | O | O |
| GLM-5.3 753B | 자체 조건 | 약 400GB | X | X | X | X | O |
경계는 셋입니다.
- 32GB 경계: 27B 조밀형과 35B-A3B까지가 그래픽카드 한 장의 범위입니다. 100B급은 한 장으로는 올라가지 않습니다.
- 96GB와 128GB 경계: 100B에서 120B급 MoE가 이 구간입니다. 워크스테이션 카드 한 장이나 128GB 통합 메모리 장비에서 실행됩니다. 다만 맥과 RTX 스파크는 사양표 용량의 8할 안팎만 GPU 몫이라 128GB 장비에서 Flash-Next는 빠듯합니다.
- 256GB 이상: 300B를 넘는 모델은 DGX 스파크 두 대를 묶거나 512GB 맥 스튜디오가 필요합니다.
이 표는 올라가는지만 봅니다. 답이 얼마나 빨리 나오는지는 장비의 대역폭이 정하므로, 32GB 카드에서 돌아가는 27B가 128GB 장비의 27B보다 훨씬 빠릅니다.
⚖️ 큰 모델이 항상 나은 것은 아닙니다
같은 크기라도 모델마다 잘하는 일이 다르고, 작은 모델이 큰 모델을 앞서는 항목도 있습니다. 2026년 9월에 확인된 예를 셋 적습니다.
- 27B가 상위권에 든 예: 사람이 투표하는 Arena의 웹 화면 만들기 부문에서 Qwen3.8 27B가 2026년 8월 22일 집계 기준 전체 117개 모델 가운데 9위였습니다. 앞에 있는 모델 대부분이 훨씬 큰 규모였습니다.
- 같은 크기에서 벌어진 예: 아부다비 IFM의 K2 호라이즌 32B는 비슷한 크기의 Qwen3.8 27B에 터미널 작업 벤치마크에서 36.6 대 79.8로 밀렸습니다. 크기가 같아도 무엇을 어떻게 배웠는지에 따라 결과가 다릅니다.
- 작은 모델이 빨리 좋아지는 이유: 큰 모델이 풀어 놓은 문제로 작은 모델을 학습시키는 증류가 산업 공정이 되면서, 원본 하나가 좋아지면 크기가 다른 증류본 여럿이 함께 좋아집니다. 딥시크는 671B 원본을 증류한 32B가 여러 벤치마크에서 비슷한 크기대의 다른 모델을 앞섰다고 밝혔습니다. 과정은 AI 모델 증류 정리에 있습니다.
반대로 크기가 그대로 드러나는 곳도 있습니다. 여러 단계를 거치는 긴 추론 작업에서는 작은 모델의 한계가 남아 있다는 평가가 많고, 오픈 모델과 폐쇄 모델의 격차도 단답형 지식 문제에서는 거의 따라잡혔는데 오래 돌아가는 에이전트 작업에서는 벌어진 상태입니다. 문서 분류와 요약처럼 반복되는 일은 작은 로컬 모델이 맡고, 여러 단계의 판단은 큰 모델에 넘기는 나눔이 현실적으로 보입니다.
🧭 크기를 고르는 순서
넷을 순서대로 봅니다.
- 장비의 GPU 메모리 몫에서 상한을 정합니다. 그래픽카드는 VRAM, 통합 메모리 장비는 사양표의 8할 안팎입니다. 파일 크기가 기기 메모리의 절반을 넘으면 내려받기 전에 확인합니다.
- 쓰려는 작업에 맞는 모델을 두세 개 고릅니다. 코딩이면 코드 벤치마크, 한국어 문서면 한국어 항목을 보되, 발표 점수는 만든 쪽이 고른 조건이라는 점을 감안합니다. 라이선스는 확인법대로 먼저 봅니다.
- 같은 입력으로 직접 돌려 봅니다. 회사에서 실제로 반복하는 작업 한두 개를 골라 같은 문서를 넣고 답과 속도를 나란히 놓습니다. 표를 읽는 것보다 정확합니다.
- 속도가 모자라면 크기를 내리고, 품질이 모자라면 올리되 장비 상한 안에서 정합니다. 상한을 넘겨야 할 정도면 그 작업은 클라우드로 보냅니다.
준이아빠블로그의 경험으로는 처음부터 큰 장비를 사기보다 지금 있는 컴퓨터에서 8B와 27B를 먼저 돌려 보는 편이 안전했습니다. 24GB 맥에서 27B가 CPU로 떨어진 것을 직접 본 뒤에야 장비를 고르는 기준이 용량 하나가 아니라는 것이 분명해졌습니다.
⚠️ 자주 하는 실수
- 활성 파라미터로 메모리를 계산합니다: 397B-A17B는 17B가 아니라 397B 크기의 메모리가 필요합니다.
- 총 파라미터로 속도를 짐작합니다: MoE는 활성 파라미터가 속도를 정해서 총 117B 모델이 7.6B 밀집 모델보다 빠른 실측이 있습니다.
- 크기만 보고 품질을 짐작합니다: 같은 32B급에서도 벤치마크가 두 배 차이 난 예가 있습니다.
- 가장 큰 것을 받아 놓고 씁니다: 상한에 걸친 모델은 컨텍스트를 조금만 늘려도 CPU로 떨어집니다. 한 단계 아래가 실제로는 더 빠르고 안정적입니다.
❓ 자주 묻는 질문
처음 시작할 때 어떤 크기가 무난한가요?
메모리 16GB면 4비트 8B급, 24GB면 12B급까지, 32GB면 27B급이 무난합니다. 8B급은 대부분의 노트북에서 돌아가고 문장 정리와 짧은 질문에는 충분한 편입니다. 27B급부터 코딩과 긴 문서 요약에서 차이가 느껴지는데, 이 크기가 편하게 돌아가려면 32GB 안팎이 필요합니다.
70B 모델은 개인이 돌릴 만한가요?
메모리 64GB 이상이면 4비트로 올라가지만, 조밀형 70B는 토큰마다 35GB를 읽어야 해서 대역폭 273GB/s인 장비에서는 초당 8토큰 안팎이 상한입니다. 2026년에는 같은 메모리에 올라가는 100B급 MoE 모델이 활성 파라미터가 작아 더 빠른 경우가 많으므로, 70B 조밀형보다 MoE 쪽을 먼저 봅니다.
스마트폰이나 스마트워치용 모델도 있나요?
있습니다. K2 호라이즌 묶음은 0.9B를 스마트워치와 스마트글라스처럼 자원이 크게 제한된 기기용으로, 3.7B와 7B를 스마트폰용으로 냈습니다. 큐원의 0.6B는 허깅페이스 텍스트 생성 모델 가운데 다운로드 1위입니다. 답의 정확도는 개인 컴퓨터용 27B급보다 낮으므로 짧은 작업에 맞습니다.
모델 크기와 컨텍스트 길이는 어떤 관계인가요?
별개의 숫자입니다. 크기는 모델이 아는 양이고 컨텍스트는 한 번에 읽는 양입니다. 다만 컨텍스트를 길게 잡으면 대화 내용을 저장하는 KV 캐시가 커져 같은 모델이라도 메모리가 더 필요하므로, 긴 문서를 넣을 계획이면 크기 상한을 한 단계 낮춰 잡습니다.
📋 3줄 요약
-
모델 이름의 B는 파라미터 10억 개 단위이고 4비트 필요 메모리는 그 숫자의 절반에 여유를 더한 GB라 8B는 약 6GB, 27B는 약 17GB, 70B는 약 42GB, 120B는 약 70GB입니다.
-
32GB 그래픽카드는 30B 안팎까지, 96GB와 128GB 장비는 100B급 MoE까지, 256GB 이상은 300B를 넘는 모델까지가 2026년 9월 기준 경계이고 MoE는 활성이 아니라 총 파라미터가 메모리를 정합니다.
-
같은 크기에서도 모델마다 잘하는 일이 다르고 증류로 작은 모델이 빠르게 좋아지고 있으므로, 장비 메모리에서 크기 상한을 정한 뒤 쓰려는 작업으로 두세 개를 직접 돌려 보고 고릅니다.
참고 자료

제대로 이해했는지 한 문제로 확인해 볼까요?
답을 고르면 바로 풀이가 나와요.
VRAM 32GB인 RTX 5090 한 장에서 4비트로 편하게 돌아가는 모델의 상한은 어느 정도일까요?

