DGX 스파크와 RTX 5090 비교: 가격과 메모리, Qwen과 GLM을 몇 파라미터까지 돌리는지
DGX 스파크는 엔비디아가 AI 개발용으로 파는 128GB 통합 메모리 소형 컴퓨터이고, RTX 5090은 32GB 그래픽카드입니다. 2026년 9월 기준 가격과 메모리, Qwen과 GLM 오픈 모델을 어느 장비에서 몇 파라미터까지 돌릴 수 있는지, 여러 대를 묶는 조건을 정리했습니다.

3줄 요약
이번 방문에서 한 편은 바로 볼 수 있습니다.
이 글은 세 가지 질문에 답합니다. 2026년 9월 기준 어느 장비가 얼마인지, 그 장비에 Qwen과 GLM 오픈 모델을 몇 파라미터까지 올릴 수 있는지, 그리고 한 대로 모자랄 때 여러 대를 묶는 방법이 장비마다 어떻게 다른지입니다. 비교 대상은 DGX 스파크, DGX 스테이션, RTX 5090, RTX PRO 6000, 그리고 10월 출시 예정인 RTX 스파크입니다.
먼저 이름부터 나누겠습니다. DGX는 엔비디아가 AI 개발용으로 파는 완제품 컴퓨터 계열이고, RTX는 게이밍과 워크스테이션용 그래픽카드 계열입니다. DGX 스파크는 그 가운데 손바닥 크기의 소형 컴퓨터이고, RTX 5090은 데스크톱에 꽂는 소비자용 카드입니다. 같은 회사의 제품이고 CUDA를 같이 쓰지만, 메모리 구조와 운영체제, 가격대가 다르기 때문에 로컬 AI 용도로 고를 때는 게임용 PC를 고를 때와 다른 기준으로 봐야 합니다.
로컬 모델 실행 조건은 준이아빠블로그에서 Qwen3.8 27B를 24GB 맥에서 돌린 결과와 RTX 스파크 사양 정리에서 다뤘습니다. 이 글은 그 연장선에서 장비를 서로 비교합니다. 수치는 엔비디아와 각 모델 팀의 공식 페이지에 적힌 것만 썼고, 공식 확인이 안 되는 가격은 보도 기준임을 표시했습니다.
위 이미지는 엔비디아가 DGX 스파크 출시 때 공개한 사진입니다. 본체는 가로세로 150mm에 높이 50.5mm, 무게 1.2kg이고, 사진은 이 본체를 노트북에 연결해 쓰는 모습입니다.
2026년 9월 기준 가격과 사양 비교
다섯 장비의 공식 사양을 한 표에 모았습니다. 가격은 엔비디아가 공식 페이지에 적은 것과 보도로만 확인되는 것을 구분했습니다.
| 항목 | DGX 스파크 | RTX 스파크 PC | RTX 5090 | RTX PRO 6000 | DGX 스테이션 |
|---|---|---|---|---|---|
| 형태 | 소형 완제품 컴퓨터 | 노트북, 소형 데스크톱 | 그래픽카드 | 그래픽카드 | 타워 완제품 |
| 모델이 올라가는 메모리 | 128GB LPDDR5x 통합 | 128GB 통합 | 32GB GDDR7 | 96GB GDDR7 ECC | GPU 252GB HBM3e + CPU 496GB, 합계 748GB |
| 메모리 대역폭 | 273GB/s | 미공개 | 1,792GB/s | 1,792GB/s | GPU 7.1TB/s |
| AI 연산 (제조사 표기) | 1페타플롭 FP4 | 1페타플롭 FP4 | 3,352 AI TOPS | 4,000 AI TOPS | 20페타플롭 FP4 이상 |
| CPU | 20코어 Arm (GB10) | 20코어 Grace | 별도 구성 | 별도 구성 | 72코어 Grace |
| 운영체제 | DGX OS (리눅스) | 윈도우 | 윈도우 또는 리눅스 | 윈도우 또는 리눅스 | 우분투 |
| 전력 | 어댑터 240W, 칩 140W | 미공개 | 카드 575W, 전원 1,000W 이상 | 카드 600W | 시스템 1,600W |
| 여러 대 연결 | ConnectX-7 200Gbps, 최대 4대 | 미공개 | NVLink 없음, PCIe만 | PCIe 5.0 | ConnectX-8 800Gb/s |
| 가격 | 출시가 3,999달러, 2026년 2월 이후 파운더스 4,699달러 (보도) | 미공개 | 출시가 1,999달러 | 출시가 8,565달러 (보도), 2026년 9월 마켓플레이스 표시가 약 1만 6천 달러 (보도) | 미공개, 파트너 견적 9만 달러대 (보도) |
| 출시 | 2025년 10월 15일 | 2026년 10월 | 2025년 1월 30일 | 2025년 3월 | 판매 중 |
표에서 이 글의 결론을 정하는 값은 둘입니다. 하나는 메모리 용량이고 다른 하나는 메모리 대역폭입니다. DGX 스파크는 RTX 5090보다 메모리가 네 배 크지만 대역폭은 6분의 1 수준입니다. 큰 모델을 올릴 수 있는 장비와 빨리 답하는 장비가 이렇게 나뉘고, 이 차이가 용도를 정합니다.
표의 가격 항목 가운데 둘은 주의가 필요합니다. DGX 스파크는 출시 때 3,999달러였다가 2026년 2월 메모리 부족을 이유로 파운더스 에디션이 4,699달러로 올랐다는 보도가 있고, RTX PRO 6000은 출시가보다 표시가가 크게 오른 상태라는 보도가 있습니다. 둘 다 엔비디아 공식 페이지에는 가격이 적혀 있지 않으므로 구매 시점에 마켓플레이스와 파트너 가격을 직접 확인해야 합니다.
메모리 용량과 대역폭이 정하는 것
로컬 모델은 가중치 전체가 GPU가 쓰는 메모리에 올라가야 실행됩니다. 필요한 용량은 파라미터 수와 정밀도로 정해지는데, 개인 장비에서는 대개 4비트로 압축해서 씁니다. 이 글의 추정은 파라미터 수에 0.5바이트를 곱한 값에 컨텍스트와 실행 엔진용 여유를 더한 것입니다. 27B 모델이면 약 13.5GB에 여유를 더해 17GB 안팎이고, 이 값은 준이아빠블로그에서 Qwen3.8 27B를 내려받았을 때의 실제 파일 크기와 거의 같았습니다.
대역폭은 응답 속도를 정합니다. 토큰 하나를 만들 때마다 활성 파라미터 전체를 메모리에서 읽어야 하므로, 같은 모델이면 대역폭이 높은 장비가 초당 토큰을 더 많이 냅니다. RTX 5090의 1,792GB/s와 DGX 스파크의 273GB/s는 여섯 배 넘게 차이가 나고, 이것이 커뮤니티 실측에서 DGX 스파크의 토큰 속도가 카드보다 낮게 나오는 이유로 보입니다.
MoE(Mixture of Experts, 전문가 혼합) 모델에서는 이 두 값이 서로 다른 역할을 맡습니다. 전체 파라미터는 메모리에 다 올라가야 하지만, 토큰마다 읽는 것은 활성 파라미터뿐입니다. Qwen3.5 397B-A17B라면 397B가 메모리를 정하고 17B가 속도를 정합니다. 그래서 메모리가 크고 대역폭이 낮은 DGX 스파크에는 활성 파라미터가 작은 MoE 모델이 상대적으로 맞습니다.
Qwen과 GLM 모델별로 올라가는 장비
2026년 9월 기준 공개된 Qwen과 GLM 오픈 모델을 파라미터 순으로 놓고, 4비트 기준 필요 메모리 추정치와 어느 장비에 올라가는지를 표로 정리했습니다. 필요 메모리는 추정치이고, 컨텍스트를 길게 잡으면 더 필요합니다. 라이선스는 각 모델 카드 기준입니다.
| 모델 (총 파라미터, 활성) | 라이선스 | 4비트 필요 메모리 (추정) | RTX 5090 32GB | RTX PRO 6000 96GB | DGX 스파크, RTX 스파크 128GB | DGX 스파크 2대 256GB | DGX 스테이션 748GB |
|---|---|---|---|---|---|---|---|
| Qwen3.8 27B (밀집, dense) | Apache 2.0 | 약 17GB | O | O | O | O | O |
| Qwen3.6 35B-A3B | Apache 2.0 | 약 20GB | O | O | O | O | O |
| GLM-4.5 Air 106B-A12B | MIT | 약 60GB | X | O | O | O | O |
| Qwen3.5 122B-A10B | Apache 2.0 | 약 70GB | X | O | O | O | O |
| Qwen3.8 Flash-Next 125B-A6B (임베딩 표 51B 포함 약 180B) | Qwen 커뮤니티 | 약 100GB | X | X | O | O | O |
| GLM-5.3 Flash 320B-A18B | MIT | 약 175GB | X | X | X | O | O |
| Qwen3.5 397B-A17B | Apache 2.0 | 약 215GB | X | X | X | O | O |
| GLM-5 744B-A40B, GLM-5.3 753B | MIT, GLM-5.3 라이선스 | 약 400GB | X | X | X | X (4대면 가능) | O |
| Qwen3.8 2.4T-A95B | 모델 카드 참조 | 약 1.3TB | X | X | X | X | X |
표에서 경계가 셋 보입니다.
- 32GB 경계: Qwen3.8 27B와 35B-A3B까지가 RTX 5090 한 장의 범위입니다. 그 위의 100B급은 카드 한 장으로는 올라가지 않습니다.
- 96GB와 128GB 경계: GLM-4.5 Air와 Qwen3.5 122B가 이 구간입니다. RTX PRO 6000 한 장이나 128GB 통합 메모리 장비라면 한 대로 올라갑니다.
- 256GB 이상: 300B를 넘는 모델은 DGX 스파크 두 대를 묶거나 DGX 스테이션을 써야 올라갑니다. GLM-5급 700B대는 DGX 스파크 네 대나 DGX 스테이션 범위이고, Qwen3.8 2.4T는 이 글의 어느 장비에도 올라가지 않습니다.
실제 속도는 커뮤니티 실측으로만 확인됩니다. 엔비디아 개발자 포럼에는 DGX 스파크 한 대에서 Qwen3.8 27B를 NVFP4(엔비디아의 4비트 부동소수점 형식)로 돌려 초당 34토큰 안팎이 나왔다는 보고와, 두 대를 묶어 Qwen3 235B를 4비트로 돌려 초당 12.5토큰이 나왔다는 보고가 있습니다. 후자는 llama.cpp의 RPC 방식이라 최적화 전 수치라고 작성자가 적어 두었습니다. 공식 벤치마크가 아니므로 참고 수준으로 보는 편이 맞습니다.
위 카드가 RTX 5090 파운더스 에디션입니다. 32GB는 위 표의 첫 번째 경계이고, 대역폭 1,792GB/s는 RTX PRO 6000과 같은 값이며 이 글의 장비 가운데 DGX 스테이션 다음으로 높습니다.
여러 대 묶기: DGX 스파크 연결과 RTX 다중 GPU
한 대로 모자랄 때 늘리는 방법이 두 계열에서 다릅니다.
DGX 스파크는 본체끼리 직접 연결합니다. 뒷면의 ConnectX-7(내장 고속 네트워크 카드) 포트를 200Gbps 케이블로 이으면 두 대의 메모리 256GB를 한 모델에 쓸 수 있고, 엔비디아는 두 대 연결 시 405B, 최대 네 대 연결 시 700B 파라미터까지 다룰 수 있다고 안내합니다. 가중치를 여러 대에 나눠 올리는 일은 vLLM이나 llama.cpp의 RPC 백엔드가 맡습니다. 다만 앞서 적은 커뮤니티 보고처럼 GB10용 소프트웨어 지원이 아직 고르지 않아, 어떤 조합이 되는지는 시점마다 확인이 필요합니다.
RTX 5090은 카드끼리 직접 연결하는 통로가 없습니다. 엔비디아 공식 사양에 NVLink 미지원으로 적혀 있어, 두 장을 꽂아도 데이터는 메인보드의 PCIe를 거칩니다. 그래도 llama.cpp의 tensor-split 옵션이나 vLLM의 텐서 병렬(tensor parallel, 가중치를 여러 GPU에 나눠 올리는 방식)로 가중치를 두 장에 나눠 올릴 수 있고, 추론에서는 PCIe 대역폭으로도 동작한다는 것이 커뮤니티의 공통된 보고입니다. 다만 두 장을 꽂으려면 카드 두 장분의 전원과 케이스 공간이 필요하고, 두 장을 합쳐도 64GB라서 위 표에서 GLM-4.5 Air까지 올라가는 정도입니다.
RTX PRO 6000은 한 장이 96GB라서 여러 장을 묶기 전에 단일 카드로 해결되는 범위가 넓습니다. 워크스테이션용이라 한 본체에 여러 장을 꽂는 구성이 흔하고, 그때도 PCIe 5.0으로 통신합니다.
NVIDIA PAIR는 성격이 다릅니다. 엔비디아가 IFA에서 공개한 무료 오픈소스 도구인데, 같은 네트워크의 PC들에 서로 다른 추론 요청을 나눠 보내는 방식입니다. 하나의 큰 모델을 여러 대에 걸쳐 올리는 것이 아니라, 각 PC가 따로 돌리는 모델에 요청을 분배하는 구조입니다. RTX 20 시리즈 이상과 DGX 스파크, 애플 M4 이상을 지원한다고 발표됐습니다. 그래서 큰 모델 하나를 쪼개는 용도로는 쓸 수 없고, 작은 모델 여러 개를 동시에 돌릴 때 유휴 PC를 활용하는 용도입니다.
정리하면 큰 모델 하나를 여러 대에 올리는 공식 경로는 DGX 스파크 쪽에만 있고, RTX 쪽은 소프트웨어 병렬로 카드를 묶되 카드 사이 통신은 PCIe에 머뭅니다. 학습이나 미세조정처럼 카드 사이에 데이터가 많이 오가는 작업에서는 이 차이가 더 크게 드러납니다.
용도별 추천 구성
같은 예산이라도 무엇을 하려는지에 따라 답이 달라집니다. 2026년 9월 기준으로 정리한 표입니다.
| 용도 | 맞는 장비 | 이유 |
|---|---|---|
| 30B 이하 모델로 빠르게 답하는 에이전트 | RTX 5090 | 대역폭이 높아 토큰 속도가 빠르고 가격이 가장 낮음 |
| 100B급 MoE 모델을 한 대에서 상시 실행 | DGX 스파크, RTX PRO 6000 | 128GB 또는 96GB로 한 대에 올라감. 전력은 DGX 스파크가 훨씬 낮음 |
| 300B 이상 모델을 로컬에서 실행 | DGX 스파크 2대 이상, DGX 스테이션 | 단일 카드로는 불가능. 본체 직접 연결 경로가 있는 쪽 |
| 70B 이하 모델 미세조정 | DGX 스파크 | 엔비디아가 70B까지 로컬 미세조정을 공식으로 안내 |
| 게임과 로컬 AI 겸용 | RTX 5090 | DGX 계열은 게임용이 아니고 운영체제도 리눅스 |
| 윈도우 업무 환경에서 100B급 실행 | RTX 스파크 PC (10월 이후), RTX PRO 6000 | DGX 스파크는 리눅스 전용. 윈도우면 이 둘 |
| 24시간 켜 두는 실행체 | DGX 스파크 | 어댑터 240W로 카드 구성보다 전력이 낮음 |
DGX 스파크와 RTX 5090은 경쟁 관계라기보다 다른 역할을 맡습니다. 카드는 빠르고 싸지만 32GB에서 멈추고, 소형 컴퓨터는 느리지만 128GB를 한 대에 담습니다. 둘을 같이 두고 작은 모델은 카드에, 큰 모델은 소형 컴퓨터에 두는 구성도 가능하고, 앞서 말한 PAIR가 그런 구성을 겨냥한 것으로 보입니다.
위 이미지는 DGX 스테이션과 DGX 스파크의 크기 차이를 보여 줍니다. 왼쪽 아래의 작은 상자가 DGX 스파크이고, 오른쪽 타워가 748GB 메모리를 가진 DGX 스테이션입니다.
집 실행체로 쓸 때의 구성 예시
준이아빠블로그에서는 집 컴퓨터 한 대가 AI를 실행하고 노트북과 스마트폰은 그 화면을 보는 구성을 씁니다. 연결 방법은 맥미니 tmux 설정 글에 있고, 여기서는 그 실행체를 이 글의 장비로 바꿀 때 어떤 차이가 나는지만 적습니다.
- DGX 스파크를 실행체로 두는 경우: 리눅스라 SSH와 tmux 구성이 그대로 맞고, 어댑터 240W라 종일 켜 두는 부담이 작습니다. Qwen3.5 122B급을 한 대에 올려 두고 밤새 자료 정리를 맡기는 용도에 맞습니다. 대신 토큰 속도가 카드보다 낮으므로 대화형으로 빠르게 주고받는 작업에는 답답할 수 있습니다.
- RTX 5090 데스크톱을 실행체로 두는 경우: 27B급 모델이 빠르게 돌아가고 게임이나 영상 작업도 같은 컴퓨터에서 됩니다. 대신 카드 575W에 전원 1,000W 구성이라 24시간 켜 두면 전기와 소음이 DGX 스파크보다 큽니다.
- 둘을 같이 두는 경우: 빠른 답이 필요한 에이전트는 카드에, 큰 문서를 읽는 배치 작업은 소형 컴퓨터에 맡기고 뷰어에서 둘을 번갈아 봅니다. 두 장비 합계가 2026년 9월 기준 보도 가격으로 약 6,700달러라, 클라우드 API 요금과 비교해 어느 쪽이 싼지는 월 사용량으로 계산해야 합니다.
DGX 스파크 두 대를 묶으면 무엇이 달라지나요?
메모리가 256GB로 늘어나 300B대 모델이 올라갑니다. 엔비디아는 두 대 연결 시 405B까지 다룰 수 있다고 안내하고, 연결은 본체의 ConnectX-7 포트를 200Gbps 케이블로 직접 잇는 방식입니다. 다만 토큰 속도가 두 배가 되는 것은 아닙니다. 두 대에 나뉜 가중치를 토큰마다 네트워크로 주고받아야 하므로, 두 대의 의미는 속도보다 한 대로 못 올리던 모델이 올라간다는 데 있습니다.
RTX 5090 두 장이 DGX 스파크 한 대보다 나은가요?
돌리려는 모델 크기에 따라 다릅니다. 카드 두 장을 합친 64GB는 GLM-4.5 Air는 겨우 올리고 Qwen3.5 122B는 올리지 못하는 경계이고, 128GB인 DGX 스파크는 그 위의 180B급까지 한 대로 올립니다. 반면 30B 이하 모델의 토큰 속도는 대역폭 차이 때문에 RTX 5090 쪽이 훨씬 빠릅니다. 카드 두 장은 NVLink 없이 PCIe로 통신하고 카드 두 장분의 전원이 필요하다는 점도 같이 봐야 합니다. 큰 모델이 목표면 DGX 스파크, 속도가 목표면 카드입니다.
DGX 스테이션은 개인이 살 만한가요?
2026년 9월 기준 파트너 견적이 9만 달러대라는 보도가 있고 시스템 전력이 1,600W라서 개인 용도로 보기는 어렵습니다. 개인이 고를 이유가 있다면 748GB 메모리로 GLM-5급 700B대 모델을 한 대에서 돌릴 수 있다는 점 하나인데, 같은 모델을 DGX 스파크 네 대로 나눠 올리는 경로가 공식으로 안내되어 있어 개인이나 소규모 팀은 그쪽이 현실적으로 보입니다.
3줄 요약
- DGX 스파크는 128GB 통합 메모리에 대역폭 273GB/s인 리눅스 소형 컴퓨터이고, RTX 5090은 32GB에 대역폭 1,792GB/s인 그래픽카드입니다. 한쪽은 큰 모델을 한 대에 올리는 쪽이고 다른 쪽은 작은 모델을 빠르게 돌리는 쪽입니다.
- 4비트 기준으로 Qwen3.8 27B와 GLM-4.5 Air까지는 RTX 5090이나 RTX PRO 6000에서 되고, Qwen3.5 122B급은 128GB 장비가, 397B급은 DGX 스파크 두 대나 DGX 스테이션이 필요합니다. GLM-5급 700B대는 DGX 스파크 네 대 또는 DGX 스테이션 범위입니다.
- 2026년 9월 기준 DGX 스파크 파운더스 에디션은 4,699달러, RTX 5090 출시가는 1,999달러입니다. RTX 5090은 NVLink가 없어 여러 장을 묶어도 PCIe로 통신하고, 큰 모델 하나를 여러 대에 올리는 공식 경로는 DGX 스파크 쪽에만 있습니다.
Sources
- NVIDIA 공식 페이지: DGX Spark
- NVIDIA 공식 페이지: DGX Station
- NVIDIA 보도자료: NVIDIA DGX Spark Arrives for World's AI Developers
- NVIDIA 공식 페이지: GeForce RTX 5090
- NVIDIA GeForce 뉴스: RTX 50 시리즈 발표
- NVIDIA 공식 페이지: RTX PRO 6000 Blackwell
- NVIDIA 공식 블로그: Local AI at IFA 2026 (NVIDIA PAIR, RTX Spark)
- Hugging Face: Qwen/Qwen3.8-27B
- Hugging Face: Qwen/Qwen3.5-397B-A17B
- Hugging Face: Qwen/Qwen3.8-Flash-Next
- Hugging Face: zai-org/GLM-5.3
- Hugging Face: zai-org/GLM-5.3-Flash
- Hugging Face: zai-org/GLM-4.5-Air
- vLLM 공식 문서: Parallelism and Scaling
- llama.cpp 공식 저장소: RPC 백엔드
이 글이 도움이 되셨다면 공유해 주세요
메신저로 바로 보내거나 링크를 복사할 수 있습니다.

Written by
데이터로 설명하는 마케터
4비트로 압축한 Qwen3.5 397B 모델을 로컬에서 돌리려면 어떤 구성이 필요할까요?
이 글이 도움이 되었나요?
다음 단계
이어서 읽기 좋은 글
Qwen3-TTS 내 목소리 학습: 맥미니에서 미세조정한 과정과 결과
Qwen3-TTS는 알리바바 큐원 팀이 2026년 1월 아파치 2.0으로 공개한 오픈소스 음성 합성 모델입니다. 통합 메모리 24GB 맥미니에서 녹음 13초로 제로샷 복제를 하고, 31분 녹음으로 0.6B 모델을 미세조정해 참조 음성 없이 내 목소리를 내게 만든 과정과 원리, 필요한 사양, 감정 표현을 넣는 방법을 정리했습니다.
같이 보면 좋은 글

tmux는 터미널 세션을 컴퓨터 안에 남겨 두었다가 다른 기기에서 그대로 이어 받게 해 주는 터미널 멀티플렉서입니다. 집 맥 한 대에 세션을 켜 두고 테일스케일로 묶인 맥북과 아이폰에서 SSH로 들어와 클로드 코드 화면을 이어 쓰는 설정 순서를 정리했습니다.
2026. 9. 7.
RTX 스파크는 엔비디아가 2026년 10월 출시를 예고한 윈도우 PC용 슈퍼칩으로, 20코어 Grace CPU와 블랙웰 RTX GPU에 통합 메모리를 최대 128GB까지 얹었습니다. 로컬 AI 에이전트를 집 컴퓨터에서 돌리는 조건을 맥 스튜디오, RTX 5090과 비교해 정리했습니다.
2026. 9. 7.
테일스케일은 집과 회사와 가방 속 기기를 하나의 사설 네트워크로 묶어 이름만으로 서로 부르게 하는 VPN 도구입니다. 집 컴퓨터 한 대를 24시간 AI 작업 서버로 두고 노트북과 회사 컴퓨터, 스마트폰에서 이어 쓰는 구성과 설치 순서를 정리했습니다.
2026. 9. 6.
intent.md는 앤트로픽 AI 네이티브 SDLC 플레이북에서 코드를 쓰기 전에 무엇을 왜 만들지 적어 두는 첫 번째 문서입니다. 클로드에게 질문을 시켜 만드는 절차와 그대로 가져다 쓸 수 있는 예시 세 가지, PRD와 TRD에서 무엇이 달라졌는지, 이어지는 spec.md와 plan.md의 역할까지 다룹니다.
2026. 9. 5.ADVERTISEMENT