AI & Tech

DGX 스파크와 RTX 5090 비교: 가격과 메모리, Qwen과 GLM을 몇 파라미터까지 돌리는지

DGX 스파크는 엔비디아가 AI 개발용으로 파는 128GB 통합 메모리 소형 컴퓨터이고, RTX 5090은 32GB 그래픽카드입니다. 2026년 9월 기준 가격과 메모리, Qwen과 GLM 오픈 모델을 어느 장비에서 몇 파라미터까지 돌릴 수 있는지, 여러 대를 묶는 조건을 정리했습니다.

2026. 9. 7.26
Share
DGX 스파크와 RTX 5090 비교: 가격과 메모리, Qwen과 GLM을 몇 파라미터까지 돌리는지 대표 이미지

3줄 요약

이번 방문에서 한 편은 바로 볼 수 있습니다.

이 글은 세 가지 질문에 답합니다. 2026년 9월 기준 어느 장비가 얼마인지, 그 장비에 Qwen과 GLM 오픈 모델을 몇 파라미터까지 올릴 수 있는지, 그리고 한 대로 모자랄 때 여러 대를 묶는 방법이 장비마다 어떻게 다른지입니다. 비교 대상은 DGX 스파크, DGX 스테이션, RTX 5090, RTX PRO 6000, 그리고 10월 출시 예정인 RTX 스파크입니다.

먼저 이름부터 나누겠습니다. DGX는 엔비디아가 AI 개발용으로 파는 완제품 컴퓨터 계열이고, RTX는 게이밍과 워크스테이션용 그래픽카드 계열입니다. DGX 스파크는 그 가운데 손바닥 크기의 소형 컴퓨터이고, RTX 5090은 데스크톱에 꽂는 소비자용 카드입니다. 같은 회사의 제품이고 CUDA를 같이 쓰지만, 메모리 구조와 운영체제, 가격대가 다르기 때문에 로컬 AI 용도로 고를 때는 게임용 PC를 고를 때와 다른 기준으로 봐야 합니다.

로컬 모델 실행 조건은 준이아빠블로그에서 Qwen3.8 27B를 24GB 맥에서 돌린 결과RTX 스파크 사양 정리에서 다뤘습니다. 이 글은 그 연장선에서 장비를 서로 비교합니다. 수치는 엔비디아와 각 모델 팀의 공식 페이지에 적힌 것만 썼고, 공식 확인이 안 되는 가격은 보도 기준임을 표시했습니다.

위 이미지는 엔비디아가 DGX 스파크 출시 때 공개한 사진입니다. 본체는 가로세로 150mm에 높이 50.5mm, 무게 1.2kg이고, 사진은 이 본체를 노트북에 연결해 쓰는 모습입니다.

2026년 9월 기준 가격과 사양 비교

다섯 장비의 공식 사양을 한 표에 모았습니다. 가격은 엔비디아가 공식 페이지에 적은 것과 보도로만 확인되는 것을 구분했습니다.

항목DGX 스파크RTX 스파크 PCRTX 5090RTX PRO 6000DGX 스테이션
형태소형 완제품 컴퓨터노트북, 소형 데스크톱그래픽카드그래픽카드타워 완제품
모델이 올라가는 메모리128GB LPDDR5x 통합128GB 통합32GB GDDR796GB GDDR7 ECCGPU 252GB HBM3e + CPU 496GB, 합계 748GB
메모리 대역폭273GB/s미공개1,792GB/s1,792GB/sGPU 7.1TB/s
AI 연산 (제조사 표기)1페타플롭 FP41페타플롭 FP43,352 AI TOPS4,000 AI TOPS20페타플롭 FP4 이상
CPU20코어 Arm (GB10)20코어 Grace별도 구성별도 구성72코어 Grace
운영체제DGX OS (리눅스)윈도우윈도우 또는 리눅스윈도우 또는 리눅스우분투
전력어댑터 240W, 칩 140W미공개카드 575W, 전원 1,000W 이상카드 600W시스템 1,600W
여러 대 연결ConnectX-7 200Gbps, 최대 4대미공개NVLink 없음, PCIe만PCIe 5.0ConnectX-8 800Gb/s
가격출시가 3,999달러, 2026년 2월 이후 파운더스 4,699달러 (보도)미공개출시가 1,999달러출시가 8,565달러 (보도), 2026년 9월 마켓플레이스 표시가 약 1만 6천 달러 (보도)미공개, 파트너 견적 9만 달러대 (보도)
출시2025년 10월 15일2026년 10월2025년 1월 30일2025년 3월판매 중

표에서 이 글의 결론을 정하는 값은 둘입니다. 하나는 메모리 용량이고 다른 하나는 메모리 대역폭입니다. DGX 스파크는 RTX 5090보다 메모리가 네 배 크지만 대역폭은 6분의 1 수준입니다. 큰 모델을 올릴 수 있는 장비와 빨리 답하는 장비가 이렇게 나뉘고, 이 차이가 용도를 정합니다.

표의 가격 항목 가운데 둘은 주의가 필요합니다. DGX 스파크는 출시 때 3,999달러였다가 2026년 2월 메모리 부족을 이유로 파운더스 에디션이 4,699달러로 올랐다는 보도가 있고, RTX PRO 6000은 출시가보다 표시가가 크게 오른 상태라는 보도가 있습니다. 둘 다 엔비디아 공식 페이지에는 가격이 적혀 있지 않으므로 구매 시점에 마켓플레이스와 파트너 가격을 직접 확인해야 합니다.

메모리 용량과 대역폭이 정하는 것

로컬 모델은 가중치 전체가 GPU가 쓰는 메모리에 올라가야 실행됩니다. 필요한 용량은 파라미터 수와 정밀도로 정해지는데, 개인 장비에서는 대개 4비트로 압축해서 씁니다. 이 글의 추정은 파라미터 수에 0.5바이트를 곱한 값에 컨텍스트와 실행 엔진용 여유를 더한 것입니다. 27B 모델이면 약 13.5GB에 여유를 더해 17GB 안팎이고, 이 값은 준이아빠블로그에서 Qwen3.8 27B를 내려받았을 때의 실제 파일 크기와 거의 같았습니다.

대역폭은 응답 속도를 정합니다. 토큰 하나를 만들 때마다 활성 파라미터 전체를 메모리에서 읽어야 하므로, 같은 모델이면 대역폭이 높은 장비가 초당 토큰을 더 많이 냅니다. RTX 5090의 1,792GB/s와 DGX 스파크의 273GB/s는 여섯 배 넘게 차이가 나고, 이것이 커뮤니티 실측에서 DGX 스파크의 토큰 속도가 카드보다 낮게 나오는 이유로 보입니다.

MoE(Mixture of Experts, 전문가 혼합) 모델에서는 이 두 값이 서로 다른 역할을 맡습니다. 전체 파라미터는 메모리에 다 올라가야 하지만, 토큰마다 읽는 것은 활성 파라미터뿐입니다. Qwen3.5 397B-A17B라면 397B가 메모리를 정하고 17B가 속도를 정합니다. 그래서 메모리가 크고 대역폭이 낮은 DGX 스파크에는 활성 파라미터가 작은 MoE 모델이 상대적으로 맞습니다.

Qwen과 GLM 모델별로 올라가는 장비

2026년 9월 기준 공개된 Qwen과 GLM 오픈 모델을 파라미터 순으로 놓고, 4비트 기준 필요 메모리 추정치와 어느 장비에 올라가는지를 표로 정리했습니다. 필요 메모리는 추정치이고, 컨텍스트를 길게 잡으면 더 필요합니다. 라이선스는 각 모델 카드 기준입니다.

모델 (총 파라미터, 활성)라이선스4비트 필요 메모리 (추정)RTX 5090 32GBRTX PRO 6000 96GBDGX 스파크, RTX 스파크 128GBDGX 스파크 2대 256GBDGX 스테이션 748GB
Qwen3.8 27B (밀집, dense)Apache 2.0약 17GBOOOOO
Qwen3.6 35B-A3BApache 2.0약 20GBOOOOO
GLM-4.5 Air 106B-A12BMIT약 60GBXOOOO
Qwen3.5 122B-A10BApache 2.0약 70GBXOOOO
Qwen3.8 Flash-Next 125B-A6B (임베딩 표 51B 포함 약 180B)Qwen 커뮤니티약 100GBXXOOO
GLM-5.3 Flash 320B-A18BMIT약 175GBXXXOO
Qwen3.5 397B-A17BApache 2.0약 215GBXXXOO
GLM-5 744B-A40B, GLM-5.3 753BMIT, GLM-5.3 라이선스약 400GBXXXX (4대면 가능)O
Qwen3.8 2.4T-A95B모델 카드 참조약 1.3TBXXXXX

표에서 경계가 셋 보입니다.

  • 32GB 경계: Qwen3.8 27B와 35B-A3B까지가 RTX 5090 한 장의 범위입니다. 그 위의 100B급은 카드 한 장으로는 올라가지 않습니다.
  • 96GB와 128GB 경계: GLM-4.5 Air와 Qwen3.5 122B가 이 구간입니다. RTX PRO 6000 한 장이나 128GB 통합 메모리 장비라면 한 대로 올라갑니다.
  • 256GB 이상: 300B를 넘는 모델은 DGX 스파크 두 대를 묶거나 DGX 스테이션을 써야 올라갑니다. GLM-5급 700B대는 DGX 스파크 네 대나 DGX 스테이션 범위이고, Qwen3.8 2.4T는 이 글의 어느 장비에도 올라가지 않습니다.

실제 속도는 커뮤니티 실측으로만 확인됩니다. 엔비디아 개발자 포럼에는 DGX 스파크 한 대에서 Qwen3.8 27B를 NVFP4(엔비디아의 4비트 부동소수점 형식)로 돌려 초당 34토큰 안팎이 나왔다는 보고와, 두 대를 묶어 Qwen3 235B를 4비트로 돌려 초당 12.5토큰이 나왔다는 보고가 있습니다. 후자는 llama.cpp의 RPC 방식이라 최적화 전 수치라고 작성자가 적어 두었습니다. 공식 벤치마크가 아니므로 참고 수준으로 보는 편이 맞습니다.

위 카드가 RTX 5090 파운더스 에디션입니다. 32GB는 위 표의 첫 번째 경계이고, 대역폭 1,792GB/s는 RTX PRO 6000과 같은 값이며 이 글의 장비 가운데 DGX 스테이션 다음으로 높습니다.

여러 대 묶기: DGX 스파크 연결과 RTX 다중 GPU

한 대로 모자랄 때 늘리는 방법이 두 계열에서 다릅니다.

DGX 스파크는 본체끼리 직접 연결합니다. 뒷면의 ConnectX-7(내장 고속 네트워크 카드) 포트를 200Gbps 케이블로 이으면 두 대의 메모리 256GB를 한 모델에 쓸 수 있고, 엔비디아는 두 대 연결 시 405B, 최대 네 대 연결 시 700B 파라미터까지 다룰 수 있다고 안내합니다. 가중치를 여러 대에 나눠 올리는 일은 vLLM이나 llama.cpp의 RPC 백엔드가 맡습니다. 다만 앞서 적은 커뮤니티 보고처럼 GB10용 소프트웨어 지원이 아직 고르지 않아, 어떤 조합이 되는지는 시점마다 확인이 필요합니다.

RTX 5090은 카드끼리 직접 연결하는 통로가 없습니다. 엔비디아 공식 사양에 NVLink 미지원으로 적혀 있어, 두 장을 꽂아도 데이터는 메인보드의 PCIe를 거칩니다. 그래도 llama.cpp의 tensor-split 옵션이나 vLLM의 텐서 병렬(tensor parallel, 가중치를 여러 GPU에 나눠 올리는 방식)로 가중치를 두 장에 나눠 올릴 수 있고, 추론에서는 PCIe 대역폭으로도 동작한다는 것이 커뮤니티의 공통된 보고입니다. 다만 두 장을 꽂으려면 카드 두 장분의 전원과 케이스 공간이 필요하고, 두 장을 합쳐도 64GB라서 위 표에서 GLM-4.5 Air까지 올라가는 정도입니다.

RTX PRO 6000은 한 장이 96GB라서 여러 장을 묶기 전에 단일 카드로 해결되는 범위가 넓습니다. 워크스테이션용이라 한 본체에 여러 장을 꽂는 구성이 흔하고, 그때도 PCIe 5.0으로 통신합니다.

NVIDIA PAIR는 성격이 다릅니다. 엔비디아가 IFA에서 공개한 무료 오픈소스 도구인데, 같은 네트워크의 PC들에 서로 다른 추론 요청을 나눠 보내는 방식입니다. 하나의 큰 모델을 여러 대에 걸쳐 올리는 것이 아니라, 각 PC가 따로 돌리는 모델에 요청을 분배하는 구조입니다. RTX 20 시리즈 이상과 DGX 스파크, 애플 M4 이상을 지원한다고 발표됐습니다. 그래서 큰 모델 하나를 쪼개는 용도로는 쓸 수 없고, 작은 모델 여러 개를 동시에 돌릴 때 유휴 PC를 활용하는 용도입니다.

정리하면 큰 모델 하나를 여러 대에 올리는 공식 경로는 DGX 스파크 쪽에만 있고, RTX 쪽은 소프트웨어 병렬로 카드를 묶되 카드 사이 통신은 PCIe에 머뭅니다. 학습이나 미세조정처럼 카드 사이에 데이터가 많이 오가는 작업에서는 이 차이가 더 크게 드러납니다.

용도별 추천 구성

같은 예산이라도 무엇을 하려는지에 따라 답이 달라집니다. 2026년 9월 기준으로 정리한 표입니다.

용도맞는 장비이유
30B 이하 모델로 빠르게 답하는 에이전트RTX 5090대역폭이 높아 토큰 속도가 빠르고 가격이 가장 낮음
100B급 MoE 모델을 한 대에서 상시 실행DGX 스파크, RTX PRO 6000128GB 또는 96GB로 한 대에 올라감. 전력은 DGX 스파크가 훨씬 낮음
300B 이상 모델을 로컬에서 실행DGX 스파크 2대 이상, DGX 스테이션단일 카드로는 불가능. 본체 직접 연결 경로가 있는 쪽
70B 이하 모델 미세조정DGX 스파크엔비디아가 70B까지 로컬 미세조정을 공식으로 안내
게임과 로컬 AI 겸용RTX 5090DGX 계열은 게임용이 아니고 운영체제도 리눅스
윈도우 업무 환경에서 100B급 실행RTX 스파크 PC (10월 이후), RTX PRO 6000DGX 스파크는 리눅스 전용. 윈도우면 이 둘
24시간 켜 두는 실행체DGX 스파크어댑터 240W로 카드 구성보다 전력이 낮음

DGX 스파크와 RTX 5090은 경쟁 관계라기보다 다른 역할을 맡습니다. 카드는 빠르고 싸지만 32GB에서 멈추고, 소형 컴퓨터는 느리지만 128GB를 한 대에 담습니다. 둘을 같이 두고 작은 모델은 카드에, 큰 모델은 소형 컴퓨터에 두는 구성도 가능하고, 앞서 말한 PAIR가 그런 구성을 겨냥한 것으로 보입니다.

위 이미지는 DGX 스테이션과 DGX 스파크의 크기 차이를 보여 줍니다. 왼쪽 아래의 작은 상자가 DGX 스파크이고, 오른쪽 타워가 748GB 메모리를 가진 DGX 스테이션입니다.

집 실행체로 쓸 때의 구성 예시

준이아빠블로그에서는 집 컴퓨터 한 대가 AI를 실행하고 노트북과 스마트폰은 그 화면을 보는 구성을 씁니다. 연결 방법은 맥미니 tmux 설정 글에 있고, 여기서는 그 실행체를 이 글의 장비로 바꿀 때 어떤 차이가 나는지만 적습니다.

  • DGX 스파크를 실행체로 두는 경우: 리눅스라 SSH와 tmux 구성이 그대로 맞고, 어댑터 240W라 종일 켜 두는 부담이 작습니다. Qwen3.5 122B급을 한 대에 올려 두고 밤새 자료 정리를 맡기는 용도에 맞습니다. 대신 토큰 속도가 카드보다 낮으므로 대화형으로 빠르게 주고받는 작업에는 답답할 수 있습니다.
  • RTX 5090 데스크톱을 실행체로 두는 경우: 27B급 모델이 빠르게 돌아가고 게임이나 영상 작업도 같은 컴퓨터에서 됩니다. 대신 카드 575W에 전원 1,000W 구성이라 24시간 켜 두면 전기와 소음이 DGX 스파크보다 큽니다.
  • 둘을 같이 두는 경우: 빠른 답이 필요한 에이전트는 카드에, 큰 문서를 읽는 배치 작업은 소형 컴퓨터에 맡기고 뷰어에서 둘을 번갈아 봅니다. 두 장비 합계가 2026년 9월 기준 보도 가격으로 약 6,700달러라, 클라우드 API 요금과 비교해 어느 쪽이 싼지는 월 사용량으로 계산해야 합니다.

DGX 스파크 두 대를 묶으면 무엇이 달라지나요?

메모리가 256GB로 늘어나 300B대 모델이 올라갑니다. 엔비디아는 두 대 연결 시 405B까지 다룰 수 있다고 안내하고, 연결은 본체의 ConnectX-7 포트를 200Gbps 케이블로 직접 잇는 방식입니다. 다만 토큰 속도가 두 배가 되는 것은 아닙니다. 두 대에 나뉜 가중치를 토큰마다 네트워크로 주고받아야 하므로, 두 대의 의미는 속도보다 한 대로 못 올리던 모델이 올라간다는 데 있습니다.

RTX 5090 두 장이 DGX 스파크 한 대보다 나은가요?

돌리려는 모델 크기에 따라 다릅니다. 카드 두 장을 합친 64GB는 GLM-4.5 Air는 겨우 올리고 Qwen3.5 122B는 올리지 못하는 경계이고, 128GB인 DGX 스파크는 그 위의 180B급까지 한 대로 올립니다. 반면 30B 이하 모델의 토큰 속도는 대역폭 차이 때문에 RTX 5090 쪽이 훨씬 빠릅니다. 카드 두 장은 NVLink 없이 PCIe로 통신하고 카드 두 장분의 전원이 필요하다는 점도 같이 봐야 합니다. 큰 모델이 목표면 DGX 스파크, 속도가 목표면 카드입니다.

DGX 스테이션은 개인이 살 만한가요?

2026년 9월 기준 파트너 견적이 9만 달러대라는 보도가 있고 시스템 전력이 1,600W라서 개인 용도로 보기는 어렵습니다. 개인이 고를 이유가 있다면 748GB 메모리로 GLM-5급 700B대 모델을 한 대에서 돌릴 수 있다는 점 하나인데, 같은 모델을 DGX 스파크 네 대로 나눠 올리는 경로가 공식으로 안내되어 있어 개인이나 소규모 팀은 그쪽이 현실적으로 보입니다.

3줄 요약

  1. DGX 스파크는 128GB 통합 메모리에 대역폭 273GB/s인 리눅스 소형 컴퓨터이고, RTX 5090은 32GB에 대역폭 1,792GB/s인 그래픽카드입니다. 한쪽은 큰 모델을 한 대에 올리는 쪽이고 다른 쪽은 작은 모델을 빠르게 돌리는 쪽입니다.
  2. 4비트 기준으로 Qwen3.8 27B와 GLM-4.5 Air까지는 RTX 5090이나 RTX PRO 6000에서 되고, Qwen3.5 122B급은 128GB 장비가, 397B급은 DGX 스파크 두 대나 DGX 스테이션이 필요합니다. GLM-5급 700B대는 DGX 스파크 네 대 또는 DGX 스테이션 범위입니다.
  3. 2026년 9월 기준 DGX 스파크 파운더스 에디션은 4,699달러, RTX 5090 출시가는 1,999달러입니다. RTX 5090은 NVLink가 없어 여러 장을 묶어도 PCIe로 통신하고, 큰 모델 하나를 여러 대에 올리는 공식 경로는 DGX 스파크 쪽에만 있습니다.

Sources

이 글이 도움이 되셨다면 공유해 주세요

메신저로 바로 보내거나 링크를 복사할 수 있습니다.

Author

Written by

데이터로 설명하는 마케터

퀴즈

4비트로 압축한 Qwen3.5 397B 모델을 로컬에서 돌리려면 어떤 구성이 필요할까요?

이 글이 도움이 되었나요?

다음 단계

이어서 읽기 좋은 글

Qwen3-TTS 내 목소리 학습: 맥미니에서 미세조정한 과정과 결과

Qwen3-TTS는 알리바바 큐원 팀이 2026년 1월 아파치 2.0으로 공개한 오픈소스 음성 합성 모델입니다. 통합 메모리 24GB 맥미니에서 녹음 13초로 제로샷 복제를 하고, 31분 녹음으로 0.6B 모델을 미세조정해 참조 음성 없이 내 목소리를 내게 만든 과정과 원리, 필요한 사양, 감정 표현을 넣는 방법을 정리했습니다.

다음 글 읽기

같이 보면 좋은 글

맥미니 한 대에 tmux 세션 두고 맥북과 아이폰에서 SSH로 AI 작업 이어가기 썸네일
AI & Tech맥미니 한 대에 tmux 세션 두고 맥북과 아이폰에서 SSH로 AI 작업 이어가기

tmux는 터미널 세션을 컴퓨터 안에 남겨 두었다가 다른 기기에서 그대로 이어 받게 해 주는 터미널 멀티플렉서입니다. 집 맥 한 대에 세션을 켜 두고 테일스케일로 묶인 맥북과 아이폰에서 SSH로 들어와 클로드 코드 화면을 이어 쓰는 설정 순서를 정리했습니다.

2026. 9. 7.
RTX 스파크(RTX Spark) 사양 정리: 로컬 AI 에이전트를 집 컴퓨터에서 돌리는 조건 썸네일
AI & TechRTX 스파크(RTX Spark) 사양 정리: 로컬 AI 에이전트를 집 컴퓨터에서 돌리는 조건

RTX 스파크는 엔비디아가 2026년 10월 출시를 예고한 윈도우 PC용 슈퍼칩으로, 20코어 Grace CPU와 블랙웰 RTX GPU에 통합 메모리를 최대 128GB까지 얹었습니다. 로컬 AI 에이전트를 집 컴퓨터에서 돌리는 조건을 맥 스튜디오, RTX 5090과 비교해 정리했습니다.

2026. 9. 7.
테일스케일(Tailscale) 사용법: 어디서든 내 집, 회사의 컴퓨터를 활용해 AI로 일하는 방식 썸네일
AI & Tech테일스케일(Tailscale) 사용법: 어디서든 내 집, 회사의 컴퓨터를 활용해 AI로 일하는 방식

테일스케일은 집과 회사와 가방 속 기기를 하나의 사설 네트워크로 묶어 이름만으로 서로 부르게 하는 VPN 도구입니다. 집 컴퓨터 한 대를 24시간 AI 작업 서버로 두고 노트북과 회사 컴퓨터, 스마트폰에서 이어 쓰는 구성과 설치 순서를 정리했습니다.

2026. 9. 6.
intent.md 작성법과 사용 예시, 앤트로픽 AI 네이티브 SDLC 플레이북 정리 썸네일
AI & Techintent.md 작성법과 사용 예시, 앤트로픽 AI 네이티브 SDLC 플레이북 정리

intent.md는 앤트로픽 AI 네이티브 SDLC 플레이북에서 코드를 쓰기 전에 무엇을 왜 만들지 적어 두는 첫 번째 문서입니다. 클로드에게 질문을 시켜 만드는 절차와 그대로 가져다 쓸 수 있는 예시 세 가지, PRD와 TRD에서 무엇이 달라졌는지, 이어지는 spec.md와 plan.md의 역할까지 다룹니다.

2026. 9. 5.

ADVERTISEMENT

이 글의 학습 경로

글 전체 보기

관련 개념

무료 셀프 교육으로 배워보세요

코스 전체 보기