커뮤니티 입장하기

내 컴퓨터에서 AI 돌리기

12개 개념, 총 학습 약 198분

로컬 AI 시작하기 입문

로컬 AI 시작하기 입문은 모델 파일을 내 컴퓨터에서 실행하는 데 필요한 지식을 순서대로 정리한 코스입니다. 계약서나 고객 자료를 클라우드에 보내기 어려운 분, 토큰 요금 없이 반복 작업을 돌리고 싶은 분, 그리고 DGX 스파크나 맥 스튜디오 같은 장비를 살지 고민 중인 분을 위해 만들었습니다.

로컬 AI에서 처음 막히는 곳은 프로그램 설치가 아니라 사양표 읽기입니다. 메모리가 24GB인데 17GB 모델이 GPU에 올라가지 않고, 128GB 장비가 32GB 그래픽카드보다 답이 느립니다. 이 코스는 그 두 가지가 왜 그런지를 하드웨어 편에서 먼저 잡고, 그 위에 장비와 모델과 도구를 차례로 놓습니다. 준이아빠블로그에서 24GB 맥미니로 직접 확인한 결과와 2026년 9월 28일에 확인한 공식 문서를 근거로 삼았습니다.

📚 다루는 개념 12가지

터미널 명령이 나오는 편은 올라마와 원격 접속 두 편이고, 나머지는 사양표와 표로 따라갈 수 있습니다. 장비 가격과 출시 일정처럼 바뀌는 사실에는 편마다 확인일을 적어 두었습니다.

❓ 자주 묻는 질문

그래픽카드가 없는데 시작할 수 있나요?

애플 실리콘 맥이면 됩니다. CPU와 GPU가 메모리를 나눠 쓰는 구조라 그래픽카드 없이도 로컬 모델이 돌아가고, 맥 편에서 메모리 용량별로 편하게 돌아가는 모델 크기를 표로 정리했습니다. 그래픽카드가 없는 윈도우 PC는 CPU로만 실행되어 속도가 나오지 않으므로, 2026년 10월 출시 예정인 RTX 스파크 편을 먼저 보시는 편이 맞습니다.

장비를 먼저 사야 하나요?

사지 않는 쪽을 권합니다. 코스 전체에서 반복되는 판단은 지금 있는 컴퓨터에서 8B와 27B를 올라마로 먼저 돌려 본 뒤 장비를 정하라는 것입니다. 24GB 맥에서 27B가 CPU로 떨어진 것을 직접 본 뒤에야 장비 기준이 용량 하나가 아니라는 점이 분명해졌고, 사용량이 적으면 오픈 모델 API 쪽이 장비보다 훨씬 쌉니다.

클라우드 AI를 쓰고 있는데 로컬이 필요한가요?

밖으로 내보낼 수 없는 자료를 다루거나, 같은 작업을 아주 많이 반복하거나, 인터넷 없이 써야 하는 경우가 아니면 필요하지 않습니다. 첫 편에서 이 세 가지 기준과 로컬에 맞는 일과 클라우드가 맞는 일을 나눠 두었으므로, 거기서 해당하는 것이 없으면 클라우드를 그대로 쓰시면 됩니다.

🔗 함께 보는 코스

12개 개념총 학습 약 198분

3줄 요약

이번 방문에서 한 편은 바로 볼 수 있습니다.

1

로컬 AI 뜻과 클라우드 AI와 다른 점

로컬 AI는 모델 파일을 내려받아 내 컴퓨터 안에서만 실행하는 방식이고, 입력한 자료가 밖으로 나가지 않으며 토큰 요금이 붙지 않습니다. 클라우드 AI는 다른 회사 서버에 요청을 보내 답을 받아 오는 방식입니다.

16분→
2

오픈 웨이트와 오픈 소스 차이, 라이선스 확인법

오픈 웨이트는 학습이 끝난 가중치 파일만 공개하는 방식이고, 오픈 소스는 학습 데이터와 학습 코드까지 함께 열어 만드는 과정을 재현할 수 있게 하는 방식입니다. 가중치를 내려받을 수 있다는 것과 상업적으로 써도 된다는 것은 별개라서 모델마다 라이선스를 확인해야 합니다.

17분→
3

로컬 AI 하드웨어 기초, VRAM과 통합 메모리와 대역폭

로컬 AI가 돌아가는지는 GPU가 쓸 수 있는 메모리 용량이 정하고, 답이 나오는 속도는 메모리 대역폭이 정합니다. 그래픽카드는 카드에 붙은 VRAM이 그 한도이고, 애플 실리콘과 DGX 스파크 같은 통합 메모리 구조는 CPU와 나눠 쓰는 메모리 전체가 한도입니다.

17분→
4

DGX 스파크(DGX Spark) 이해하기, 무엇이고 누구에게 맞는지

DGX 스파크는 엔비디아가 2025년 10월에 내놓은 손바닥 크기의 AI 개발용 컴퓨터로, GB10 그레이스 블랙웰 슈퍼칩에 통합 메모리 128GB를 얹고 리눅스 기반 DGX OS로 돌아갑니다. 큰 모델을 한 대에 올려 종일 켜 두는 용도에 맞고, 답이 빠르게 나오는 장비는 아닙니다.

16분→
5

RTX 스파크(RTX Spark) 이해하기, 확인된 사양과 정황 구분

RTX 스파크는 엔비디아가 2026년 10월 출시를 예고한 윈도우 PC용 슈퍼칩과 그 칩을 넣은 노트북과 소형 데스크톱의 이름으로, 20코어 그레이스 CPU와 블랙웰 RTX GPU를 한 칩에 묶고 통합 메모리를 최대 128GB까지 얹었습니다. DGX 스파크와 같은 세대의 칩을 윈도우 시장에 낸 자매 제품이고 후속 세대는 아닙니다.

17분→
6

맥에서 로컬 AI 돌리기, 애플 실리콘 메모리와 되는 모델 크기

애플 실리콘 맥은 CPU와 GPU가 통합 메모리 하나를 나눠 쓰는 구조라 그래픽카드 없이도 로컬 AI를 돌릴 수 있고, 돌아가는 모델 크기는 사양표의 메모리가 아니라 macOS가 GPU에 내주는 몫이 정합니다. 24GB 맥에서는 4비트 8B급이 편하고 27B급은 GPU 한도에 걸립니다.

15분→
7

양자화(Quantization) 뜻과 GGUF, 4비트가 뜻하는 것

양자화는 모델의 가중치를 더 적은 비트로 저장해 파일 크기와 필요한 메모리를 줄이는 압축 방법입니다. 16비트 원본을 4비트로 줄이면 크기가 4분의 1 가까이 되고, 개인 장비에서는 대개 이 4비트판을 씁니다.

15분→
8

올라마(Ollama)와 llama.cpp, 로컬 모델을 실행하는 도구

llama.cpp는 GGUF 형식의 모델을 여러 종류의 하드웨어에서 실행하는 C/C++ 엔진이고, 올라마는 그 엔진 위에 모델 내려받기와 실행과 API 제공을 명령 몇 줄로 묶은 프로그램입니다. 둘 다 MIT 라이선스이고 맥과 윈도우와 리눅스에서 돌아갑니다.

15분→
9

큐원(Qwen) 모델 패밀리 구분, 3.8과 Max와 Flash와 이미지와 TTS

큐원은 알리바바 클라우드 Qwen 팀이 만드는 AI 모델 계열의 이름이고, 언어 모델인 Qwen3.8 세대와 이미지 생성 모델인 Qwen-Image, 음성 합성 모델인 Qwen3-TTS가 같은 이름 아래 있습니다. 같은 세대 안에서도 27B와 Flash-Next와 Max는 크기와 실행 위치와 라이선스가 다릅니다.

16분→
10

로컬 모델 크기 고르기, 8B와 27B와 70B가 뜻하는 것

모델 이름의 8B와 27B와 70B는 파라미터 수를 10억 개 단위로 적은 것이고, 4비트로 압축했을 때 필요한 메모리는 대략 그 숫자의 절반에 여유를 더한 GB입니다. 어떤 크기를 고를지는 장비의 GPU 메모리 몫에서 거꾸로 정하고, 파일 크기가 기기 메모리의 절반을 넘으면 내려받기 전에 확인합니다.

16분→
11

원격 접속으로 집 컴퓨터의 로컬 AI 쓰기, SSH와 테일스케일

집 컴퓨터에 로컬 AI를 켜 두고 밖에서 쓰는 구성은 테일스케일이 기기들을 하나의 사설 네트워크로 묶고, SSH가 그 컴퓨터의 터미널에 들어가게 하며, tmux가 들어간 화면을 세션으로 남겨 두는 세 가지로 이뤄집니다. 공유기 포트를 인터넷에 열지 않고도 스마트폰과 노트북에서 같은 작업을 이어 볼 수 있습니다.

19분→
12

컴피UI(ComfyUI) 이해하기, 노드로 잇는 이미지 생성

컴피UI는 모델과 처리 단계를 노드로 연결해 이미지와 영상과 3D와 음악을 만드는 오픈소스 생성 엔진입니다. 2023년 1월 개인 프로젝트로 공개됐고 GPL 3.0 라이선스이며, 로컬 설치는 무료이고 커스텀 노드 설치는 남이 쓴 코드를 내 컴퓨터에서 실행하는 일이라 출처 확인이 필요합니다.

19분→