GLM 모델 정리: Z.ai 버전별 차이와 쓰는 방법 4가지
홍승협(준이아빠) / 데이터 분석, AI 실무 교육
GLM은 중국 AI 기업 Z.ai가 만드는 오픈 웨이트 언어 모델 계열입니다. 2026년 9월 기준 현행 모델 네 가지의 규모와 가격, 라이선스를 나란히 놓고 웹 화면과 API, 코딩 구독, 가중치 내려받기까지 쓰는 방법을 공식 자료로 정리했습니다.

3줄 요약
이번 방문에서 한 편은 바로 볼 수 있습니다.
GLM은 중국 AI 기업 Z.ai가 만드는 오픈 웨이트 언어 모델 계열입니다. 옛 이름이 즈푸AI인 이 회사는 2022년의 GLM-130B부터 2026년 8월의 GLM-5.3까지 같은 이름으로 모델을 내놓았습니다. 진열대에 놓인 물건만 파는 가게와 달리 창고째 가져가도 좋다며 문을 열어 둔 쪽입니다.
새 AI 모델이 계속 나오는 것은 이제 익숙한 일입니다. 클로드와 GPT, 제미나이는 어느 회사가 만들었고 무엇을 잘하는지 대략 알려져 있어서, 새 버전이 나와도 기존 자리에 갈아 끼우면 됩니다.
GLM은 그 목록에 잘 들어오지 않습니다. 버전이 GLM-5.3과 GLM-5.3-Flash, GLM-4.7, GLM-4.7-Flash로 나뉘어 있고 쓰는 방법도 네 가지인데, 이름이 비슷해서 어느 것을 어디에 쓰는지 정하기 어렵습니다. 정하지 못한 채로 두면 무료로 열려 있는 모델을 그냥 지나치거나, 반대로 개인 장비에 올라가지 않는 크기의 가중치를 내려받는 데 시간을 쓰게 됩니다. Z.ai 개발자 문서와 허깅페이스 모델 카드를 근거로 2026년 9월 15일 기준으로 정리하겠습니다.
위 화면은 Z.ai의 공식 웹 채팅에서 모델 선택 메뉴를 연 모습입니다. 로그인하지 않은 상태에서도 GLM-5.3-Flash가 기본으로 잡혀 있고, GLM-5.3과 GLM-5.2를 골라 쓸 수 있습니다.
GLM이라는 이름의 뜻과 계열의 출발점
GLM이라는 이름은 General Language Model, 즉 범용 언어 모델의 줄임말입니다. 2021년에 나온 같은 제목의 논문에서 온 이름이고, 저자 명단에 Z.ai를 세운 칭화대 탕제 교수가 들어 있습니다. 회사 이름보다 모델 이름이 먼저 나온 경우라, GLM은 제품 이름이면서 연구 계보의 이름이기도 합니다.
계열의 출발점은 2022년 8월 공개된 GLM-130B입니다. 파라미터 1,300억 개 규모의 모델을 가중치까지 열어 둔 사례였고, 이듬해에는 개인용 그래픽카드에서 돌아가는 ChatGLM-6B가 나왔습니다. 이 회사가 왜 가중치를 계속 여는지는 별도 글에서 다뤘으니, 이 글에서는 지금 쓸 수 있는 모델과 쓰는 방법을 정리하겠습니다.
2026년 9월 기준 GLM 현행 모델 네 가지
이름이 길고 비슷해서 표로 나란히 놓는 편이 빠릅니다. 규모는 공식 저장소 표기를, 가격은 Z.ai 공식 가격표를 따랐습니다.
| 모델 | 규모 (총 / 토큰당 활성) | 입력 | 컨텍스트 | 100만 토큰 입력 | 100만 토큰 출력 | 라이선스 |
|---|---|---|---|---|---|---|
| GLM-5.3 | 7,440억 / 400억 | 텍스트 | 100만 토큰 | 1.40달러 | 4.40달러 | 자체 라이선스 |
| GLM-5.3-Flash | 3,200억 / 180억 | 텍스트, 이미지, 영상 | 100만 토큰 | 0.15달러 | 0.50달러 | MIT |
| GLM-4.7 | 3,580억 / 공식 표기 없음 | 텍스트 | 20만 토큰 | 0.60달러 | 2.20달러 | MIT |
| GLM-4.7-Flash | 300억 / 30억 | 텍스트 | 20만 토큰 | 무료 | 무료 | MIT |
위 화면이 Z.ai의 공식 가격 페이지입니다. 표에는 이 글이 다루지 않은 이전 버전과 문자 인식 전용 모델까지 함께 올라 있어서, 계열 전체의 폭을 한 번에 볼 수 있습니다.
표에서 먼저 눈에 들어오는 것은 이름과 규모가 일치하지 않는다는 점입니다. Flash가 붙었다고 작은 모델은 아닙니다. GLM-5.3-Flash는 총 3,200억 파라미터인데 GLM-4.7-Flash는 총 300억 파라미터라서, 같은 이름을 달고 열 배 넘게 차이가 납니다. 이름만 보고 개인 장비용 모델을 고르면 어긋나는 이유가 여기에 있습니다.
활성 파라미터라는 두 번째 숫자는 한 번 풀고 가겠습니다. GLM 계열은 전문가 혼합(Mixture of Experts) 구조를 씁니다. 서랍이 여러 칸인 공구함에서 나사 하나를 조일 때 꺼내는 공구가 한두 개뿐이듯, 토큰 하나를 처리할 때 실제로 계산에 참여하는 부분만 활성 파라미터입니다. 계산량은 이 두 번째 숫자를 따르지만 가중치 전체를 메모리에 올려야 하는 조건은 첫 번째 숫자를 따릅니다.
어떤 모델이 실제로 많이 쓰이는지는 내려받은 횟수에서 드러납니다. 2026년 9월 15일 기준 허깅페이스의 최근 30일 내려받기는 GLM-4.7-Flash가 186만 회로 가장 많고, GLM-5.3-Flash가 177만 회, GLM-5.2가 95만 회, GLM-5.3이 71만 회입니다. 최신 플래그십보다 300억 파라미터짜리 경량 모델을 받아 간 사람이 더 많았습니다.
GLM을 쓰는 방법 네 가지
접근 방법이 넷인데 난이도와 비용이 서로 다릅니다. 진열대에서 바로 집어 드는 쪽이 웹 화면이라면, 창고에서 실어 오는 쪽이 가중치를 내려받아 직접 돌리는 방법입니다.
- 웹 채팅:
chat.z.ai에 접속하면 로그인 없이 GLM-5.3-Flash로 질문할 수 있습니다. 모델 선택 메뉴에서 GLM-5.3과 GLM-5.2로 바꾸는 것도 되고, 추론 강도를 정하는 Deep Think 항목이 입력창에 함께 나옵니다. - API:
api.z.ai에서 키를 발급받아 토큰 단위로 값을 치르는 방식입니다. 도구 호출과 구조화 출력, 컨텍스트 캐싱, 스트리밍을 지원하고 GLM-5.3의 최대 출력은 12만 8천 토큰입니다. - GLM Coding Plan: 코딩 도구에 붙여 쓰는 월정액입니다. 공식 문서 기준 Lite와 Pro, Max 세 등급이 있고 월 18달러부터 시작합니다. 5시간마다 채워지는 크레딧이 등급별로 2,000과 12,000, 28,000이고, 7일마다 채워지는 주간 크레딧이 10,000과 60,000, 140,000입니다. 피크 시간대인 한국 시각 평일 오후 3시부터 7시를 벗어나면 크레딧을 절반만 씁니다.
- 가중치 내려받기: 허깅페이스에서 파일을 받아 자기 장비에서 실행합니다. 공식 저장소가 SGLang과 vLLM, Transformers를 비롯한 실행 프레임워크를 안내합니다.
구독 쪽은 모델 연결 규칙을 하나 두고 있습니다. 모든 등급에서 GLM-5.3과 GLM-5.3-Flash를 쓸 수 있고, GLM-5.2나 GLM-5.1을 부르는 요청은 GLM-5.3으로, GLM-4.7을 부르는 요청은 GLM-5.3-Flash로 자동 연결됩니다. 예전 모델 이름을 그대로 적어 둔 설정 파일이 있어도 최신 모델로 처리된다는 뜻입니다.
상황별로 정리하면 이렇습니다.
| 상황 | 맞는 방법 | 근거 |
|---|---|---|
| 답변 품질만 먼저 확인한다 | 웹 채팅 | 로그인과 결제 없이 GLM-5.3-Flash 사용 |
| 우리 서비스에 붙인다 | API | 토큰 단위 과금, 도구 호출과 캐싱 지원 |
| 터미널 코딩 도구에서 매일 쓴다 | Coding Plan | 월정액이 호출량 많은 작업에 유리 |
| 자료를 밖으로 내보낼 수 없다 | 가중치 내려받기 | 요청이 외부 서버로 가지 않음 |
클로드 코드나 코덱스 CLI에 붙이는 절차는 설정 파일 위치와 주소가 도구마다 다릅니다. 두 도구에 넣을 값은 설정 방법을 따로 정리한 글에 그대로 옮겨 두었습니다.
공식 벤치마크에서 확인되는 위치
GLM-5.3은 2026년 8월 발표됐습니다. GLM-5.2와 같은 기반 모델을 두고 사후학습만 다시 했다고 모델 카드에 적혀 있어서, 구조를 바꾸지 않고 학습 방식만 다시 잡아 점수를 올린 사례에 해당합니다.
위 그래프는 Z.ai가 공개한 공식 평가 결과입니다. 여섯 항목 가운데 두 곳에서 비교 대상 중 가장 높은 점수를 받았고, 나머지 네 곳은 앞선 모델이 따로 있습니다.
| 평가 항목 | GLM-5.3 | GLM-5.2 | Kimi K3 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal Bench 3.0 | 28.3 | 4.6 | 17.4 | 33.7 | 34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 69.7 | 72.7 |
| AutomationBench | 48.2 | 26.2 | 46.7 | 46.2 | 45.8 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1743 | 1730 |
가장 크게 벌어진 것은 이전 버전과의 격차입니다. 터미널 작업을 재는 Terminal Bench 3.0에서 4.6이 28.3으로 올랐고, 업무 자동화를 재는 AutomationBench는 26.2에서 48.2로 올랐습니다. 반면 터미널 작업과 코드 수정에서는 Fable 5와 GPT-5.6 Sol이 앞서므로, 모든 항목에서 우위라는 서술은 성립하지 않습니다.
측정 조건도 함께 봐야 하는데, 항목마다 조건이 다릅니다. Terminal Bench 3.0은 클로드 코드 2.1.207 하네스에서 추론 강도를 최대로 두고 과제당 10시간 제한으로 쟀고, DeepSWE는 mini-swe-agent 하네스에 6시간 제한입니다. GDPval-AA v2는 Z.ai가 아니라 Artificial Analysis가 측정한 값이고, AutomationBench는 하네스와 제한 시간이 공개돼 있지 않습니다. 발표한 쪽이 고른 조건이라 우리 작업에 그대로 적용되는 숫자는 아니라고 보는 편이 안전합니다.
GLM을 클로드나 GPT 대신 고를 이유가 있을까요?
점수만 놓고 보면 GLM-5.3이 최상위 모델을 앞서지는 않습니다. 그래서 고를 이유는 다른 곳에 있고, 크게 둘로 나뉩니다.
첫째는 값입니다. 2026년 9월 15일 기준 GLM-5.3의 출력 단가는 100만 토큰당 4.40달러이고, GLM-5.3-Flash는 0.50달러입니다. 같은 시점 최상위 모델들의 출력 단가는 이보다 여러 배 높은 수준이어서, 호출이 잦은 자동화나 밤사이 돌리는 작업이라면 이 차이가 매달 요금으로 쌓입니다.
둘째는 가중치가 열려 있다는 점입니다. 클로드와 GPT는 서버에 요청을 보내는 것 외에 다른 선택지가 없지만, GLM은 파일을 받아 자기 장비에서 실행할 수 있습니다. 자료를 외부로 내보낼 수 없는 조건이라면 이 차이가 가격보다 먼저 판단 기준이 됩니다.
| 기준 | GLM 계열 | 클로드, GPT 계열 |
|---|---|---|
| 가중치 내려받기 | 대부분의 모델에서 가능 | 제공되지 않음 |
| 자체 서버 실행 | 가능. 장비를 직접 갖춰야 함 | 불가능 |
| 출력 100만 토큰 단가 | 0.50달러에서 4.40달러 | 이보다 높은 편 |
| 자료가 외부로 나가는지 | 직접 실행하면 나가지 않음 | API를 쓰면 나감 |
| 요금제 | 종량제와 월 18달러부터의 구독 | 종량제와 구독 |
반대로 GLM을 고르지 않는 편이 나은 경우도 분명합니다. 사람이 화면 앞에서 결과를 기다리는 작업이나 점수 차이가 그대로 결과 차이로 이어지는 작업이라면, 쓰던 도구를 그대로 두는 쪽이 낫다고 봅니다. 평소 하는 작업 두세 개를 같은 조건으로 돌려 보고 정하는 편이 맞겠습니다.
오픈 웨이트라서 생기는 차이와 라이선스 두 종류
오픈 웨이트(open-weight)라는 말은 오픈 소스보다 상대적으로 낯설 수 있습니다. 쉽게 말하면 학습이 끝난 가중치 파일만 공개하고 학습에 쓴 자료와 코드는 공개하지 않는 방식입니다. 두 방식의 차이는 무엇까지 열려 있는지 기준으로 나눈 글에 정리해 두었습니다.
여기서 실무에 걸리는 차이가 하나 있습니다. 같은 GLM 계열인데 라이선스가 두 종류로 나뉩니다.
- MIT 라이선스: GLM-5.3-Flash와 GLM-5.2, GLM-4.7, GLM-4.7-Flash가 여기에 속합니다. 상업적 이용과 수정, 재배포에 별도 조건이 붙지 않습니다.
- 자체 라이선스: GLM-5.3에만 적용됩니다. 허용 범위는 MIT와 거의 같지만 조건이 하나 더 붙습니다.
GLM-5.3 라이선스가 추가한 조건은 이렇습니다. 모델 추론이나 미세조정을 제3자에게 제공하는 사업, 곧 Model as a Service를 운영하면서 연속 12개월 합산 매출이 100억 달러를 넘으면, 상업적으로 쓰기 전에 Z.AI의 보안 검토를 통과해야 합니다. 창고를 열어 두더라도 그 물건을 되파는 쪽에는 조건이 따로 붙는 방식입니다. 매출 기준이 대형 클라우드 사업자를 겨냥한 수준이라 대부분의 조직에는 적용되지 않습니다. 다만 모델 파일을 받기 전에 저장소의 라이선스 항목을 모델마다 따로 여는 습관은 필요합니다.
직접 돌리는 쪽을 검토한다면 규모부터 확인해야 합니다. GLM-5.3은 총 7,440억 파라미터라 서버급 장비 여러 대를 요구하고, GLM-5.3-Flash도 총 3,200억 파라미터라 사정이 크게 다르지 않습니다. 개인 장비에서 검토할 수 있는 쪽은 총 300억 파라미터인 GLM-4.7-Flash입니다. 사진을 옮겨 담을 때 화질을 조금 낮춰 용량을 줄이듯, 정밀도를 4비트로 줄인 커뮤니티 판본이 17GiB 수준으로 공개돼 있습니다.
이 크기는 주의해서 봐야 합니다. 직접 재보지는 않았지만, 메모리 24GB 맥에서 17GB 모델을 돌렸을 때 GPU 할당 한도를 넘겨 CPU로 떨어진 실측 기록이 준이아빠블로그에 남아 있습니다. GLM-4.7-Flash의 4비트 판본도 같은 한도에 걸릴 수 있으므로, 통합 메모리가 32GB 이상인 기기를 기준으로 잡는 편이 안전합니다.
공식 자료에서 확인하지 못한 것
숫자를 적을 때 근거를 나눠 두는 편이 나중에 덜 헷갈립니다. 이번에 공식 자료로 확인하지 못해 본문에서 뺀 항목은 셋입니다.
- Coding Plan의 등급별 월 요금: 공식 문서에는 월 18달러부터라는 문구와 크레딧 수치만 있습니다. Pro와 Max의 정확한 금액은 소개하는 곳마다 달라서 적지 않았습니다.
- GLM-4.7의 활성 파라미터 수: 총 3,580억이라는 수치는 저장소 파일에서 확인되지만, 토큰당 활성 파라미터는 공식 표기가 없습니다.
- 직접 측정한 속도: 이 글은 공식 문서와 저장소 기록을 정리한 것이고, 초당 토큰 같은 수치를 직접 재지는 않았습니다.
GLM 5.3과 GLM 5.3 플래시는 무엇이 다른가요?
규모와 입력 방식, 가격이 다릅니다. GLM-5.3은 총 7,440억 파라미터에 텍스트만 받는 모델이고 출력 단가가 100만 토큰당 4.40달러입니다. GLM-5.3-Flash는 총 3,200억 파라미터에 이미지와 영상까지 받는 모델이고 출력 단가가 0.50달러입니다. 여기서 Flash는 성능을 낮춘 경량판을 뜻하지 않고, 같은 세대를 더 싸게 돌리도록 구조를 바꾼 판본을 가리킵니다. 이 모델이 이름을 감춘 채 공개됐던 경과와 상세 스펙은 앞선 글에서 다뤘습니다.
GLM을 무료로 쓸 수 있나요?
두 가지입니다. 하나는 chat.z.ai 웹 채팅입니다. 로그인 없이 GLM-5.3-Flash로 질문하면 됩니다. 다른 하나는 API에서 GLM-4.7-Flash를 부르는 방법인데, 2026년 9월 15일 기준 공식 가격표에 입력과 출력이 모두 무료로 적혀 있습니다. 다만 무료 조건은 언제든 바뀔 수 있고, 업무 자료를 넣는다면 요금보다 데이터 처리 조건을 먼저 보는 편이 맞습니다.
GLM 가중치를 내려받으면 회사 서버에서 마음대로 써도 되나요?
모델마다 다르므로 저장소의 라이선스 항목을 직접 열어야 합니다. GLM-5.3-Flash와 GLM-4.7, GLM-4.7-Flash는 MIT라서 상업적 이용과 수정, 재배포가 모두 열려 있습니다. GLM-5.3은 자체 라이선스이고, 모델 추론을 제3자에게 파는 사업자 가운데 연속 12개월 매출이 100억 달러를 넘는 곳에만 Z.AI의 보안 검토 조건이 붙습니다. 사내에서 쓰거나 제품 안에 기능으로 넣는 경우는 이 조건에 해당하지 않습니다.
3줄 요약
- GLM은 중국 AI 기업 Z.ai가 2022년 GLM-130B부터 이어 온 언어 모델 계열이고, 2026년 9월 기준 최신 버전은 8월에 나온 GLM-5.3입니다.
- 웹 화면과 API, 월 18달러부터 시작하는 코딩 구독, 가중치 내려받기 네 가지로 쓸 수 있고 GLM-4.7-Flash는 API에서 무료입니다.
- GLM-5.3-Flash와 GLM-4.7-Flash는 MIT 라이선스지만 GLM-5.3은 자체 라이선스라서, 연속 12개월 매출이 100억 달러를 넘는 모델 재판매 사업자는 Z.AI 보안 검토를 먼저 받아야 합니다.
Sources:
- Pricing (Z.AI 개발자 문서)
- GLM-5.3 모델 안내 (Z.AI 개발자 문서)
- GLM Coding Plan 개요 (Z.AI 개발자 문서)
- zai-org/GLM-5.3 모델 카드와 라이선스 (Hugging Face)
- zai-org/GLM-5.3-Flash 모델 카드 (Hugging Face)
- zai-org/GLM-4.7 모델 카드 (Hugging Face)
- zai-org/GLM-4.7-Flash 모델 카드 (Hugging Face)
- GLM-5 시리즈 저장소 (GitHub)
- GLM: General Language Model Pretraining with Autoregressive Blank Infilling (arXiv)
이 글이 도움이 되셨다면 공유해 주세요
메신저로 바로 보내거나 링크를 복사할 수 있습니다.

Written by
데이터로 설명하는 마케터
개인용 장비에서 직접 돌려 볼 GLM 모델을 고른다면 어느 쪽이 맞을까요?
이 글이 도움이 되었나요?
다음 단계
이어서 읽기 좋은 글
클로드 페이블 5.1과 미토스 5.1 공개, 달라진 점 정리
클로드 페이블 5.1은 앤트로픽이 2026년 9월 1일 공개한 코딩과 지식 업무용 상위 모델입니다. 벤치마크 변화와 캐시 읽기 75% 인하, 안전장치 완화, 플랜별 이용 조건, 클로드 코드에서 바꾸는 방법을 공식 자료 기준으로 정리했습니다.
같이 보면 좋은 글

CLAUDE.md는 클로드 코드가 세션마다 읽는 지시 파일입니다. 권장 길이 300줄, 절대 금지 섹션, 9월 모델 가격 인상처럼 널리 도는 이야기를 앤트로픽 공식 문서와 하나씩 맞춰 정리했습니다. 2026년 8월 28일 기준입니다.
2026. 8. 28.
AI 배포 경쟁은 같은 모델을 몇 개의 화면에 넣어 두느냐로 우열이 정해지는 경쟁입니다. 2026년 8월 12일부터 15일 사이에 나온 발표 다섯 건을 놓고, 각 회사가 모델을 어디까지 밀어 넣었는지 공식 자료 기준으로 정리했습니다.
2026. 8. 15.
프롬프트 캐시는 AI에 이미 보낸 앞부분의 계산 결과를 서버가 보관했다가 다음 요청에서 재사용하는 기능입니다. 캐시가 유지되는 조건과 깨지는 조건, 실제 비용 차이를 계산으로 정리했습니다.
2026. 8. 8.
GPT-6 아스트라는 OpenAI가 2026년 9월 3일 공개한, 컴퓨터를 사람처럼 직접 조작하는 데 초점을 둔 모델입니다. 이번 출시가 왜 예전 모델 발표와 다른 반응을 얻었는지, 클로드 페이블 5.1과 제미나이 3.8 플래시와 견주면 어디에 서는지, ARC-AGI-3 99.9%와 Critical 사이버 등급이 무엇을 상징하는지 정리하고 사무직과 AI 전환기의 중장기 방향을 조심스럽게 전망했습니다.
2026. 9. 5.ADVERTISEMENT