AI & Tech

Ox Alpha 정체와 GLM-5.3-Flash 스펙 정리

Ox Alpha는 중국 Z.AI가 만든 곳을 감춘 채 OpenRouter에 무료로 공개했던 GLM-5.3-Flash의 프리뷰 모델입니다. 2026년 8월 21일 이름 없이 등장해 닷새 만에 사용량 1위에 올랐고, 8월 26일 정체가 공개되면서 MIT 라이선스로 가중치까지 풀렸습니다. 공개 경과와 공식 스펙, 벤치마크 점수가 측정 방식에 따라 달라진 사례를 정리했습니다.

2026. 8. 27.21
Share
Ox Alpha 정체와 GLM-5.3-Flash 스펙 정리 대표 이미지

새 모델이 나오면 만든 회사의 이름과 벤치마크 점수가 함께 발표됩니다. 어느 회사가 만들었는지 알면 대략의 기대치가 정해지고, 점수는 그 기대치를 숫자로 확인하는 재료가 됩니다.

그런데 2026년 8월 21일 OpenRouter에 올라온 Ox Alpha는 만든 곳을 밝히지 않았습니다. 회사 이름도 공식 점수도 없이 무료로만 열려 있어서, 판단할 재료가 실제로 돌려 본 결과밖에 없었습니다. 상표를 가린 채 접시만 내놓은 시식 코너처럼 이름을 지우고 맛부터 보여준 방식입니다.

닷새 만에 사용량 1위에 올랐고 8월 26일 중국 Z.AI가 자사 모델이라고 확인했습니다. 순서가 이렇게 뒤집히면 실무자는 판단이 어려워지는데, 무료 기간에 붙어 있던 조건과 정식 출시 뒤의 가격이 서로 다르기 때문입니다. OpenRouter 모델 페이지와 Z.ai 공식 모델 카드를 근거로 2026년 8월 27일 기준으로 정리하겠습니다.

OpenRouter의 Ox Alpha 모델 페이지 화면. 상단 경고 배너에 이 스텔스 모델은 ZAI가 개발하고 운영했으며 ZAI GLM-5.3-Flash로 밝혀졌다는 안내와 프롬프트를 제공자가 보관하되 학습에는 쓰지 않는다는 설명이 있고, 아래에 모달리티, 컨텍스트 1M, 공개일 2026년 8월 21일이 표시되어 있다

위 화면은 OpenRouter의 Ox Alpha 모델 페이지입니다. 정체가 공개된 뒤 상단에 경고 배너가 붙었고, 여기에 개발과 운영을 맡은 곳이 ZAI이며 ZAI GLM-5.3-Flash로 밝혀졌다는 안내가 적혀 있습니다.

Ox Alpha 등장부터 정체 공개까지의 경과

닷새 사이에 일어난 일을 날짜순으로 정리하면 다음과 같습니다.

날짜 (2026년)내용
8월 21일OpenRouter에 stealth/ox-alpha로 등록. 만든 곳을 밝히지 않은 스텔스 모델로 표기되고 무료로 열림
8월 23일사용량이 오르면서 만든 곳을 두고 추측이 나오기 시작. 테크크런치가 관련 보도
8월 25일까지주간 처리 토큰 23.2조로 OpenRouter 리더보드 1위
8월 26일Z.AI가 블룸버그에 자사 GLM 시리즈의 새 버전이라고 확인. 같은 날 GLM-5.3-Flash로 정식 등록되고 가중치 공개

OpenRouter가 모델 페이지에 적어 둔 설명은 이렇습니다. Ox Alpha는 코딩과 오래 돌아가는 에이전트 작업, 프로덕션 워크로드를 위해 만든 추론 모델이고, 긴 호흡의 소프트웨어 작업과 텍스트에 시각 자료를 함께 쓰는 작업에 맞춘다는 내용입니다.

프리뷰 기간에 공개된 정보는 세 가지였습니다. 컨텍스트 100만 토큰, 텍스트와 이미지와 영상을 받아 텍스트를 내보내는 입출력 구성, 그리고 요금을 받지 않는다는 조건입니다. 만든 곳과 정식 가격, 파라미터 규모는 모두 비어 있었습니다.

스텔스 모델이라는 출시 방식

스텔스 모델이라는 말은 일반 모델 출시보다 상대적으로 낯설 수 있습니다. 쉽게 말하면 만든 곳을 밝히지 않은 채 중개 서비스에만 올려 두고 반응을 먼저 받아 보는 공개 방식입니다. OpenRouter는 이 모델을 두고 익명을 유지하기로 한 제3자 제공자가 개발하고 운영하며, 자신들은 요청을 넘겨줄 뿐 개발자나 소유자가 아니라고 명시했습니다.

이 방식에는 만드는 쪽 입장에서 분명한 이점이 있습니다. 상표를 가린 시식 코너에서 손님이 브랜드가 아니라 맛만 보고 줄을 서듯, 회사 이름이 없으면 평가가 결과물로만 모이기 때문입니다. 중국 연구소가 만든 모델에 붙기 쉬운 선입견도 이 구간에서는 작동하지 않습니다.

실제로 반응은 빠르게 모였습니다. 스트라이프 최고경영자 패트릭 콜리슨이 X에 매우 인상적이라고 적은 사례가 있고, 개발자 커뮤니티에서도 만든 곳을 두고 추측이 이어졌습니다.

OpenRouter LLM 리더보드 화면. 1위 Ox Alpha가 stealth 제공으로 23.2조 토큰에 new 표시, 2위 DeepSeek V4 Flash 0731이 11.6조 토큰, 3위 샤오미 MiMo-V2.5가 9.92조 토큰으로 이어진다

위 화면은 2026년 8월 25일까지의 사용량을 반영한 OpenRouter 리더보드입니다. Ox Alpha가 23.2조 토큰으로 1위에 있고, 2위인 딥시크 V4 Flash의 11.6조 토큰과 견주면 두 배 규모입니다. 등록 닷새 만의 기록이라 무료라는 조건이 크게 작용했다고 볼 수 있습니다.

커뮤니티가 정체를 좁혀 간 방법

공식 발표가 나오기 전까지 사용자들은 모델의 겉으로 드러나는 동작만으로 만든 곳을 추정했습니다. 커뮤니티 관찰이라 단정할 근거는 아니지만, 어떤 신호를 봤는지 정리하면 다음과 같습니다.

  • 토큰 수 대조: 여러 언어와 이모지, 코드를 섞은 프롬프트를 넣고 세어진 토큰 수를 기존 모델들과 맞춰 보는 방식입니다. GLM 계열과 수치가 맞아떨어졌다는 보고가 이어졌습니다.
  • 오류 응답 형식: 잘못된 요청을 일부러 보내면 돌아오는 오류 코드와 문구가 Z.ai의 기존 모델과 같았다는 관찰이 있었습니다.
  • 영상 토큰 계산 방식: 같은 길이의 영상을 넣었을 때 소모되는 토큰이 Z.ai의 시각 모델과 비슷한 규칙을 따랐다는 분석이 나왔습니다.

이런 관찰은 계열을 좁히는 데는 쓸모가 있었지만 버전까지 특정하지는 못했습니다. Z.ai가 GLM-5.3과 GLM-5.2의 기반 모델이 같다고 밝혀 둔 터라 토큰 수만으로는 두 버전을 나눌 수 없었고, 공개된 GLM-5.3은 시각 입력을 기본으로 다루는 모델로 소개되지 않았기 때문입니다. 결국 정체는 추정이 아니라 회사의 확인으로 정해졌습니다.

GLM-5.3-Flash 공식 스펙과 벤치마크

8월 26일 정식 공개된 GLM-5.3-Flash의 공식 사양은 다음과 같습니다.

항목내용
모델 IDz-ai/glm-5.3-flash
파라미터총 3,200억, 토큰마다 활성화되는 부분은 180억
구조희소 어텐션과 선형 어텐션을 섞은 하이브리드 구조에 mHC 적용
사전학습30조 토큰 규모의 멀티모달 학습 자료
컨텍스트100만 토큰
입출력텍스트, 이미지, 영상 입력과 텍스트 출력
라이선스MIT
가중치허깅페이스 zai-org/GLM-5.3-Flash에 공개

Z.ai는 모델 카드에서 GLM-5.3-Flash를 GLM-5 계열 최초의 네이티브 멀티모달 모델로 소개하고, 벤치마크와 실사용 모두에서 GLM-5.2를 10분의 1 가격으로 앞서면서 코딩과 에이전트 평가에서 Claude Opus 4.8에 근접했다고 밝혔습니다. 회사 공식 계정은 학습과 구동을 모두 중국산 AI 칩에서 처리했다는 내용도 함께 알렸습니다.

Z.ai 공식 벤치마크 그래프. 6개 평가에서 GLM-5.3-Flash가 Terminal Bench 2.1 84.3, DeepSWE v1.1 63.4, Agents Last Exam 26.3, AutomationBench 48.8, HLE with Tools 55.3, GDPVal-AA v2 1773을 기록했고 Claude Opus 4.8과 GPT-5.6 Terra, Gemini 3.7 Flash가 나란히 비교되어 있다

위 그래프는 Z.ai가 공개한 공식 평가 결과입니다. 여섯 개 평가 가운데 실제 직무 수행을 재는 GDPVal-AA v2 한 곳에서 비교 대상 중 가장 높은 점수를 받았습니다.

평가 항목GLM-5.3-FlashGLM-5.2Claude Opus 4.8GPT-5.6 TerraGemini 3.7 Flash
Terminal Bench 2.184.381.085.087.485.8
DeepSWE v1.163.446.258.069.665.3
AutomationBench48.826.241.037.252.3
GDPVal-AA v217731504158215711527

이전 버전인 GLM-5.2와의 차이가 특히 큽니다. 코드 수정을 재는 DeepSWE에서 46.2에서 63.4로 올랐고 AutomationBench는 26.2에서 48.8로 거의 두 배가 됐습니다. 다만 터미널 작업과 DeepSWE에서는 GPT-5.6 Terra가, AutomationBench에서는 Gemini 3.7 Flash가 앞서므로 전 항목 우위라는 서술은 성립하지 않습니다. 회사도 발표문에서 Claude Opus 4.8을 앞섰다고 하지 않고 근접했다고 적었습니다.

같은 벤치마크에서 점수가 다르게 나온 사례

프리뷰 기간에 커뮤니티가 올린 측정치와 공식 점수가 어긋난 대목이 있습니다. 이 차이는 모델을 판단할 때 무엇을 조심해야 하는지 보여 주는 사례라서 따로 정리했습니다.

한 개발자가 DeepSWE 과제 10개를 돌려 약 80%라는 결과를 공개했고, 이 수치가 경쟁 모델을 앞선다는 이야기로 퍼졌습니다. 그런데 같은 벤치마크의 전체 과제 113개로 범위를 넓힌 측정에서는 58.4%가 나왔고, Z.ai가 공식 발표한 점수는 63.4였습니다.

표본 10개로 잰 80%와 전체 과제로 잰 63.4는 같은 벤치마크의 결과이지만 도입 판단의 근거로 쓰기에는 무게가 전혀 다릅니다.

시식 코너에서 한 입 먹고 내린 평가와 한 접시를 다 비우고 내린 평가가 다르듯, 표본이 작으면 몇 문제의 성패가 전체 비율을 크게 바꿉니다. 열 문제 중 한 문제만 결과가 바뀌어도 10퍼센트포인트가 움직입니다. 평가를 돌린 조건도 함께 봐야 하는데, Z.ai는 DeepSWE를 mini-swe-agent 하네스에서 400K 컨텍스트로 여섯 시간 제한을 두고 측정했다고 밝혔습니다. 하네스와 제한 시간이 다르면 같은 모델도 다른 점수가 나옵니다.

가격과 라이선스, 무료 프리뷰의 조건

정식 출시 뒤의 가격은 프리뷰 기간과 완전히 다릅니다. 2026년 8월 27일 기준 OpenRouter에 표시된 정가는 100만 토큰당 입력 0.15달러, 출력 0.50달러입니다. 2026년 9월 9일 16시 UTC까지는 50% 할인이 적용되어 입력 0.075달러, 출력 0.25달러로 내려갑니다.

OpenRouter의 Z.ai GLM 5.3 Flash 모델 페이지. 상단에 2026년 9월 9일 16시 UTC까지 50% 할인 안내가 있고, 네이티브 멀티모달 모델이라는 설명과 함께 100만 토큰당 0.075달러 대 0.25달러 가격, 컨텍스트 1M, 공개일 2026년 8월 26일이 표시되어 있다

위 화면이 정식 등록된 GLM-5.3-Flash의 모델 페이지입니다. 같은 시점 다른 모델들과 견주면 출력 단가 0.50달러는 낮은 편에 속합니다. 앞선 세대인 GLM-5.2의 출력 정가가 100만 토큰당 4달러대였으니, 회사가 밝힌 10분의 1이라는 설명과 대체로 맞아떨어집니다.

가중치가 MIT 라이선스로 공개된 점도 함께 봐야 할 조건입니다. MIT는 상업적 이용과 수정, 재배포를 모두 허용하는 느슨한 라이선스라서, 자체 서버에서 돌리거나 고쳐서 쓰는 데 별도의 계약이 필요하지 않습니다.

프리뷰 기간의 데이터 조건은 따로 확인이 필요합니다. OpenRouter는 Ox Alpha 모델 페이지에 프롬프트와 응답을 제공자가 보관하며 학습에는 쓰지 않고, 그 밖의 사용은 스텔스 모델 약관을 따른다고 적어 두었습니다. 시식이 공짜라도 방문 기록은 남듯, 무료 구간에서는 데이터 처리 조건이 정식 서비스와 다른 경우가 흔합니다.

실무에서 확인할 순서

  • 무료 프리뷰에 넣은 자료부터 살펴봅니다. Ox Alpha를 8월 21일부터 26일 사이에 써 봤다면 그 기간에 어떤 자료를 넣었는지 확인합니다. 고객 정보나 계약서 같은 자료가 들어갔다면 보관 조건을 팀 내부에 공유해 두는 편이 안전합니다.
  • 가격은 할인 종료 이후를 기준으로 잡습니다. 지금 보이는 입력 0.075달러는 2026년 9월 9일까지의 한시 가격이고, 그 뒤에는 0.15달러가 적용됩니다. 예산은 정가로 계산해 두면 나중에 어긋나지 않습니다.
  • 평소 쓰는 작업 두세 개를 같은 조건으로 돌려 봅니다. 발표된 점수는 특정 하네스와 제한 시간 아래에서 나온 값이라, 실제 판단은 우리 작업의 결과물과 걸린 시간으로 하는 편이 맞겠습니다.
  • 자체 운영이 필요한지부터 정합니다. MIT 라이선스로 가중치가 열려 있어도 3,200억 파라미터 모델을 돌리려면 상당한 장비가 필요합니다. API로 충분한 작업이라면 자체 운영을 검토할 이유가 크지 않습니다.

Ox Alpha를 지금도 쓸 수 있나요?

프리뷰 이름으로는 계속 쓰기 어렵습니다. OpenRouter의 stealth/ox-alpha 페이지는 남아 있지만 상단에 GLM-5.3-Flash로 밝혀졌다는 안내가 붙었고, 정식 모델은 z-ai/glm-5.3-flash로 따로 등록됐습니다. 같은 모델을 계속 쓰려면 정식 모델 ID로 옮기는 편이 맞습니다. 다만 프리뷰 기간의 무료 조건은 끝났으므로, 옮긴 뒤에는 100만 토큰당 입력 0.15달러와 출력 0.50달러가 청구된다는 점을 예산에 반영해야 합니다.

GLM-5.3-Flash를 회사 서버에서 직접 돌리려면 무엇이 필요할까요?

가중치는 허깅페이스에 MIT 라이선스로 올라와 있어 내려받는 데 제약이 없습니다. 다만 총 3,200억 파라미터 규모라 일반적인 서버 한 대로는 감당하기 어렵습니다. 모델 카드는 SGLang과 vLLM을 비롯한 실행 프레임워크를 함께 안내하고 있어서, 이미 GPU 서버를 운영하는 팀이라면 기존 환경에 붙일 수 있습니다. 토큰마다 활성화되는 부분이 180억이라 파라미터를 전부 쓰는 같은 규모의 모델보다 연산은 적게 들지만, 가중치 전체를 메모리에 올려야 하는 조건은 그대로입니다. 데이터를 외부로 내보낼 수 없는 조직이 아니라면 API 쪽이 대체로 현실적인 선택입니다.

3줄 요약:

  • Ox Alpha는 중국 Z.AI가 만든 곳을 감춘 채 2026년 8월 21일 OpenRouter에 무료로 올린 모델이고, 8월 26일 GLM-5.3-Flash로 정체가 공개됐습니다. 닷새 만에 주간 처리 토큰 23.2조로 리더보드 1위에 올랐습니다.
  • 공식 사양은 총 3,200억 파라미터에 활성 180억, 컨텍스트 100만 토큰, MIT 라이선스입니다. 가격은 100만 토큰당 입력 0.15달러, 출력 0.50달러이고 2026년 9월 9일까지 절반 가격이 적용됩니다.
  • 프리뷰 기간에 퍼진 DeepSWE 80%는 과제 10개를 돌린 결과였고 공식 점수는 63.4였습니다. 표본이 작은 측정치와 데이터 보관 조건을 확인하지 않은 채 업무에 붙이면 나중에 되돌리기 어렵습니다.

Sources:

이 글이 도움이 되셨다면 공유해 주세요

메신저로 바로 보내거나 링크를 복사할 수 있습니다.

Author

Written by

데이터로 설명하는 마케터

퀴즈

무료로 공개된 프리뷰 모델을 업무에 붙이기 전에 가장 먼저 확인해야 할 것은 무엇일까요?

이 글이 도움이 되었나요?

다음 단계

이어서 읽기 좋은 글

Qwen3.8-Max 정리: 사양, 가격, 자율작업 성적, 오픈웨이트 공개 상태 (2026년 8월 기준)

Qwen3.8-Max는 알리바바 Qwen 팀이 2026년 8월 3일 공개한 2조 4천억 파라미터 규모의 MoE 모델입니다. 공개 자료에 적힌 사양과 가격, 16일 자율 코딩을 포함한 장기 작업 실험 결과, 벤치마크를 읽을 때 주의할 점을 정리했습니다.

다음 글 읽기

같이 보면 좋은 글

구글 픽셀 11, Qwen3.8, 커서 인수로 본 AI 배포 경쟁 썸네일
AI & Tech구글 픽셀 11, Qwen3.8, 커서 인수로 본 AI 배포 경쟁

AI 배포 경쟁은 같은 모델을 몇 개의 화면에 넣어 두느냐로 우열이 정해지는 경쟁입니다. 2026년 8월 12일부터 15일 사이에 나온 발표 다섯 건을 놓고, 각 회사가 모델을 어디까지 밀어 넣었는지 공식 자료 기준으로 정리했습니다.

2026. 8. 15.
클로드 코드와 코덱스 프롬프트 캐시 정리: 작업을 몰아서 해야 하는 이유 썸네일
AI & Tech클로드 코드와 코덱스 프롬프트 캐시 정리: 작업을 몰아서 해야 하는 이유

프롬프트 캐시는 AI에 이미 보낸 앞부분의 계산 결과를 서버가 보관했다가 다음 요청에서 재사용하는 기능입니다. 캐시가 유지되는 조건과 깨지는 조건, 실제 비용 차이를 계산으로 정리했습니다.

2026. 8. 8.
업스테이지 Solar Open 2, Solar Pro 4 정리: 벤치마크와 클로드 코드 연동 썸네일
AI & Tech업스테이지 Solar Open 2, Solar Pro 4 정리: 벤치마크와 클로드 코드 연동

Solar Open 2는 업스테이지가 2026년 7월 22일 가중치까지 공개한 250B 규모의 오픈웨이트 언어 모델입니다. 공식 벤치마크에서 이긴 항목과 뒤진 항목, 클로드 코드에 연결하는 공식 방법, 8월 6일 공개된 상용 모델 Solar Pro 4와의 역할 차이를 정리했습니다.

2026. 8. 6.
헤드리스 AI의 개념과 특징: AI 에이전트 활용하기 썸네일
AI & Tech헤드리스 AI의 개념과 특징: AI 에이전트 활용하기

화면 없이 백그라운드에서 실행되는 헤드리스 AI의 개념과 채팅형 AI와의 차이를 정리했습니다. 이벤트 기반 동작 구조, 이메일 자동 분류와 주간 리포트 자동화 같은 실무 사례, 클로드 코드로 직접 실행하는 방법까지 다룹니다.

2026. 7. 29.

ADVERTISEMENT

이 글의 학습 경로

글 전체 보기

관련 개념

무료 셀프 교육으로 배워보세요

코스 전체 보기