Qwen3.8-Max 정리: 사양, 가격, 0902 업그레이드 (2026년 9월)
홍승협(준이아빠) / 데이터 분석, AI 실무 교육
Qwen3.8-Max는 알리바바 Qwen 팀이 2026년 8월 3일 공개한 2조 4천억 파라미터 규모의 MoE 모델입니다. 공개 자료에 적힌 사양과 가격, 9월 2일 나온 0902 업그레이드의 변화, 16일 자율 코딩을 포함한 장기 작업 실험 결과, 가중치 공개 상태를 정리했습니다.

3줄 요약
이번 방문에서 한 편은 바로 볼 수 있습니다.
Qwen3.8-Max는 알리바바 Qwen 팀이 2026년 8월 3일 공개한 2조 4천억 파라미터 규모의 MoE(전문가 혼합) 모델입니다. MoE는 전체 파라미터 중 일부만 골라서 계산에 참여시키는 구조라서, 크기가 커져도 한 번 답할 때 드는 계산량은 그만큼 늘지 않습니다. 여러 매체가 이 모델은 토큰마다 950억 파라미터를 활성화한다고 전합니다.
이번 발표에서 눈에 띄는 부분은 점수 자체가 아니라 알리바바가 성능을 보여주려고 고른 실험입니다. 알리바바는 질문 하나에 잘 답하는지가 아니라, 2주 넘게 사람이 거의 개입하지 않은 상태에서 프로젝트 하나를 끝까지 끌고 갈 수 있는지를 앞세웠습니다.
지금부터 공개된 자료에 적힌 사양과 가격, 장기 작업 실험 결과, 벤치마크를 읽을 때 주의할 점, 오픈웨이트 공개 상태를 정리합니다. 처음 쓴 날은 2026년 8월 4일입니다.
2026년 9월 3일 업데이트. 알리바바는 2026년 9월 2일 같은 모델을 추가 학습한 Qwen3.8-Max-0902를 API에 올렸습니다. 가격과 컨텍스트 창은 그대로이고 코딩과 협업 에이전트 점수가 올랐습니다. 바뀐 내용은 아래 "0902 업그레이드" 절에 넣었고, 8월에 예고만 있었던 가중치 공개 상태도 실제 확인한 대로 고쳤습니다.
위 이미지는 알리바바가 발표와 함께 낸 벤치마크 차트입니다. 파란색이 Qwen3.8-Max이고, 회색이 비교 대상인 Claude Opus 4.8, Claude Fable 5, Gemini 3.1 Pro, GPT-5.6 Sol입니다. 아래에서 이 수치를 항목별로 나눠 보겠습니다.
Qwen3.8-Max의 사양과 가격
공개 자료에 적힌 사양은 다음과 같습니다.
| 항목 | 값 |
|---|---|
| 전체 파라미터 | 2조 4천억 |
| 활성 파라미터 | 토큰당 950억 (매체 보도 기준) |
| 컨텍스트 창 | 100만 토큰 |
| 최대 입력 | 991K 토큰 (사고 기능 사용 시 983K) |
| 최대 출력 | 131K 토큰 |
| 최대 추론 예산 | 262K 토큰 |
| 입력 형식 | 텍스트, 이미지, 영상 |
| 추론 강도 조절 | reasoning_effort 값으로 low, medium, xhigh 지정 |
가격은 100만 토큰 기준입니다.
| 구분 | 가격 |
|---|---|
| 입력 (캐시 미적중) | $2.00 |
| 출력 | $6.00 |
| 입력 (암묵적 캐시 적중) | $0.25 |
| 명시적 캐시 생성 | $2.50 |
| 명시적 캐시 읽기 | $0.17 |
직전 세대인 Qwen3.7-Max의 정가가 입력 $2.50, 출력 $7.50이었으므로 약 20% 내려간 값입니다. 같은 시기에 쓸 수 있는 다른 상위 모델과 나란히 놓으면 차이가 더 분명해집니다.
| 모델 | 입력 (100만 토큰) | 출력 (100만 토큰) |
|---|---|---|
| Qwen3.8-Max | $2 | $6 |
| Kimi K3 | $3 | $15 |
| GPT-5.6 Sol | $5 | $30 |
| Claude Fable 5 | $10 | $50 |
출력 기준으로 보면 Fable 5의 약 8분의 1, GPT-5.6 Sol의 5분의 1입니다. 위 표의 Sol 단가는 정가입니다. OpenAI가 2026년 8월 21일부터 11월 21일까지 입력 $4, 출력 $20으로 한시 인하해서, 이 기간에는 Sol과의 출력 단가 격차가 약 3분의 1로 좁혀집니다. 가격은 프로모션과 지역에 따라 바뀌므로 실제 청구 화면에서 확인하는 편이 안전합니다. 다른 모델의 특징과 선택 기준은 Kimi K3, Claude Fable 5, GPT-5.6 Sol 비교 글에 따로 정리해 두었습니다.
2026년 9월 2일 업그레이드 Qwen3.8-Max-0902
Qwen3.8-Max-0902는 알리바바가 2026년 9월 2일 API에 올린 업그레이드 스냅샷입니다. QwenCloud 공식 모델 페이지는 이 판을 qwen3.8-max의 업그레이드 스냅샷으로 설명하고, 별칭으로 qwen3.8-max-2026-09-02를 함께 적어 두었습니다. 새 모델이 아니라 같은 2조 4천억 파라미터 모델에 코딩과 협업(Cowork) 작업을 추가 학습한 판입니다.
스냅샷이라는 말은 모델 이름보다 상대적으로 낯설 수 있습니다. 쉽게 말하면 같은 모델을 특정 날짜 기준으로 저장해 둔 판이고, 뒤에 붙은 0902가 그 날짜입니다. 추가 학습은 이미 만든 모델에 특정 작업 자료를 더 가르치는 일이라, 파라미터 수 같은 몸집은 그대로인데 그 작업만 더 잘하게 됩니다.
공식 페이지 기준으로 그대로인 것과 달라진 것을 나누면 다음과 같습니다.
| 구분 | 내용 |
|---|---|
| 그대로 | 100만 토큰 컨텍스트, 사고 모드, 내장 도구, 입력 2달러와 출력 6달러 가격, 캐시 단가 |
| 달라짐 | 규모가 큰 엔지니어링 프로젝트와 장기 자율 개발, 여러 도구를 오가는 협업 에이전트 작업, 차트와 문서 읽기 |
| 모델 ID | qwen3.8-max-0902 (별칭 qwen3.8-max-2026-09-02) |
| 가중치 | 0902판은 API 전용. 2026년 9월 3일 기준 허깅페이스 Qwen 계정에 0902 저장소 없음 |
알리바바가 X에 올린 비교표를 옮긴 보도에 따르면 8월판과의 차이는 코딩 쪽에서 큽니다. 아래 수치는 알리바바가 직접 낸 값이고 제3자가 같은 조건으로 재현한 결과는 아직 없습니다.
| 벤치마크 | 0902 | 8월판 | Claude Opus 5 |
|---|---|---|---|
| TerminalBench 3.0 (에이전트 터미널 코딩) | 29.0 | 11.3 | 42.7 |
| DeepSWE 1.1 (에이전트 코딩) | 69.3 | 56.6 | 73.6 |
| NL2Repo-Bench (저장소 단위 생성) | 64.9 | 55.9 | 72.3 |
| ProgramBench (블랙박스 재현) | 28.0 | 10.5 | 41.5 |
| SWE-Atlas QnA (저장소 이해) | 66.3 | 60.3 | 63.2 |
| JobBench (직무 작업) | 64.0 | 53.4 | 67.8 |
| CoWorkBench (장기 사무 작업, 자체 벤치마크) | 76.1 | 74.8 | 79.6 |
두 가지가 보입니다. 8월판에서 약했던 터미널 코딩과 프로그램 재현 점수가 두세 배로 올라 같은 가격에 받는 성능이 분명히 나아졌고, 그런데도 Opus 5가 앞선 줄이 대부분입니다. 저장소 이해(SWE-Atlas QnA)처럼 0902가 앞선 항목은 있지만 장기 에이전트 코딩에서는 격차가 남아 있습니다.
Arena.ai는 사람이 두 모델의 결과를 나란히 보고 더 나은 쪽에 투표하는 순위표입니다. 이 가운데 웹 화면을 만드는 Code Arena WebDev 부문에서 0902가 1,691점으로 1위에 올랐다고 Arena 쪽이 밝힌 것으로 보도됐습니다. 8월판이 프런트엔드 부문 4위였던 것과 견주면 순위가 올랐고, 웹 프런트엔드 작업에 쓰는 팀이라면 먼저 시험해 볼 만한 근거가 됩니다.
이미 8월판을 API로 쓰고 있다면 모델 ID만 바꾸면 되고 청구 단가는 같습니다. 다만 새 모델 ID를 붙인 뒤 반복하는 작업 몇 건의 결과와 토큰 사용량을 이전 판과 나란히 놓아 보고 넘어가는 편이 안전합니다.
여러 날에 걸친 자율작업 실험 4가지
알리바바가 발표에서 가장 앞에 둔 것은 벤치마크 점수가 아니라 네 건의 실행 기록입니다. 모두 알리바바가 직접 수행하고 공개한 내용이므로, 제3자가 같은 조건으로 재현한 결과는 아니라는 점을 감안하고 보아야 합니다.
- 16일간의 코딩 프로젝트: 빈 저장소에서 시작해
oh-my-cli라는 명령줄 도구를 만들었습니다. 약 16일 동안 커밋 265건, 풀 리퀘스트 127건, 이슈 151건이 쌓였습니다. 사용자와 개발자 피드백을 스스로 이슈로 바꾸고, 작업을 나눠 코드를 짜고, 테스트를 돌린 뒤 병합까지 진행했다고 밝혔습니다. - 논문 재현: 계산에 약 125시간을 쓰면서 코드 7,600줄을 짜고 GPU 훈련 작업 33건을 돌려 논문의 파이프라인을 다시 만들었습니다. 원 논문보다 2.71점 높은 결과가 나왔다고 발표했습니다.
- 칩 설계 최적화: 암호화 회로를 대상으로 약 500회의 상호작용과 71회의 평가를 거쳐 논리 게이트를 8,298개에서 678개로 줄였습니다. 물리 구현 단계에서는 면적이 81% 줄고, 배선 길이가 33,369마이크로미터에서 4,187마이크로미터로 짧아졌으며, 500MHz에서 타이밍 조건을 맞췄다고 밝혔습니다.
- 이커머스 1년 운영 시뮬레이션: 익명화한 타오바오와 티몰 거래 데이터로 만든 가상 소매 운영 환경입니다. 사기 공급업체 152곳과 무작위 공급 충격이 섞여 있었고, 초기 자본 10만 위안으로 시작해 1년 뒤 잔고 416,252위안으로 끝났습니다. 2위인 GLM-5.2보다 38% 앞선 결과였습니다.
이 밖에 데이터 분석 대회 플랫폼 톈츠에서 24시간 동안 혼자 참가해, 사람이 참가한 526개 팀 가운데 458개 팀보다 높은 성적을 냈다는 기록도 함께 공개됐습니다.
네 가지 실험의 공통점은 작업 하나가 며칠에서 몇 주 단위로 이어진다는 것입니다. 정답을 한 번 맞히는 능력과, 중간에 실패한 시도를 스스로 정리하고 방향을 다시 잡아 끝까지 가는 능력은 다릅니다. 알리바바가 앞세운 쪽은 뒤쪽입니다.
위 그래프는 알리바바가 함께 공개한 학습 곡선입니다. 가로축은 강화학습에 쓴 훈련 환경의 개수이고, 세로축은 10개 이상 벤치마크를 묶은 종합 점수입니다. 지도학습만 마친 시점의 0.474에서 시작해 훈련 환경 4,000개 지점에서 0.725로 가장 높았고, 그 뒤로는 다시 내려갑니다. 훈련 환경을 무한정 늘린다고 계속 좋아지지는 않는다는 뜻으로 보입니다.
Qwen3.8-Max 벤치마크 수치와 읽을 때 주의할 점
주요 항목을 비교 모델과 함께 정리하면 다음과 같습니다.
| 벤치마크 | Qwen3.8-Max | Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| TerminalBench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 |
| FrontierSWE | 73.5 | 70.0 | 88.8 | 기록 없음 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 |
| OSWorld-Verified | 86.1 | 83.4 | 85.0 | 83.2 |
| CoWorkBench | 74.8 | 72.3 | 75.9 | 71.5 |
| JobBench | 53.4 | 48.4 | 57.4 | 45.4 |
| DeepSWE 1.1 | 56.6 | 59.0 | 70.0 | 73.0 |
결과는 항목마다 다릅니다.
- 앞선 곳: 논문 재현(PaperBench)과 컴퓨터 조작(OSWorld-Verified)에서 비교 대상을 모두 앞섰습니다.
- 뒤진 곳: 소프트웨어 수정 능력을 보는 SWE-bench Pro와 FrontierSWE에서 Fable 5와 격차가 큽니다.
- 다른 모델이 앞선 곳: 터미널 작업(TerminalBench 2.1)은 GPT-5.6 Sol이 앞섭니다.
수치를 볼 때 두 가지를 감안해야 합니다.
- 전부 알리바바가 직접 낸 수치입니다. 발표 자료에도 비교 대상 모델의 점수는 각 회사가 선호하는 방식으로 잰 값이라고 적혀 있습니다. 같은 조건에서 나란히 돌린 결과가 아닙니다.
- 표에 들어간 벤치마크 일부는 알리바바가 만든 것입니다. QwenReactBench, QwenSWEBench, QwenQoderBench처럼 이름에 Qwen이 붙은 항목이 그렇습니다. 애플리케이션 재현 능력을 보는 RecreationBench도 이번에 함께 소개된 자체 벤치마크입니다.
여러 에이전트 실행 도구에서 고르게 나온 점수
위 막대그래프는 같은 모델을 서로 다른 에이전트 실행 도구에 붙였을 때 점수가 얼마나 달라지는지를 보여줍니다. 에이전트 실행 도구는 모델에 명령을 전달하고 파일과 터미널을 다루게 해 주는 프로그램을 말합니다. Claude Code, Codex, OpenClaw가 여기에 해당합니다.
QwenWork, Claude Code, Codex, OpenClaw, Hermes 다섯 곳에 붙여 재 봤습니다. CoWorkBench는 73.2에서 75.8, WorkspaceBench는 67.0에서 71.2, JobBench는 53.4에서 59.8 사이였습니다. 어느 도구에 붙여도 점수가 크게 떨어지지 않습니다. 직전 세대인 Qwen3.7-Max가 JobBench에서 31.3에 그쳤던 것과 비교하면 상승 폭이 큽니다.
실무에서는 이 부분이 표의 최고점보다 중요할 수 있습니다. 이미 Claude Code나 Codex로 작업 흐름을 짜 두었다면 모델만 바꿔 끼우는 선택지가 생기기 때문입니다.
Arena 순위와 제3자 검증 상태
사람이 두 모델의 답을 비교해 투표하는 Arena 순위도 함께 공개됐습니다. Qwen3.8-Max는 이미지 부문과 텍스트 부문에서 2위, 프런트엔드 코드 부문에서 1,668점으로 4위에 올랐습니다. 프런트엔드 코드 부문 1위는 1,705점의 Claude Opus 5, 2위는 1,676점의 Kimi K3입니다.
이 순위는 8월판 기준이고, 9월 2일 나온 0902판은 Code Arena WebDev 부문 1위로 올라섰다고 보도됐습니다. 벤치마크 표는 여전히 대부분 알리바바 발표 자료이거나 그것을 옮긴 것이라, 독립 평가 기관의 측정치가 나오면 함께 놓고 보는 편이 안전합니다.
Qwen3.8-Max 가중치는 받을 수 있나요?
네, 받을 수 있게 됐습니다. 가중치는 학습이 끝난 모델 파일 자체를 말하고, 이 파일을 받으면 알리바바 서버를 거치지 않고 내 장비에서 모델을 돌릴 수 있습니다. 8월 4일에는 예고만 있었는데, 허깅페이스의 Qwen 계정에 2026년 8월 8일 Qwen3.8-2.4T-A95B와 FP8판이 올라왔습니다. 모델 카드는 이 저장소가 Qwen3.8-Max의 기반 모델이고, Max는 여기에 이미지 입력과 비사고 모드, 기본 100만 토큰 컨텍스트, 내장 도구를 더한 공식 서비스판이라고 설명합니다. Qwen 계열의 Max급 모델 가중치가 공개된 첫 사례입니다.
확인이 필요한 부분은 세 가지입니다.
- 라이선스가 아파치 2.0이 아닙니다. 2.4T-A95B 저장소의 라이선스 항목은 other로 표시되어 있어 별도 라이선스 문서가 붙어 있습니다. 같은 세대의 Qwen3.8-27B는 8월 5일 아파치 2.0으로 올라왔으므로, 상업 이용 조건은 두 저장소의 라이선스 원문을 따로 읽어야 합니다.
- 0902판은 가중치가 없습니다. 2026년 9월 3일 기준 허깅페이스 Qwen 계정에는 8월 8일자 저장소만 있고 0902 저장소는 보이지 않습니다. 자체 서버에서 돌리는 판과 API로 쓰는 판이 다르다는 뜻이라, 성능을 비교할 때 어느 판인지 적어 두어야 합니다.
- 2조 4천억 파라미터를 자체 서버에서 돌리려면 장비 요구 수준이 높습니다. 개인이나 소규모 팀이 바로 띄울 수 있는 크기는 아닙니다. Qwen3.8-27B 쪽이 현실적인 선택지이고, 맥에서 돌리는 조건은 Qwen3.8-27B 로컬 실행 정리에 있습니다.
실무 비용 계산 예시와 함께 확인할 것
가격 차이가 얼마나 되는지는 실제 작업량을 넣어 보면 바로 나옵니다. 광고 소재 카피를 대량으로 만드는 작업을 예로 들어 보겠습니다. 브랜드 가이드와 과거 소재를 컨텍스트에 넣어 한 번에 입력 20만 토큰, 출력 3만 토큰이 나가고, 이 작업을 한 달에 100회 돌린다고 하면 이렇게 됩니다.
| 모델 | 입력 비용 | 출력 비용 | 합계 |
|---|---|---|---|
| Qwen3.8-Max | 2천만 토큰 × $2 = $40 | 300만 토큰 × $6 = $18 | $58 |
| Claude Fable 5 | 2천만 토큰 × $10 = $200 | 300만 토큰 × $50 = $150 | $350 |
같은 작업에서 약 6분의 1입니다. 캐시가 적중하면 입력 단가가 $0.25까지 내려가므로 격차는 더 벌어집니다. 브랜드 가이드처럼 매번 똑같이 들어가는 부분이 많은 작업일수록 캐시 효과가 큽니다.
다만 비용만으로 정할 문제는 아닙니다. 확인할 것이 두 가지 더 있습니다.
- 작업 성격과 벤치마크가 맞는지 봐야 합니다. 표에서 Qwen3.8-Max가 앞선 항목은 논문 재현과 컴퓨터 조작 쪽이고, 기존 코드베이스를 수정하는 작업에서는 Fable 5가 앞섰습니다. 회사에서 실제로 반복하는 작업 한두 개를 골라 같은 입력으로 돌려 보는 것이 표를 읽는 것보다 정확합니다.
- 데이터 처리 조건을 확인해야 합니다. 현재 접근 경로는 알리바바 클라우드입니다. 고객 데이터나 미공개 자료를 넣을 계획이라면 저장 위치와 학습 이용 여부를 약관에서 먼저 확인해야 합니다. 이 부분은 API로 데이터를 주고받는 구조를 이해하고 있으면 판단하기 쉽습니다.
Sources
이 글이 도움이 되셨다면 공유해 주세요
메신저로 바로 보내거나 링크를 복사할 수 있습니다.

Written by
데이터로 설명하는 마케터
2026년 9월 2일 나온 Qwen3.8-Max-0902에서 바뀐 것과 바뀌지 않은 것으로 맞는 설명은 무엇일까요?
이 글이 도움이 되었나요?
다음 단계
이어서 읽기 좋은 글
Kimi K3, Claude Fable 5, GPT-5.6 Sol 비교: 모델별 장점 정리
2026년 7월에 출시된 Kimi K3와 Claude Fable 5, GPT-5.6 Sol의 스펙, 벤치마크, 가격, 커뮤니티 반응을 비교하고 작업 성격별 선택 기준을 정리합니다.
같이 보면 좋은 글

GLM은 중국 AI 기업 Z.ai가 만드는 오픈 웨이트 언어 모델 계열입니다. 2026년 9월 기준 현행 모델 네 가지의 규모와 가격, 라이선스를 나란히 놓고 웹 화면과 API, 코딩 구독, 가중치 내려받기까지 쓰는 방법을 공식 자료로 정리했습니다.
2026. 9. 15.
GPT-6 아스트라는 OpenAI가 2026년 9월 3일 공개한, 컴퓨터를 사람처럼 직접 조작하는 데 초점을 둔 모델입니다. 이번 출시가 왜 예전 모델 발표와 다른 반응을 얻었는지, 클로드 페이블 5.1과 제미나이 3.8 플래시와 견주면 어디에 서는지, ARC-AGI-3 99.9%와 Critical 사이버 등급이 무엇을 상징하는지 정리하고 사무직과 AI 전환기의 중장기 방향을 조심스럽게 전망했습니다.
2026. 9. 5.
클로드 페이블 5.1은 앤트로픽이 2026년 9월 1일 공개한 코딩과 지식 업무용 상위 모델입니다. 벤치마크 변화와 캐시 읽기 75% 인하, 안전장치 완화, 플랜별 이용 조건, 클로드 코드에서 바꾸는 방법을 공식 자료 기준으로 정리했습니다.
2026. 9. 2.
CLAUDE.md는 클로드 코드가 세션마다 읽는 지시 파일입니다. 권장 길이 300줄, 절대 금지 섹션, 9월 모델 가격 인상처럼 널리 도는 이야기를 앤트로픽 공식 문서와 하나씩 맞춰 정리했습니다. 2026년 8월 28일 기준입니다.
2026. 8. 28.ADVERTISEMENT