AI & Tech

Qwen3.8-Max 정리: 사양, 가격, 자율작업 성적, 오픈웨이트 공개 상태 (2026년 8월 기준)

Qwen3.8-Max는 알리바바 Qwen 팀이 2026년 8월 3일 공개한 2조 4천억 파라미터 규모의 MoE 모델입니다. 공개 자료에 적힌 사양과 가격, 16일 자율 코딩을 포함한 장기 작업 실험 결과, 벤치마크를 읽을 때 주의할 점을 정리했습니다.

Share
Qwen3.8-Max 정리: 사양, 가격, 자율작업 성적, 오픈웨이트 공개 상태 (2026년 8월 기준) 대표 이미지

Qwen3.8-Max는 알리바바 Qwen 팀이 2026년 8월 3일 공개한 2조 4천억 파라미터 규모의 MoE(전문가 혼합) 모델입니다. MoE는 전체 파라미터 중 일부만 골라서 계산에 참여시키는 구조라서, 크기가 커져도 한 번 답할 때 드는 계산량은 그만큼 늘지 않습니다. 여러 매체는 이 모델이 토큰마다 950억 파라미터를 활성화한다고 전하고 있습니다.

이번 발표에서 눈에 띄는 부분은 점수 자체가 아니라 알리바바가 성능을 보여주려고 고른 실험입니다. 알리바바는 질문 하나에 잘 답하는지가 아니라, 2주 넘게 사람이 거의 손대지 않은 상태에서 프로젝트 하나를 끝까지 끌고 갈 수 있는지를 앞세웠습니다.

이 글에서는 공개된 자료에 적힌 사양과 가격, 장기 작업 실험 결과, 벤치마크를 읽을 때 주의할 점, 오픈웨이트 공개 상태를 정리합니다. 2026년 8월 4일 기준입니다.

Qwen3.8-Max 공식 벤치마크 차트 16종. SWE-Pro 67.7, TerminalBench-2.1 86.6, PaperBench 93.0, FrontierSWE 73.5 등의 점수를 Qwen3.7-Max, Opus 4.8, Fable 5, Gemini 3.1 Pro, GPT-5.6 Sol과 막대그래프로 비교한 표

위 이미지는 알리바바가 발표와 함께 낸 벤치마크 차트입니다. 파란색이 Qwen3.8-Max이고, 회색이 비교 대상인 Claude Opus 4.8, Claude Fable 5, Gemini 3.1 Pro, GPT-5.6 Sol입니다. 아래에서 이 수치를 항목별로 나눠 보겠습니다.

Qwen3.8-Max의 사양과 가격

공개 자료에 적힌 사양은 다음과 같습니다.

항목
전체 파라미터2조 4천억
활성 파라미터토큰당 950억 (매체 보도 기준)
컨텍스트 창100만 토큰
최대 입력991K 토큰 (사고 기능 사용 시 983K)
최대 출력131K 토큰
최대 추론 예산262K 토큰
입력 형식텍스트, 이미지, 영상
추론 강도 조절reasoning_effort 값으로 low, medium, xhigh 지정

가격은 100만 토큰 기준입니다.

구분가격
입력 (캐시 미적중)$2.00
출력$6.00
입력 (암묵적 캐시 적중)$0.25
명시적 캐시 생성$2.50
명시적 캐시 읽기$0.17

직전 세대인 Qwen3.7-Max의 정가가 입력 $2.50, 출력 $7.50이었으므로 약 20% 내려간 값입니다. 같은 시기에 쓸 수 있는 다른 상위 모델과 나란히 놓으면 차이가 더 분명해집니다.

모델입력 (100만 토큰)출력 (100만 토큰)
Qwen3.8-Max$2$6
Kimi K3$3$15
GPT-5.6 Sol$5$30
Claude Fable 5$10$50

출력 기준으로 보면 Fable 5의 약 8분의 1, GPT-5.6 Sol의 5분의 1입니다. 다만 가격은 프로모션과 지역에 따라 바뀌므로 실제 청구 화면에서 확인하는 편이 안전합니다. 다른 모델의 특징과 선택 기준은 Kimi K3, Claude Fable 5, GPT-5.6 Sol 비교 글에 따로 정리해 두었습니다.

여러 날에 걸친 자율작업 실험 4가지

알리바바가 발표에서 가장 앞에 둔 것은 벤치마크 점수가 아니라 네 건의 실행 기록입니다. 모두 알리바바가 직접 수행하고 공개한 내용이므로, 제3자가 같은 조건으로 재현한 결과는 아니라는 점을 감안하고 보아야 합니다.

  • 16일간의 코딩 프로젝트: 빈 저장소에서 시작해 oh-my-cli라는 명령줄 도구를 만들었습니다. 약 16일 동안 커밋 265건, 풀 리퀘스트 127건, 이슈 151건이 쌓였습니다. 사용자와 개발자 피드백을 스스로 이슈로 바꾸고, 작업을 나눠 코드를 짜고, 테스트를 돌린 뒤 병합까지 진행했다고 밝혔습니다.
  • 논문 재현: 약 125시간의 계산 시간 동안 7,600줄의 코드를 쓰고 GPU 훈련 작업 33건을 돌려 논문의 파이프라인을 다시 만들었습니다. 원 논문보다 2.71점 높은 결과가 나왔다고 발표했습니다.
  • 칩 설계 최적화: 암호화 회로를 대상으로 약 500회의 상호작용과 71회의 평가를 거쳐 논리 게이트를 8,298개에서 678개로 줄였습니다. 물리 구현 단계에서는 면적이 81% 줄고, 배선 길이가 33,369마이크로미터에서 4,187마이크로미터로 짧아졌으며, 500MHz에서 타이밍 조건을 맞췄다고 밝혔습니다.
  • 이커머스 1년 운영 시뮬레이션: 익명화한 타오바오와 티몰 거래 데이터로 만든 가상 소매 운영 환경입니다. 사기 공급업체 152곳과 무작위 공급 충격이 심어져 있었고, 초기 자본 10만 위안으로 시작해 1년 뒤 잔고 416,252위안으로 끝났습니다. 2위인 GLM-5.2보다 38% 앞선 결과였습니다.

이 밖에 데이터 분석 대회 플랫폼 톈츠에서 24시간 동안 혼자 참가해, 사람으로 구성된 526개 팀 가운데 458개 팀보다 높은 성적을 냈다는 기록도 함께 공개됐습니다.

네 실험의 공통점은 작업 하나가 며칠에서 몇 주 단위로 이어진다는 것입니다. 정답을 한 번 맞히는 능력과, 중간에 실패한 시도를 스스로 정리하고 방향을 다시 잡아 끝까지 가는 능력은 다릅니다. 알리바바가 앞세운 쪽은 뒤쪽입니다.

RL 훈련 환경 수가 늘어남에 따라 10개 이상 벤치마크 종합 점수가 변화하는 꺾은선 그래프. SFT 기준선 0.474에서 시작해 훈련 환경 4,000개 지점에서 0.725로 최고점을 찍고 이후 0.689로 내려간다

위 그래프는 알리바바가 함께 공개한 학습 곡선입니다. 가로축은 강화학습에 쓴 훈련 환경의 개수이고, 세로축은 10개 이상 벤치마크를 묶은 종합 점수입니다. 지도학습만 마친 시점의 0.474에서 시작해 훈련 환경 4,000개 지점에서 0.725로 가장 높았고, 그 뒤로는 다시 내려갑니다. 훈련 환경을 무한정 늘린다고 계속 좋아지지는 않는다는 뜻으로 읽힙니다.

Qwen3.8-Max 벤치마크 수치와 읽을 때 주의할 점

주요 항목을 비교 모델과 함께 정리하면 다음과 같습니다.

벤치마크Qwen3.8-MaxOpus 4.8Fable 5GPT-5.6 Sol
TerminalBench 2.186.684.684.688.8
SWE-bench Pro67.769.280.064.6
FrontierSWE73.570.088.8기록 없음
PaperBench93.080.388.890.5
OSWorld-Verified86.183.485.083.2
CoWorkBench74.872.375.971.5
JobBench53.448.457.445.4
DeepSWE 1.156.659.070.073.0

결과는 항목마다 다릅니다. 논문 재현(PaperBench)과 컴퓨터 조작(OSWorld-Verified)에서는 비교 대상을 모두 앞섰지만, 소프트웨어 수정 능력을 보는 SWE-bench Pro와 FrontierSWE에서는 Fable 5와 격차가 큽니다. 터미널 작업은 GPT-5.6 Sol이 앞섭니다.

수치를 볼 때 두 가지를 감안해야 합니다.

  • 전부 알리바바가 직접 낸 수치입니다. 발표 자료에는 비교 대상 모델이 각 회사가 선호하는 평가 방식에서 측정됐다는 단서가 붙어 있습니다. 같은 조건에서 나란히 돌린 결과가 아닙니다.
  • 표에 들어간 벤치마크 일부는 알리바바가 만든 것입니다. QwenReactBench, QwenSWEBench, QwenQoderBench처럼 이름에 Qwen이 붙은 항목이 그렇습니다. 애플리케이션 재현 능력을 보는 RecreationBench도 이번에 함께 소개된 자체 벤치마크입니다.

여러 에이전트 실행 도구에서 고르게 나온 점수

CoWorkBench, WorkspaceBench, JobBench 세 벤치마크에서 Qwen3.8-Max를 QwenWork, Claude Code, Codex, OpenClaw, Hermes 등 여러 실행 도구에 붙였을 때의 점수를 Fable 5, Opus 4.8, Qwen3.7-Max와 비교한 막대그래프

위 막대그래프는 같은 모델을 서로 다른 에이전트 실행 도구에 붙였을 때 점수가 얼마나 흔들리는지를 보여줍니다. 에이전트 실행 도구는 모델에게 명령을 전달하고 파일과 터미널을 다루게 해 주는 프로그램을 말합니다. Claude Code, Codex, OpenClaw가 여기에 해당합니다.

Qwen3.8-Max는 QwenWork, Claude Code, Codex, OpenClaw, Hermes에서 CoWorkBench 73.2에서 75.8, WorkspaceBench 67.0에서 71.2, JobBench 53.4에서 59.8 사이의 점수를 냈습니다. 어느 도구에 붙여도 점수가 크게 떨어지지 않습니다. 직전 세대인 Qwen3.7-Max가 JobBench에서 31.3에 그쳤던 것과 비교하면 상승 폭이 큽니다.

실무에서는 이 부분이 표의 최고점보다 중요할 수 있습니다. 이미 Claude Code나 Codex로 작업 흐름을 짜 두었다면 모델만 바꿔 끼우는 선택지가 생기기 때문입니다.

Arena 순위와 제3자 검증 상태

사람이 두 모델의 답을 비교해 투표하는 Arena 순위도 함께 공개됐습니다. Qwen3.8-Max는 이미지 부문과 텍스트 부문에서 2위, 프런트엔드 코드 부문에서 1,668점으로 4위에 올랐습니다. 프런트엔드 코드 부문 1위는 1,705점의 Claude Opus 5, 2위는 1,676점의 Kimi K3입니다.

다만 2026년 8월 4일 기준으로 아티피셜 애널리시스 같은 독립 평가 기관의 측정치는 아직 나오지 않았습니다. 지금 볼 수 있는 표는 대부분 알리바바 발표 자료이거나 그것을 옮긴 것입니다.

오픈웨이트 공개 예고와 지금 확인해야 할 것

알리바바는 발표 시점에 다음 주 안으로 허깅페이스와 모델스코프에 Qwen3.8-Max의 가중치를 올리겠다고 밝혔습니다. 소형 모델인 Qwen3.8-27B도 함께 공개할 예정이라고 했습니다. 성사되면 Qwen 계열에서 Max급 모델의 가중치가 공개되는 첫 사례가 됩니다.

여기에는 확인이 필요한 부분이 있습니다.

  • 라이선스가 발표되지 않았습니다. Qwen3.5와 Qwen3.6 계열이 아파치 2.0으로 나왔으므로 같은 조건일 가능성이 있지만, 공식 확인은 아직 없습니다.
  • 직전 두 세대의 상위 모델은 가중치가 공개되지 않았습니다. Qwen3.7-Max와 Qwen3.6-Max-Preview는 알리바바 클라우드를 거쳐서만 쓸 수 있었습니다. 일반 모델 중 마지막 오픈웨이트 공개는 2026년 4월 22일의 Qwen3.6-27B입니다.
  • 2조 4천억 파라미터를 자체 서버에서 돌리려면 장비 요구 수준이 높습니다. 가중치가 공개되더라도 개인이나 소규모 팀이 바로 띄울 수 있는 크기는 아닙니다. Qwen3.8-27B 쪽이 현실적인 선택지가 될 가능성이 큽니다.

지금 시점에서는 예고와 공개를 나눠서 보는 편이 안전합니다. 자체 서버 운영을 전제로 일정을 잡기보다는, 실제 파일과 라이선스 문구를 확인한 뒤에 계획을 세우는 순서가 낫습니다.

실무 비용 계산 예시와 함께 확인할 것

가격 차이가 얼마나 되는지는 실제 작업량을 넣어 보면 바로 나옵니다. 광고 소재 카피를 대량으로 만드는 작업을 예로 들어 보겠습니다. 브랜드 가이드와 과거 소재를 컨텍스트에 넣어 한 번에 입력 20만 토큰, 출력 3만 토큰이 나가고, 이 작업을 한 달에 100회 돌린다고 하면 이렇게 됩니다.

모델입력 비용출력 비용합계
Qwen3.8-Max2천만 토큰 × $2 = $40300만 토큰 × $6 = $18$58
Claude Fable 52천만 토큰 × $10 = $200300만 토큰 × $50 = $150$350

같은 작업에서 약 6분의 1입니다. 캐시가 적중하면 입력 단가가 $0.25까지 내려가므로 격차는 더 벌어집니다. 브랜드 가이드처럼 매번 똑같이 들어가는 부분이 많은 작업일수록 캐시 효과가 큽니다.

다만 비용만으로 정할 문제는 아닙니다. 확인할 것이 두 가지 더 있습니다.

  • 작업 성격과 벤치마크가 맞는지 봐야 합니다. 표에서 Qwen3.8-Max가 앞선 항목은 논문 재현과 컴퓨터 조작 쪽이고, 기존 코드베이스를 고치는 작업에서는 Fable 5가 앞섰습니다. 회사에서 실제로 반복하는 작업 한두 개를 골라 같은 입력으로 돌려 보는 것이 표를 읽는 것보다 정확합니다.
  • 데이터 처리 조건을 확인해야 합니다. 현재 접근 경로는 알리바바 클라우드입니다. 고객 데이터나 미공개 자료를 넣을 계획이라면 저장 위치와 학습 이용 여부를 약관에서 먼저 확인해야 합니다. 이 부분은 API로 데이터를 주고받는 구조를 이해하고 있으면 판단하기 쉽습니다.

3줄 요약:

  • Qwen3.8-Max는 알리바바가 2026년 8월 3일 공개한 2조 4천억 파라미터 MoE 모델이고, 가격은 100만 토큰당 입력 $2, 출력 $6으로 Claude Fable 5 출력가의 약 8분의 1입니다.
  • 발표의 핵심은 점수보다 16일 자율 코딩, 칩 설계 500턴, 이커머스 1년 시뮬레이션처럼 여러 날에 걸친 작업 기록이지만, 모두 알리바바가 직접 수행하고 공개한 결과입니다.
  • Max 계열 첫 오픈웨이트 공개가 예고됐으나 2026년 8월 4일 기준 파일과 라이선스가 확인되지 않았으므로, 자체 서버 운영 계획은 실제 공개 이후에 세우는 것이 안전합니다.

Sources

이 글이 도움이 되셨다면 공유해 주세요

메신저로 바로 보내거나 링크를 복사할 수 있습니다.

다음으로 읽어볼 글

퀴즈

2026년 8월 4일 기준, Qwen3.8-Max의 모델 가중치 공개 상태로 맞는 설명은 무엇일까요?