교육 문의커뮤니티 입장하기

Qwen3.8-Flash-Next 이해하기: 125B와 6B, 메모리와 속도 표 읽기

Qwen3.8-Flash-Next의 주 모델 125B와 활성 6B는 무엇이 다를까요? 필요한 저장 공간과 메모리, 입력 처리량 그래프, API 비용을 구분해 모델 사양을 읽는 연습을 합니다.

지금까지 300명 넘게 읽었어요, 79%가 끝까지 읽었어요
Share
Qwen3.8-Flash-Next 이해하기: 125B와 6B, 메모리와 속도 표 읽기 대표 이미지
목차
  1. 첫 연습: 6B만 쓰면 작은 파일일까요?
  2. Qwen3.8-Flash-Next 공식 사양
  3. 1,250억 개 가운데 60억 개만 쓰는 구조
  4. Qwen4를 미리 여는 네 가지 변경
  5. 입력 처리량과 답변 완료 속도는 다릅니다
  6. 공식 벤치마크와 27B의 Arena 성적
  7. 로컬에서 돌리는 데 필요한 메모리
  8. 이용 조건과 API 비용을 따로 확인합니다
  9. 혼자 다시 해 보기: 사양으로 판단할 수 없는 것 찾기
  10. 3줄 요약

세 줄로 먼저 읽기

이번 방문에서 한 편은 바로 볼 수 있습니다.

Qwen3.8-Flash-Next는 알리바바 Qwen 팀이 2026년 8월 26일 공개한 이미지와 글 등을 입력받는 멀티모달 모델입니다. 다음 세대 Qwen4에 사용할 구조를 미리 공개한 모델이기도 합니다. 이 글에서는 구조 이름을 외우기보다 계산 규모, 저장할 파일, 실행 메모리와 속도 수치가 무엇을 뜻하는지 구분합니다.

오픈 웨이트는 학습된 가중치 파일을 내려받을 수 있다는 뜻입니다. 무료로 모든 용도에 쓸 수 있거나 작은 컴퓨터에서 바로 실행된다는 뜻은 아닙니다. 설명과 가격은 2026년 10월 4일 문서로 보완했으며, 과거 순위 화면에는 별도 날짜를 적었습니다.

첫 연습: 6B만 쓰면 작은 파일일까요?

파라미터는 모델이 학습한 수치이고 B는 10억 개를 뜻합니다. 토큰은 글을 처리하는 단위이며 글자 수와 항상 같지는 않습니다. 다음 세 문장에서 맞는 것을 골라 봅니다.

  1. 주 모델이 125B이고 토큰당 활성 규모가 6B이므로 파일도 6B 분량만 있으면 된다.
  2. 활성 6B는 한 토큰을 처리할 때 계산에 참여하는 규모이며 저장할 전체 파일과는 다르다.
  3. 처리량이 8.6배라는 그래프만 있으면 내 컴퓨터의 답변도 8.6배 빨라진다고 결론 낼 수 있다.

정답은 2번입니다. 1번은 계산할 부분과 보관할 전체를 혼동했고, 3번은 특정 실험의 측정값을 다른 환경에 그대로 적용했습니다. 아래 표에서 125B, 6B, 51B가 각각 무엇인지 찾아봅니다.

Qwen3.8-Flash-Next 공식 사양

공개된 사양은 다음과 같습니다. API는 프로그램이 원격 서비스에 요청하는 연결 방식입니다. 아래에서 CPU는 컴퓨터의 일반 계산 장치, GPU는 병렬 계산에 주로 쓰는 장치를 가리킵니다.

항목내용
공개일2026년 8월 26일
주 모델 파라미터1,250억 개
N-gram 임베딩별도 510억 개
MTP 모듈다음 토큰 예측을 돕는 별도 40억 개
토큰당 활성 파라미터60억 개
구조GDN과 QSA를 섞은 하이브리드 어텐션, Gated Residual, N-gram 임베딩, Muon 옵티마이저
전문가 구성라우팅 전문가 512개 중 10개 선택, 공유 전문가 1개
컨텍스트기본 262,144 토큰, YaRN으로 100만 토큰까지
입출력텍스트, 이미지, 영상 입력과 텍스트 출력
라이선스qwen-community-1.0
가중치허깅페이스와 ModelScope에 공개
API 이름QwenCloud에서 qwen3.8-flash
API 기본 단가100만 토큰당 입력 0.15달러, 출력 0.47달러

공식 모델 카드의 사양과 QwenCloud 가격을 구분해 적었습니다. 컨텍스트는 한 번에 다루는 입력과 출력 등 문맥의 범위이고, YaRN은 이를 늘리는 설정 기법입니다. 최대 길이를 지원해도 그 길이를 내 장비에서 빠르게 처리한다는 보장은 아닙니다.

이름이 둘로 나뉘어 있어 헷갈리기 쉽습니다. 가중치를 공개한 실험판이 Qwen3.8-Flash-Next이고, QwenCloud에서 파는 정식판은 컨텍스트 100만 토큰을 기본으로 켜고 내장 도구를 붙인 Qwen3.8-Flash입니다.

라이선스도 함께 봐야 합니다. 같은 시기의 Qwen3.8-27B가 Apache 2.0인 것과 달리 Flash-Next는 qwen-community-1.0이라는 자체 조건을 답니다. 오픈 웨이트라는 말만 보고 두 모델의 이용 조건이 같다고 넘기면 나중에 확인할 일이 생깁니다.

1,250억 개 가운데 60억 개만 쓰는 구조

전문가 혼합(Mixture of Experts, MoE)이라는 구조는 파라미터를 전부 쓰는 일반적인 모델보다 상대적으로 낯설 수 있습니다. 쉽게 말하면 파라미터를 잔뜩 갖춰 두되 토큰 하나를 처리할 때는 그중 일부만 골라 계산하는 방식입니다.

토큰에 따라 필요한 전문가 부분을 골라도 나머지 가중치 파일이 없어지는 것은 아닙니다. 어떤 부분을 GPU에 두고 CPU 메모리나 저장장치로 옮겨 둘지는 실행 프로그램의 지원과 설정에 달려 있습니다.

별도 51B N-gram 임베딩은 현재 토큰과 앞선 짧은 토큰 묶음을 이용해 값을 찾는 표입니다. 주 모델의 큰 행렬 계산과는 처리 방식이 달라 적은 추가 계산으로 정보를 더 담으려는 구조입니다. 조회와 데이터 이동이 필요하므로 ‘아무 계산도 하지 않는다’는 설명은 정확하지 않습니다. 공식 발표는 이를 CPU 쪽 메모리에 두고 필요한 부분을 미리 가져오는 방식도 설명합니다. 구조 설명

Qwen4를 미리 여는 네 가지 변경

Qwen 팀은 이번 공개를 Qwen3-Next가 Qwen3.5에 했던 역할과 같다고 밝혔습니다. 그때 내놓은 하이브리드 구조가 이후 Qwen3.5부터 3.8까지 쓰였듯, 이번 변경도 Qwen4 계열의 바탕이 될 예정입니다. 바뀐 곳은 네 군데입니다.

  • 어텐션(문맥에서 참고할 정보를 고르는 계산): 네 개 층 가운데 세 개는 Gated DeltaNet으로 지난 내용을 고정 크기 상태에 압축하고, 나머지 한 층은 문맥에서 필요한 정보를 찾는 데 씁니다. 여기에 Qwen Sparse Attention을 더해 문맥을 작은 단위로 나눈 뒤 중요한 부분만 골라 봅니다.
  • 잔차(앞 단계 정보를 뒤 단계로 전달하는 구조): 층마다 정보가 오가는 통로를 하나에서 네 개로 넓히고, 통로마다 얼마나 읽고 쓸지를 그때그때 정합니다. 초반에 만들어진 신호가 뒤로 갈수록 흐려지는 것을 줄이려는 변경입니다.
  • 임베딩(토큰을 모델이 사용할 수치로 표현하는 방식): 앞서 설명한 N-gram 임베딩으로 계산량을 거의 늘리지 않고 모델이 담는 정보량을 키웁니다.
  • 최적화: 학습 중 가중치를 바꾸는 알고리즘인 Muon과 AdamW를 가중치 종류에 따라 나눠 씁니다.

이 변경들이 겨냥한 것은 점수보다 비용입니다. 공식 발표는 이전 세대인 Qwen3.7-Plus와 견줘 학습에 든 비용이 약 9분의 1이면서 코딩과 사무 작업에서는 더 나은 결과를 냈다고 밝혔습니다.

입력 처리량과 답변 완료 속도는 다릅니다

그래프 제목의 Prefill은 입력을 먼저 처리하는 단계를 뜻합니다. 답변 토큰을 이어서 만드는 단계는 Decode입니다. 캐시 적중률 90%는 이전 입력의 처리 결과를 많이 재사용하는 실험 조건이며, 내 요청에서도 자동으로 90%가 재사용된다는 뜻은 아닙니다.

가로 방향은 입력 길이, 세로 방향은 같은 길이의 Qwen3.7-Plus를 1로 둔 상대 입력 처리량입니다. 가로 눈금은 16K, 32K처럼 대체로 두 배씩 늘어나므로 같은 간격을 같은 토큰 증가량으로 읽지 않습니다. Flash-Next는 16K에서 약 2.1배, 1M에서 8.6배입니다. M은 여기서 100만 토큰을 뜻합니다.

이는 해당 조건에서 긴 입력 처리의 이점이 커졌다는 발표입니다. 전체 응답 시간에는 입력 처리 외에 답변 생성과 대기 시간도 포함됩니다. 따라서 8.6배를 그대로 답변 속도나 API 할인율로 사용하지 않습니다. 어텐션 계산 일부를 따로 측정한 수치 역시 전체 서비스 속도와 구분해야 합니다.

공식 벤치마크와 27B의 Arena 성적

Qwen 팀이 공개한 자체 측정 가운데 코딩과 에이전트 항목은 다음과 같습니다.

평가 항목Flash-NextQwen3.8-27BQwen3.7-PlusDeepSeek-V4-Flash-0731
DeepSWE 1.158.742.216.554.4
SWE-bench Pro62.561.755.856.0
SWE-bench Multilingual81.073.875.8측정 없음
CoWorkBench73.970.765.145.1
JobBench55.733.427.641.3

눈에 띄는 것은 SWE-bench Pro입니다. 125B인 Flash-Next가 62.5, 27B가 61.7로 차이는 0.8점입니다. 다만 DeepSWE 1.1에서는 58.7 대 42.2로 크게 벌어지므로, 항목에 따라 두 모델의 거리가 달라진다고 보는 편이 정확합니다. DeepSWE는 두 실행 환경 가운데 높은 점수를 보고한 결과입니다. CoWorkBench는 개발팀의 사무 업무 평가입니다. 모델 규모 하나로 순위를 정하지 말고 과제와 실행 조건을 함께 봅니다.

만든 곳이 아닌 쪽의 측정으로는 Arena의 사람 투표 결과가 있습니다.

위 화면은 2026년 8월 22일 집계 기준 Arena의 Code WebDev 리더보드에서 참고 이미지를 보고 화면을 만드는 카테고리를 열고 오픈소스만 걸러낸 결과입니다. Qwen3.8-27B가 1,614점으로 오픈 모델 가운데 3위, 전체 순위는 9위로 표시돼 있습니다.

이 화면의 모델은 Flash-Next가 아니라 Qwen3.8-27B입니다. 표시된 순위는 당시 해당 카테고리의 결과이며 현재 순위나 모든 코딩 작업의 순위가 아닙니다. 화면의 Open Source 필터에 함께 나타났다고 모델들의 이용 약관이 같아지는 것도 아닙니다.

로컬에서 돌리는 데 필요한 메모리

위 이미지는 원문 작성 때의 Unsloth 안내 화면입니다. 이미지의 top-1 80%는 양자화 비교 지표이며, 일반 질문 100개 중 80개를 맞힌다는 뜻도 ‘상위 1%’라는 뜻도 아닙니다.

양자화는 가중치의 수치 정밀도를 낮춰 용량을 줄이는 방식입니다. 이 모델의 1비트 배포본도 모든 부분을 1비트로 저장하지 않으며 N-gram 부분에는 4비트 등을 사용합니다. Unsloth 실행 문서의 현재 메모리 안내는 다음과 같습니다.

양자화안내 메모리
1비트75GB
2비트79GB
3비트90GB
4비트96~114GB
5비트163GB
8비트200GB
BF16355GB

BF16은 16비트 수치 형식입니다. 문서는 시스템 RAM과 GPU 메모리인 VRAM의 합계, 또는 통합 메모리를 기준으로 안내하고 최소 배포본에는 96GB 장비를 권합니다. 이는 모든 환경의 충분 조건은 아닙니다. 운영체제, 실행 프로그램과 긴 문맥에 쓸 여유도 필요하며 RAM과 VRAM을 함께 활용할 수 있는지는 실행 방식에 따라 다릅니다.

75GB 파일을 보관할 저장장치 여유와 모델을 실행할 메모리는 따로 확인합니다. 일부를 저장장치로 옮기는 기능도 있지만 성능은 장치와 설정에 따라 달라집니다. CPU와 GPU가 언제나 같은 속도라고 생각하면 안 됩니다. 27B 맥 실행 기록도 특정 파일과 설정의 결과이며 모든 24GB 맥에 일반화하지 않습니다.

이용 조건과 API 비용을 따로 확인합니다

Flash-Next의 qwen-community-1.0 원문은 저작권 및 허가 고지 보존을 요구합니다. 모델 제공 서비스나 독립 AI 코딩 및 사무 보조 사업에는 별도 라이선스 조건이 있고 내부 이용 예외에도 범위가 있습니다. 개인 시험과 외부 고객용 제품은 이용 형태가 다르므로, 27B의 Apache 2.0 조건을 이 모델에 대신 적용하지 않습니다.

QwenCloud API에서는 qwen3.8-flash라는 이름을 씁니다. 현재 가격표는 100만 토큰당 일반 입력 0.15달러, 출력 0.47달러, 캐시 읽기 0.016달러와 명시적 캐시 생성 0.20달러를 구분합니다. 입력 단가 0.16달러로 적힌 예전 설명과 현재 표를 혼용하지 않습니다.

캐시와 도구가 없는 가상 요청으로 일반 입력 10,000토큰, 청구 대상 출력 1,000토큰을 사용했다면 0.01 × 0.15 + 0.001 × 0.47 = 0.00197달러입니다. 같은 사용량을 1,000번 반복하면 1.97달러입니다. 실제 청구는 재시도, 추론을 포함한 출력 사용량과 도구 비용 등을 더 확인해야 합니다.

호환 API라고 해도 모델 이름과 주소만 바꾸면 모든 기능이 같게 동작하는 것은 아닙니다. 추론 설정과 도구 호출, 출력 형식을 작은 요청으로 확인합니다. 공식 예제의 추론 강도는 xhigh가 기본이며 medium, low를 지원합니다. 낮은 강도에서 실패와 재시도가 늘면 전체 시간이 더 길어질 수도 있습니다. 공식 API 예제와 주의점

혼자 다시 해 보기: 사양으로 판단할 수 없는 것 찾기

‘RAM 96GB, 저장장치 여유 200GB, 1비트 파일 약 75GB’라는 가상 장비 기록을 읽어 봅니다. 파일 보관 여유가 있다는 판단은 가능하지만, 100만 토큰 입력을 빠르게 처리할 수 있다고 확정할 수는 없습니다. 문맥 길이와 실행 프로그램, 남은 메모리와 실제 속도를 더 확인해야 합니다.

다음에는 같은 장비의 RAM만 64GB로 바꿔 봅니다. 저장장치에 파일이 들어간다는 사실은 그대로지만, 위 메모리 안내보다 작으므로 같은 설정의 실행 가능성을 단정하지 않습니다. 장비 구매 대신 더 작은 모델이나 허용된 원격 서비스로 짧은 작업부터 비교하는 방법을 검토할 수 있습니다.

실제 실행 환경이 이미 있다면 10월 12일 회의, 담당자 민수라는 가상 메모에서 날짜와 담당자만 추출하게 합니다. 기대 결과는 10월 12일 / 민수입니다. 모델 이름, 양자화 형식, 문맥 길이, 추론 설정, 정답 일치와 시간을 기록합니다. 답변이 중간에 끝나면 출력 한도와 추론 사용량을, 실행이 실패하면 지원 버전과 메모리 사용을 확인합니다. 원문의 날짜를 10월 15일로 바꿔 다시 요청하면 10월 15일 / 민수가 나와야 합니다. 날짜 변경과 담당자 유지를 모두 확인하면 됩니다.

3줄 요약

  1. Qwen3.8-Flash-Next의 활성 6B는 토큰당 계산 규모이며 주 모델과 별도 임베딩 전체의 저장 크기를 뜻하지 않습니다.

  2. 공식 8.6배 수치는 캐시 적중률 90% 등 특정 조건의 입력 처리량이며 답변 전체 속도나 비용을 보장하지 않습니다.

  3. 로컬 실행은 파일 형식과 메모리 여유를 확인하고 API 이용은 정확한 모델 이름과 현재 요금을 따로 확인합니다.

Share

제대로 이해했는지 한 문제로 확인해 볼까요?

답을 고르면 바로 풀이가 나와요.

Qwen3.8-Flash-Next의 활성 파라미터가 60억 개라는 설명은 무엇을 뜻할까요?

이 글이 도움이 되었나요?

이 글 다음 배우기로컬 AI 시작하기 입문입문 코스 · 12편

내 컴퓨터에서 AI를 돌릴 때 필요한 하드웨어, 모델 크기, 실행 도구를 순서대로

  1. 1로컬 AI 뜻과 클라우드 AI와 다른 점
  2. 2오픈 웨이트와 오픈 소스 차이, 라이선스 확인법
  3. 3로컬 AI 하드웨어 기초, VRAM과 통합 메모리와 대역폭
코스 전체 보기 →
이어서 읽기 좋은 글클로드 페이블 5.1(Claude Fable 5.1)과 미토스 5.1 공개, 달라진 점 정리 →

페이블 5.1의 성능 평가와 캐시 읽기 가격 인하를 살펴봅니다. 계산기로 전체 비용 차이를 확인하고, 플랜별 요금과 클로드 코드 모델 선택 시 확인할 조건을 정리했습니다.