Qwen4 출시 준비 정황: 아스트라 증류설 확인 결과와 Qwen3.8 계열 비교
홍승협(준이아빠) / 데이터 분석, AI 실무 교육
Qwen4는 알리바바 Qwen 팀이 준비 중인 다음 세대 모델이고, 공개된 모델 설정 파일에 내부 이름이 이미 박혀 있습니다. GPT-6 아스트라를 증류한 것 아니냐는 이야기가 도는데, 미국 정부 합동 권고문과 공개 실험을 직접 열어 대조한 결과와 Qwen3.8 계열 세 모델의 차이를 2026년 9월 23일 기준으로 정리했습니다.

3줄 요약
이번 방문에서 한 편은 바로 볼 수 있습니다.
Qwen4는 알리바바 Qwen 팀이 준비 중인 다음 세대 모델입니다. 아직 가중치도 사양도 공개되지 않았는데, 이미 공개된 모델의 설정 파일과 여러 실행 도구의 코드에 이름이 먼저 들어와 있습니다.
9월 22일에는 알리바바가 자사 컨퍼런스에서 Qwen4가 학습 단계에 들어갔다고 밝혔다는 보도가 나왔습니다. 같은 발표에서 5조에서 10조 파라미터라는 규모를 언급했는데, 이것은 Qwen4가 아니라 그 다음인 4.5와 5 계열을 가리킨 값입니다.
여기에 이야기가 하나 붙었습니다. Qwen4가 오픈AI의 GPT-6 아스트라를 증류해서 만든 것 아니냐는 의심입니다. 9월 8일에 미국 정부 기관 세 곳이 중국 AI 기업의 증류를 지목한 권고문을 내면서 이 이야기가 커졌습니다.
결론부터 말하면 아스트라를 증류했다는 주장은 근거를 찾지 못했고, 시점을 놓고 보면 성립하기 어렵습니다. 다만 알리바바를 향한 증류 의혹 자체는 실재하고, 알려진 것과 대상도 시기도 다릅니다. 공식 저장소와 권고문 원문, 공개 실험 자료를 직접 열어 2026년 9월 23일 기준으로 정리했습니다.
Qwen4가 준비 중이라는 근거
분명한 흔적이 이미 공개된 모델 안에 있습니다. 8월 26일에 나온 Qwen3.8-Flash-Next의 config.json을 열면 모델 종류가 이렇게 적혀 있습니다.
"architectures": ["Qwen4ExpForConditionalGeneration"],
"model_type": "qwen4_exp"같은 세대의 다른 모델과 비교하면 차이가 드러납니다. Qwen3.8-27B의 설정 파일은 qwen3_5이고, 2.4조 규모인 Qwen3.8-2.4T-A95B도 Qwen3_5MoeForCausalLM입니다. Flash-Next만 qwen4_exp입니다. 제품 이름은 3.8 세대를 달고 나왔지만 내부 코드명은 이미 다음 세대라는 뜻입니다.
공식 문서에도 같은 내용이 있습니다. 허깅페이스 모델 카드에 이렇게 적혀 있습니다.
Qwen4를 떠받칠 구조를 미리 보여 주는 실험적 공개입니다.
같은 날 공개된 GitHub 저장소 README에는 더 구체적인 문구가 있습니다. "전체 Qwen4 모델 계열이 이 위에 세워지기 전에 커뮤니티가 구조를 먼저 살펴볼 수 있도록 변경 사항을 일찍 공개한다"고 적었습니다.
실행 도구들의 움직임도 빠릅니다. 제목에 qwen4가 들어간 PR이 GitHub 전체에 300건 넘게 올라와 있습니다.
| 저장소 | 내용 | 시점 |
|---|---|---|
| llama.cpp | Qwen3.8-Flash-Next(qwen4exp) 지원 추가 | 8월 26일 등록, 27일 반영 |
| transformers | qwen4_exp 모델 디렉터리 추가와 테스트 정리 | 8월 하순부터 9월 초 |
| SGLang | Qwen4-Exp 임베딩 테이블 처리 | 9월 중순부터 진행 중 |
| vLLM | Qwen4-Exp 설정 파일을 상위 저장소 기준으로 통일 | 9월 중순 |
llama.cpp 작업 설명에 "가중치가 아직 공개되지 않아 초안으로 연다"는 문구가 달려 있습니다. 가중치가 나오기 전부터 실행 도구가 준비에 들어간 상태입니다.
Qwen4에서 아직 공개되지 않은 것
반대로 없는 것도 분명합니다. 직접 확인한 결과입니다.
- 허깅페이스의 Qwen 공식 계정에 Qwen4라는 이름의 모델이 없습니다. 최근 공개는 9월의 Qwen-Image-2.1 계열이고, 언어 모델은 8월 26일 Flash-Next가 마지막입니다
- transformers 저장소에
qwen4_exp는 있지만qwen4는 없습니다 - 출시일, 파라미터 수, 컨텍스트 길이, 크기 라인업, 라이선스가 모두 발표된 적 없습니다
- 벤치마크 유출이나 모델 카드 선공개도 찾지 못했습니다
9월 22일 컨퍼런스 발언은 이 가운데 학습 단계에 들어갔다는 내용 하나를 더합니다. 다만 보도로 전해진 내용이고 알리바바가 사양을 담은 공식 문서를 낸 것은 아닙니다. 5조에서 10조라는 규모는 그 다음 세대를 가리킨 값이라 Qwen4의 파라미터로 옮겨 적으면 틀립니다.
"이번 가을에 나온다"는 말이 개발자 커뮤니티에 돌지만 출처를 댄 글은 없었습니다. 공식 문구 가운데 라인업을 짐작할 단서는 README의 "전체 Qwen4 모델 계열"이라는 표현 하나뿐입니다. 계열이라고 적었으니 여러 크기가 나올 가능성은 있지만, 구체적인 크기는 어디에도 없습니다.
아스트라 증류설을 확인한 결과
"Qwen4가 GPT-6 아스트라를 증류했다"는 주장을 찾아봤는데, 그 형태의 주장을 제기한 글을 찾지 못했습니다. 해외 개발자 커뮤니티를 아스트라와 증류, Qwen4를 엮어 검색해도 나오지 않았습니다.
시점을 놓고 보면 더 분명해집니다.
| 사건 | 날짜 |
|---|---|
| Qwen4 구조를 담은 Flash-Next 가중치 공개 | 2026년 8월 26일 |
| GPT-6 아스트라 출시 | 2026년 9월 3일 |
Qwen4 구조 공개가 아스트라보다 8일 앞섭니다. 지금 공개된 qwen4_exp가 아스트라를 증류했다는 말은 시간 순서상 성립하지 않습니다. 아직 나오지 않은 Qwen4 본체라면 시점만으로 배제할 수는 없지만, 학습 데이터를 판단할 근거가 현재로서는 없습니다.
그런데 이런 오해가 생긴 사정은 있습니다. 9월 8일에 나온 정부 권고문이 알리바바를 실제로 지목했고, 그 무렵 아스트라가 막 출시돼 두 이름이 같은 시기 뉴스에 함께 실렸습니다. 지목된 대상이 무엇인지는 원문을 열어야 드러납니다.
정부 권고문이 지목한 실제 대상
미국 국가안보국과 사이버보안 인프라보안국, 연방수사국이 2026년 9월 8일에 함께 낸 권고문 AA26-251A입니다. 제목이 "미국 AI 기업을 겨냥한 중국 AI 기업의 산업 규모 증류 활동"입니다.
지목된 곳은 여섯 곳입니다. 딥시크, 문샷AI, 알리바바, 미니맥스, 스텝펀, Z.AI입니다. 알리바바 대목의 원문은 이렇습니다.
알리바바는 자사 Qwen 계열 AI 모델을 개선하려고 산업 규모의 증류를 활용했다.
구체적인 대상과 시기를 적은 문장이 따로 있습니다.
2025년 말, 알리바바는 소프트웨어 엔지니어링 능력과 고객 응대 대화 기능, 이미지와 캐릭터 생성, 그리고 강화학습과 지도 미세조정과 증류 역량의 통합을 개선하려고 Claude-4와 Claude Opus, Claude Sonnet, GPT-5를 증류했다.
여기에 아스트라는 없습니다. 권고문 전문에서 낱말 등장 횟수를 세면 이렇습니다.
| 낱말 | 등장 횟수 |
|---|---|
| Astra | 0 |
| GPT-6 | 0 |
| GPT-5 | 24 |
| GPT-5.5 | 2 |
| Claude Fable | 3 |
오픈AI 모델 가운데 권고문이 다루는 마지막 세대는 GPT-5.5입니다. 발표일이 아스트라 출시 닷새 뒤인데도 아스트라는 한 번도 나오지 않습니다. 조사 대상 기간이 그 앞 세대에서 끝났다는 뜻으로 보입니다.
권고문에는 방어책도 적혀 있는데, 한 줄이 눈에 띕니다.
증류로 의심되는 요청에는 응답을 미세하게 바꿔라. 산업 규모 증류를 벌이는 회사가 얻는 이득을 줄이기 위해서다.
의심 계정에는 성능이 낮은 모델을 대신 내주되 그 사실을 알리지 말라는 권고까지 들어 있습니다. 증류 방어가 이 단계까지 왔다는 점은 알아 둘 만합니다.
앤트로픽이 공개한 수치
권고문과 별개로 앤트로픽이 9월 10일에 낸 위협 보고서에는 알리바바 항목이 따로 있습니다. 자사가 측정한 것 가운데 규모가 가장 컸다고 밝히면서 숫자를 붙였습니다.
| 항목 | 수치 |
|---|---|
| 측정 기간 | 2026년 5월부터 7월 |
| 전체 요청 | 1억 5,100만 건 |
| 하루 최대 | 약 300만 건 |
| 동원된 계정 | 3,500개 이상 |
보고서는 이 자료가 "Qwen 3.5와 3.6, 3.7에 클로드의 능력을 증류해 넣는 데 쓰였다"고 적었습니다. 여기서도 지목된 세대는 3.5에서 3.7까지이고 Qwen4는 나오지 않습니다. 같은 보고서는 문샷을 두고도 한 대목을 적었는데, 사용자가 Kimi를 쓰는 줄 알고 보낸 요청을 조용히 클로드로 넘겨 응답을 받아 냈다는 내용입니다.
다만 이 수치는 모두 한쪽 당사자가 자체 측정해 발표한 값입니다. 알리바바의 반론이 함께 실리지 않았고, 제3자가 검증한 자료도 아직 없습니다.
증류 의혹의 근거로 제시된 프리필 실험
의혹을 숫자로 확인해 보려는 시도도 있었습니다. 9월 9일에 한 개발자가 공개한 추론 프리필 실험입니다.
방법은 이렇습니다. 교사 모델(GPT-5.5 Pro)의 추론 앞부분 1%를 대상 모델의 추론 영역에 밀어 넣고, 대상 모델이 내놓은 답변 앞 100토큰이 교사 모델의 답변과 얼마나 겹치는지 측정합니다. 대상 모델이 교사 모델의 사고 방식을 배웠다면 겹침이 크게 늘어날 것이라는 발상입니다. 문제는 45개를 썼습니다. 과학기술 15개, 비과학기술 15개, 외부에 공개되지 않은 합성 퍼즐 15개입니다.
| 모델 | 프리필 없음 | 프리필 넣음 | 차이 |
|---|---|---|---|
| DeepSeek V4 Flash | 27.30% | 26.13% | -1.17%p |
| Inkling | 19.99% | 20.45% | +0.46%p |
| Kimi K3 | 31.11% | 35.65% | +4.54%p |
| Qwen3.8 A95B | 16.79% | 34.97% | +18.18%p |
Qwen만 두드러집니다. 외부에 공개되지 않은 합성 퍼즐에서도 14.75%p가 올랐습니다. 작성자는 "Qwen이 Opus가 아니라 GPT-5.5 Pro나 그와 가까운 GPT 계열에서 배웠을 수 있다"고 적었습니다.
다만 같은 글타래에 반박이 달렸습니다. 외부에서 구할 수 있는 GPT-5.5 Pro의 추론 예시는 8월 10일에 공개된 한 논문에서 나온 것뿐인데, 실험에 쓴 Qwen3.8 판본이 그 논문 이후에 학습됐다는 지적입니다. 그렇다면 모델이 논문에 실린 그 예시 자체를 학습 자료로 이미 접했을 수 있고, 증류의 증거로 보기 어려워집니다.
여기서 대상을 다시 확인해 둡니다. 이 실험이 대상으로 삼은 것은 Qwen3.8이고 교사로 놓은 것은 GPT-5.5 Pro입니다. Qwen4도 아니고 아스트라도 아닙니다.
증류 의혹과 반대되는 자료
한쪽 자료만 놓으면 판단이 기울기 때문에 반대편 자료도 함께 적습니다.
자기 정체성 검사에서 Qwen은 다른 회사 모델이라고 답한 사례가 없습니다. 증류 의혹에서 흔히 쓰이는 근거가 모델이 자기를 다른 회사 모델이라고 답하는 현상입니다. 한 연구자가 중립적인 질문 48개로 정체성을 물은 실험에서 Qwen은 클로드라고 답한 경우가 0건이었고, Kimi K3는 48건 가운데 7건이었습니다. 다만 이 자료는 공개한 사람이 직접 "AI가 만든 연구라 신뢰할 만한 것으로 다루지 말라"는 단서를 붙여 두었습니다.
반대 방향 의혹도 있었습니다. 5월에는 클로드 Opus 4.8이 Qwen을 증류한 것 아니냐는 글이 해외 개발자 커뮤니티에 올라왔는데, 재현이 되지 않는다는 보고가 이어졌고 Opus를 판다면서 실제로는 Qwen으로 돌리던 중개 업체 때문이었다는 쪽으로 정리됐습니다. 9월 11일에는 중국의 한 로봇 스타트업이 오픈AI가 자사 개념과 웹 디자인을 베꼈다며 법적 대응에 들어갔다는 보도가 나왔습니다. 증류 의혹이 한 방향으로만 흐르지는 않습니다.
알리바바의 직접 반박은 찾지 못했습니다. 확인된 것은 중국 외교부 대변인이 "근거 없는 비난"이라고 한 발언 정도입니다.
지목은 늘었는데 소송은 없습니다
2026년 한 해의 흐름을 늘어놓으면 한 가지가 눈에 들어옵니다. 증류를 이유로 제기된 소송이나 내려진 제재를 찾지 못했습니다. 연표로 늘어놓으면 이렇습니다.
| 시점 | 일어난 일 |
|---|---|
| 2026년 2월 | 앤트로픽이 딥시크와 문샷, 미니맥스를 처음 공개 지목 |
| 4월 23일 | 미국 대통령실 과학기술정책실이 적대적 증류를 다룬 각서 발표 |
| 4월 30일 | 머스크가 법정 증언에서 xAI가 오픈AI 모델로 Grok을 학습했는지 묻는 질문에 "부분적으로"라고 답변 |
| 6월 | 앤트로픽이 알리바바를 지목, 로이터 보도 |
| 7월 | 미국 재무장관이 AI 모델 절취 관련 제재 가능성 언급 |
| 9월 8일 | 정부 기관 세 곳 합동 권고문 |
| 9월 10일 | 앤트로픽 위협 보고서 |
| 9월 22일 | 중국 규제당국이 딥시크와 문샷을 조사한다는 보도 |
기술적 방어는 실제로 늘었습니다. 계정 차단과 분류기 도입, 모델이 내부 추론을 요약해서만 내보내도록 바꾸는 작업이 이어졌습니다. 반면 법적 결론에 이른 건은 없습니다. 증류는 모델의 출력에서 배우는 방식이라 침입이나 절도로 규정하기 어렵고, 약관 위반과 법 위반 사이의 거리도 멉니다.
확인된 인정은 머스크의 "부분적으로"라는 답변 정도이고, 집행처럼 보이는 첫 사건은 오히려 중국 당국이 자국 기업을 조사한다는 9월 22일 보도입니다. 두 건 모두 보도로 전해진 내용이라 원문까지 확인하지는 못했습니다.
미국 정부 각서에서 눈여겨볼 대목이 하나 더 있습니다. 각서는 "악의적 취득에서 나온 모델을 두고 오픈이라 부를 것이 없다"고 적으면서도, 같은 문서에서 정당한 증류는 생태계에 필요하다고 밝혔습니다. 기준은 오픈웨이트 자체가 아니라 자료를 어떻게 얻었는지입니다.
증류라는 방법 자체가 무엇이고 어떤 과정을 거치는지는 AI 모델 증류 정리 글에 따로 적었습니다.
Qwen3.8 계열 모델 세 가지의 차이
Qwen4를 기다리는 동안 지금 쓸 수 있는 것은 3.8 세대입니다. 이름이 비슷해서 혼동하기 쉬운데, 셋은 쓰임새가 다릅니다.
| 항목 | Qwen3.8-27B | Qwen3.8-Flash-Next | Qwen3.8-2.4T-A95B |
|---|---|---|---|
| 공개일 | 2026년 8월 14일 | 2026년 8월 26일 | 2026년 8월 12일 |
| 총 파라미터 | 270억 | 1,250억 + N-gram 510억 + MTP 40억 | 2조 4천억 |
| 토큰당 활성 | 270억 전체 | 60억 | 950억 |
| 구조 | 조밀형 하이브리드 64층 | MoE 48층, 전문가 512개 중 라우팅 10개와 공유 1개 | MoE 92층 |
| 내부 코드명 | qwen3_5 | qwen4_exp | qwen3_5 |
| 컨텍스트 | 26만 기본, 100만까지 | 26만 기본, 100만까지 | 26만 기본, 101만까지 |
| 라이선스 | Apache 2.0 | qwen-community-1.0 | Qwen3.8-Max License |
| 멀티모달 | 이미지와 영상 입력 | 이미지와 영상 입력 | 텍스트 전용 |
| 4비트 메모리 | 16~19GB | 96~114GB | 개인 장비 범위 밖 |
| 허깅페이스 좋아요 | 16,039 | 5,583 | 1,243 |
이름만 보면 Flash가 가벼울 것 같은데 반대입니다. Flash-Next가 27B보다 훨씬 무겁습니다. 토큰마다 계산에 쓰는 파라미터는 60억 개뿐이라 연산은 가볍지만, N-gram 표까지 더한 1,800억 개가 메모리에 올라가야 합니다. 그래서 대용량 통합 메모리를 갖춘 장비에 맞습니다.
반대로 27B는 조밀형이라 파라미터 전체를 매번 계산에 쓰지만, 총량이 작아 4비트로 압축하면 16GB대에 들어갑니다. 24GB 맥에서 실제로 돌려 본 결과는 Qwen3.8 27B 로컬 실행 기록에 적었습니다. Flash-Next의 구조를 더 자세히 본 내용은 Flash-Next 정리 글에 있습니다.
실무에서 달라지는 것은 라이선스입니다. 같은 세대인데 조건이 셋 다 다릅니다.
| 모델 | 라이선스 | 상업 이용 조건 |
|---|---|---|
| 27B | Apache 2.0 | 제약 없음 |
| Flash-Next | qwen-community-1.0 | 기본 가능. 다만 API로 추론을 파는 사업이나 코딩 보조 같은 독립 제품은 별도 계약 |
| 2.4T-A95B | Qwen3.8-Max License | 기본 가능. 별도 계약 조건에 매출 하한이 붙어 더 느슨함 |
마지막 모델은 이름이 둘입니다. 가중치로 공개된 것이 Qwen3.8-2.4T-A95B이고, 같은 모델을 바탕으로 비전 입력과 100만 컨텍스트를 기본으로 켜서 파는 API판이 Qwen3.8-Max입니다. 라이선스 이름에만 Max가 들어갑니다.
커뮤니티 라이선스 두 가지에는 공통 조건도 있습니다. 월 사용자 1억 명이나 월 매출 2천만 달러를 넘는 제품에 쓰면 화면에 모델 이름을 표시해야 합니다. 오픈웨이트라는 말만 보고 셋의 조건이 같다고 넘기면 나중에 확인할 일이 생깁니다.
같은 시기의 다른 오픈웨이트 모델
Qwen4를 기다리는 동안에도 공개는 이어지고 있습니다. 8월과 9월에 나온 주요 모델을 라이선스와 함께 놓으면 흐름이 보입니다.
| 모델 | 공개일 | 규모 | 라이선스 |
|---|---|---|---|
| DeepSeek-V4-Pro-0813 | 8월 13일 | 1.65조 / 활성 490억 | MIT |
| DeepSeek-V4.1-Flash | 9월 10일 | 본체 5,520억 / 활성 80억에서 160억 | MIT |
| GLM-5.3 | 8월 25일 | 7,533억 / 활성 400억 | 자체 조건 |
| GLM-5.3-Flash | 8월 25일 | 3,213억 / 활성 180억 | MIT |
| 텐센트 Hy4-preview | 8월 27일 | 7,700억 / 활성 490억 | Apache 2.0 |
| 메타 Muse-Glimmer-30B | 8월 9일 | 296억 (비전 인코더 18억 포함) | Apache 2.0 |
| IBM Granite 4.2 | 8월 7일 | 293억, 80억, 30억 | Apache 2.0 |
| 엔비디아 Nemotron-3.5-Lightning | 8월 1일 | 316억 / 활성 30억 | OpenMDW |
두 가지를 짚어 둡니다.
메타가 Llama 이름을 내려놓았습니다. 새 모델은 meta-models 계정에서 Muse라는 이름으로 나옵니다. Glimmer 모델 카드는 자사 비공개 상위 모델인 Muse Spark에서 증류했다고 밝히고 있습니다. 자기 회사 모델에서 증류하는 것은 분쟁 대상이 아니고 오히려 흔한 방식입니다.
서구 기업의 신규 공개가 눈에 띄게 줄었습니다. 8월과 9월에 나온 서구 오픈웨이트 언어 모델은 위 표의 셋뿐이고, Phi 후속과 OLMo 후속, Gemma 5는 나오지 않았습니다. 오픈AI의 gpt-oss도 2025년 8월판 그대로입니다.
라이선스 흐름도 한 방향이 아닙니다. 딥시크는 MIT를 지키고 있고 텐센트는 7,700억 규모를 Apache 2.0으로 풀었는데, Z.AI는 GLM-5.2까지 MIT였다가 5.3 본체에서 자체 조건으로 옮겼습니다. Qwen도 세대가 올라가며 자체 조건을 붙이는 방향으로 가고 있습니다.
정작 사람들이 많이 받는 것은 작은 모델입니다. Qwen3.8-27B가 708만 회일 때 2.4조 규모인 Max는 5만 5천 회입니다. 4.9TB를 내려받아야 하는 모델은 공개돼도 대부분 돌릴 수 없습니다. 텐센트가 Apache 2.0으로 푼 7,700억 모델도 1만 8천 회에 그쳤습니다.
허깅페이스 텍스트 생성 다운로드 순위 1위는 Qwen3-0.6B로 2,537만 회이고, 상위 20개 가운데 Qwen 공식 계정 모델이 여덟 개입니다. Qwen4의 라이선스 조건이 어떻게 정해지느냐가 이 생태계 전체에 그대로 영향을 줍니다.
새 구조를 실행 도구가 받아들이는 속도
가중치가 공개된 8월 26일을 기준으로, 각 도구가 지원을 붙이기까지 걸린 기간입니다.
| 도구 | 지원 반영 | 걸린 기간 |
|---|---|---|
| transformers | 8월 26일 | 당일 |
| llama.cpp | 8월 27일 | 1일 |
| vLLM | 8월 31일 | 5일 |
| SGLang | 9월 8일 | 13일 |
기본 지원은 며칠이면 붙습니다. 다만 성능을 살리는 최적화는 따로입니다. 희소 어텐션을 CUDA에서 쓰게 하는 작업은 9월 20일에야 반영됐습니다. 돌아가는 것과 제 속도가 나오는 것은 한 달 가까이 차이가 납니다.
벤더가 직접 지원하는지에 따라 속도가 크게 달라집니다. 같은 시기에 올라온 커뮤니티발 GLM-5.3-Flash 지원 작업은 한 달이 지나도 반영되지 않았습니다. 반대로 메타가 파일을 직접 올린 Muse Glimmer는 하루 만에 들어갔습니다.
오픈웨이트와 폐쇄 모델의 격차
2026년 9월 기준 수치입니다.
| 지표 | 폐쇄 1위 | 오픈웨이트 1위 | 차이 |
|---|---|---|---|
| LMArena Elo (9월 13일) | Claude Fable 5 1505.7 | Kimi K3 Max 1484.8 (17위) | 20.9 |
| GPQA Diamond | GPT-6 Astra 96.0% | Kimi K3 93.5% | 2.5%p |
| Terminal-Bench 4.0 (리더보드 기준) | GPT-6 Astra 58.2% | GLM-5.3 41.8% | 16.4%p |
과제가 길수록 격차가 커집니다. 단답형 지식 문제는 거의 따라잡혔는데, 오래 돌아가는 에이전트 작업에서는 아직 벌어져 있습니다. LMArena는 1위부터 16위까지 전부 폐쇄 모델입니다.
한 연구 기관이 2026년 5월에 낸 집계에서는 오픈 모델이 폐쇄 모델을 평균 4개월 차이로 따라가고 있었습니다. 2025년 10월 조사의 3개월보다 늘어난 값입니다. 시간 격차는 몇 달 수준으로 유지되는데 점수 격차는 벌어졌다는 뜻으로 보입니다.
실무에서 확인할 순서
- 모델 출처가 궁금하면 config.json을 먼저 엽니다. 모델 카드는 홍보 문구가 섞이지만 설정 파일은 코드가 쓰는 값입니다. Qwen4의 흔적도 여기서 먼저 나왔습니다.
- 증류 의혹 기사를 볼 때는 대상 모델과 시기를 확인합니다. "알리바바가 증류했다"와 "Qwen4가 증류로 만들어졌다"는 서로 다른 말입니다. 권고문이 적은 시기는 2025년 말이고 대상은 Claude 4 계열과 GPT-5입니다.
- Qwen4가 나오면 라이선스부터 봅니다. 3.8 세대에서 이미 세 모델의 조건이 서로 달라졌습니다. Apache 2.0이 이어질지는 공개 전까지 알 수 없습니다.
- 지금 로컬에서 쓸 것을 고른다면 27B가 현실적입니다. 4비트로 16GB대에 들어가고 라이선스 제약이 없습니다. Flash-Next는 메모리 96GB 이상을 갖춘 장비에서만 의미가 있습니다.
자주 묻는 질문
Qwen4는 언제 나오나요?
날짜를 밝힌 공식 발표는 없습니다. 9월 22일 컨퍼런스에서 학습 단계에 들어갔다는 언급이 보도로 전해졌고, Qwen 팀이 문서에 이름을 적었으며 실행 도구들이 미리 준비하고 있다는 것까지는 확인됩니다. 다만 출시 시점은 어디에도 없고, 커뮤니티에서 도는 "이번 가을"은 출처를 댄 글이 없었습니다.
Qwen4가 아스트라를 증류했다는 말은 사실인가요?
그 주장 자체를 찾지 못했습니다. 미국 정부 합동 권고문이 알리바바를 지목한 것은 사실이지만 대상은 2025년 말의 Claude 4 계열과 GPT-5이고, 권고문 본문에 아스트라와 GPT-6은 한 번도 나오지 않습니다. Qwen4 구조를 담은 모델이 아스트라보다 8일 먼저 공개됐다는 점도 함께 봐야 합니다.
Qwen3.8-Flash-Next를 지금 로컬에서 돌릴 수 있나요?
메모리가 충분하면 됩니다. 1비트로 압축해도 75GB, 4비트는 96GB 이상이 필요합니다. 일반적인 개인 PC보다는 통합 메모리가 큰 장비 쪽에 맞습니다. 장비별 조건은 DGX 스파크와 RTX 5090 비교에 정리해 두었습니다.
27B와 Flash-Next 가운데 무엇을 고르면 되나요?
쓸 수 있는 메모리로 정해집니다. 24GB 안팎이면 27B이고, 96GB 이상을 쓸 수 있으면서 긴 문맥을 다루는 작업이면 Flash-Next입니다. 상업 제품에 넣을 계획이면 라이선스 조건이 서로 달라서 27B가 확인할 것이 적습니다.
증류가 불법인가요?
법으로 정해진 판단은 아직 없습니다. 오픈AI 이용약관에는 출력을 경쟁 모델 학습에 쓰지 말라는 조항이 있고, 다른 회사 약관에도 같은 내용이 들어 있습니다. 약관 위반은 계약 문제이고, 이것이 법 위반으로 이어진 판결이나 제재는 확인되지 않습니다.
정리
| 확인할 것 | 결과 |
|---|---|
| Qwen4 준비 여부 | 확인됨. config.json의 qwen4_exp, 공식 문서 세 곳, 실행 도구 PR 300건 이상 |
| Qwen4 학습 단계 | 9월 22일 컨퍼런스 발언이 보도로 전해짐. 5조에서 10조라는 규모는 그 다음 세대 이야기 |
| Qwen4 출시일과 사양 | 날짜와 사양을 담은 공식 문서 없음 |
| 아스트라 증류설 | 주장 자체를 찾지 못함. 구조 공개가 아스트라보다 8일 앞섬 |
| 정부 권고문의 실제 지목 | 2025년 말, Claude 4 계열과 GPT-5. 아스트라와 GPT-6 언급 0회 |
| 공개 실험의 결과 | Qwen3.8이 GPT-5.5 Pro 프리필에 18.18%p 반응. 학습 자료 오염 가능성이라는 반박 있음 |
| 법적 결론 | 소송이나 제재 사례를 찾지 못함 |
| 지금 쓸 모델 | 로컬은 27B가 현실적. 라이선스도 Apache 2.0으로 제약이 적음 |
Qwen4가 실제로 공개되면 사양과 라이선스를 확인해 이 글에 붙이겠습니다. 증류 분쟁 쪽은 소송이나 제재로 이어지는 건이 나오면 그때 다시 정리하겠습니다.
Sources
- Qwen3.8-Flash-Next 모델 카드 (Hugging Face)
- Qwen3.8-Flash-Next config.json 원문
- Qwen3.8-Flash-Next 라이선스 원문
- Qwen3.8-27B 모델 카드
- Qwen3.8-2.4T-A95B 모델 카드
- QwenLM/Qwen3.8-Flash-Next GitHub 저장소
- Qwen3.8-Flash-Next 발표글
- llama.cpp의 qwen4exp 지원 작업
- CISA 권고문 AA26-251A (2026-09-08)
- 앤트로픽 9월 위협 보고서 (2026-09-10)
- 앤트로픽의 오픈웨이트 모델 입장문
- 미국 대통령실 과학기술정책실 각서 NSTM-4 (2026-04-23)
- 머스크의 법정 증언 보도 (TechCrunch, 2026-04-30)
- 추론 프리필 실험 원문
- 같은 실험을 두고 벌어진 토론 (Hacker News)
- 모델 자기 식별 실험 자료
- Stolen Thoughts 연구
- DeepSeek-V4.1-Flash 모델 카드
- Unsloth의 Qwen3.8 실행 문서
이 글이 도움이 되셨다면 공유해 주세요
메신저로 바로 보내거나 링크를 복사할 수 있습니다.

Written by
데이터로 설명하는 마케터
2026년 9월 8일 미국 NSA와 CISA, FBI가 함께 낸 권고문이 알리바바의 증류 대상으로 지목한 모델은 무엇일까요?
이 글이 도움이 되었나요?
다음 단계
이어서 읽기 좋은 글
GPT-6 Sol과 Luna 출시: 요금 50% 인하와 쓸 수 있는 곳 정리
GPT-6 Sol과 GPT-6 Luna는 오픈AI가 2026년 9월 22일 공개한 GPT-6 계열의 보급형 모델입니다. 두 모델 모두 API 요금이 이전 세대의 절반으로 내려갔고 100만 토큰당 Sol은 입력 $2와 출력 $10, Luna는 $0.10과 $0.50입니다. 다만 일반 ChatGPT 대화창에서는 아직 고를 수 없어서, 어디에서 쓸 수 있는지까지 공식 발표 기준으로 정리했습니다.
같이 보면 좋은 글

클로드 Opus 5.5(오푸스 5.5)는 앤트로픽이 2026년 9월 22일 공개한 Claude 5.5 계열의 첫 모델입니다. 입력 100만 토큰당 $4, 출력 $20으로 Opus 5보다 20% 낮아졌고 캐시 읽기는 60% 낮아졌습니다. 발표와 함께 구독 계정에 한도 초기화권이 지급됐는데, 오픈AI가 코덱스에서 쓰는 banked reset과 같은 형태라 두 회사의 초기화권을 나란히 정리했습니다.
2026. 9. 23.
Comfy MCP는 AI 에이전트를 ComfyUI에 연결하는 공식 서버입니다. 클로드 코드나 클로드 데스크톱에서 문장으로 지시하면 에이전트가 노드 그래프를 짜고 이미지와 영상, 음악, 3D를 만듭니다. 클라우드 연결과 로컬 연결의 차이, 설정 순서, 크레딧 조건과 공개 베타 제약을 공식 문서로 정리했습니다.
2026. 9. 22.
제미나이 4는 구글이 2026년 7월 21일 사전학습 시작을 밝힌 차세대 모델입니다. 공식 발표는 문장 하나이고, 2026년 9월 22일 기준으로 출시일과 가격과 API 모델 ID는 공개되지 않았습니다. 제미나이 4 프로라는 등급 이름과 유출 벤치마크 수치가 공식 자료에서 확인되지 않는 이유를 원문과 대조해 정리했습니다.
2026. 9. 22.
Grok 4.7은 SpaceXAI가 2026년 9월 21일 공개한 모델이고 값은 입력 100만 토큰당 2달러, 출력 6달러입니다. 그런데 같은 Terminal-Bench 4.0 지표에 회사 발표는 38.0%, 독립 평가 기관 측정은 26%로 서로 다른 숫자가 나왔습니다. 두 숫자가 달라진 까닭과 값을 앞세운 구성을 공식 발표 기준으로 정리했습니다.
2026. 9. 22.ADVERTISEMENT