Qwen-Image-2.1: 나노바나나보다 강력한 오픈소스 모델의 등장
홍승협(준이아빠) / 데이터 분석, AI 실무 교육
Qwen-Image-2.1은 알리바바 Qwen 팀이 2026년 9월 20일 공개한 이미지 생성 편집 통합 모델입니다. 시각 생성부가 7B인데 알리바바 자체 벤치마크에서 나노바나나 2.0을 0.46점 앞섰고, 프롬프트만으로 투명 이미지를 만듭니다. 다만 직전 모델까지 Apache 2.0이던 라이선스가 비상업 연구용으로 바뀌어 오픈소스라고 부르기는 어렵습니다.

3줄 요약
이번 방문에서 한 편은 바로 볼 수 있습니다.
Qwen-Image-2.1은 알리바바 Qwen 팀이 2026년 9월 20일 공개한 이미지 생성 편집 통합 모델입니다. 시각 생성부는 7B로 작은 편인데, 알리바바가 함께 낸 평가표에서 구글 나노바나나 2.0보다 높은 점수를 받았습니다. 프롬프트에 투명 배경이라고 적으면 배경이 비어 있는 이미지를 그대로 내놓기도 합니다.
이미지 생성 모델을 써 본 분이라면 배경 지우기가 늘 뒤에 붙는 작업이라는 것을 아실 것입니다. 모델이 만들어 준 그림에는 하늘이든 벽이든 뒤쪽이 함께 붙어 나오고, 상세페이지나 카드뉴스에 얹으려면 누끼 작업을 한 번 더 거칩니다. 배경까지 딸려 온 그림을 새 디자인에 올릴 때마다 가위부터 듭니다. 만드는 일과 오려 내는 일이 지금까지는 늘 따로였습니다.
이번 모델은 그 두 단계를 한 단계로 줄였습니다. 다만 가중치를 내려받을 수 있다고 해서 오픈소스라고 부를 수 있는지는 따로 봐야 하는데, 같은 날 배포 조건도 함께 바뀐 것이 잘 알려지지 않았습니다. 조건을 모르고 회사 작업에 넣으면 라이선스를 어긴 채로 결과물을 내보내게 됩니다. 공식 블로그와 허깅페이스 모델 카드, LICENSE 원문, 깃허브 저장소를 근거로 삼아 2026년 9월 21일 시점에서 정리하겠습니다.
Qwen-Image-2.1 공식 사양
| 항목 | 내용 |
|---|---|
| 공개일 | 2026년 9월 20일. 허깅페이스와 모델스코프에 같은 날 올라왔습니다 |
| 시각 생성부 | 7B, Single-Stream DiT 32층 |
| 텍스트 인코더 | Qwen3-VL 8B |
| VAE | 64채널 RGBA, 16배 공간 압축 |
| 해상도 | 2K. 비율 일곱 가지를 지원하고, 1:1은 2048×2048, 16:9는 2752×1536입니다 |
| 참조 이미지 | 최대 10장 |
| 국소 편집 | 원, 색칠 주석, 별도 마스크 |
| 내려받기 용량 | 33.13GB. BF16 기준이고 텍스트 인코더가 17.53GB로 가장 큽니다 |
| 라이선스 | Qwen Research License. 비상업 용도만 허용합니다 |
| 첫날 지원 | Diffusers, ComfyUI, vLLM-Omni, SGLang, LightX2V |
표에서 먼저 볼 것은 VAE 항목입니다. VAE(Variational Autoencoder), 즉 변분 오토인코더는 이미지를 모델이 다루기 쉬운 압축된 형태로 바꿨다가 다시 그림으로 되돌리는 부분입니다. 여기에 RGBA라고 적힌 것이 이번에 달라졌습니다. 빨강과 초록과 파랑 세 가지 색 정보에 더해, 각 점이 얼마나 비어 있는지 적어 두는 알파 채널까지 이 VAE가 함께 압축하고 복원한다는 뜻입니다.
그다음은 텍스트 인코더입니다. 프롬프트를 읽는 부분이 Qwen3-VL 8B로, 시각 생성부인 7B보다 큽니다. 내려받기 용량 33.13GB 가운데 절반이 넘는 17.53GB가 여기에 들어갑니다. 파라미터 숫자만 보고 7B짜리 가벼운 모델이라고 짐작하면 실제 준비해야 할 용량과 차이가 큽니다.
첫날 지원 목록도 함께 봐야 합니다. ComfyUI와 Diffusers가 공개 당일부터 지원하므로 작업 환경을 새로 짜지 않아도 됩니다. 다만 Diffusers는 깃허브 최신판이 필요하고 transformers는 5.17 이상을 요구합니다.
프롬프트로 배경을 비우는 투명 이미지 생성
알파 채널이라는 개념은 해상도나 파일 형식보다 낯설 수 있습니다. 쉽게 말하면 그림의 점마다 색과 별개로 이 부분은 비어 있다고 적어 두는 정보 한 겹입니다. 이 정보가 있으면 그 부분으로 뒤에 깔린 것이 그대로 비칩니다.
Qwen 팀은 2025년 12월 Qwen-Image-Layered라는 투명 이미지 전용 모델을 따로 냈습니다. 이번에는 그 능력을 본체에 합쳤고, 프롬프트 내용에 따라 일반 이미지를 낼지 투명 이미지를 낼지 모델이 정합니다. 배경을 지우는 도구를 따로 부르지 않고, 미리 오려 둔 스티커를 건네받듯 뒤쪽이 비어 있는 상태로 결과를 받습니다.
위 이미지는 공식 블로그가 올린 예시로, 평범한 사진을 넣고 나무만 뽑아내라고 지시해 나온 결과입니다. 잎 사이로 하늘이 보이던 부분까지 비워져 있습니다. 배경 제거 도구는 머리카락과 나뭇잎처럼 가장자리가 잘게 나뉜 대상에서 자주 실패합니다. 공식 예시는 그런 대상을 골라 보여줍니다.
투명 층은 만들고 끝나는 것이 아니라 나중에 고칠 수도 있습니다. 공식 블로그는 배경이 비어 있는 상태를 유지하면서 인물 표정만 바꾼 예시와, 투명 이미지 안의 글자를 다른 글자로 교체한 예시를 함께 실었습니다. 다만 이 결과들은 알리바바가 성능을 보여주려고 고른 예시이므로, 실제 작업 사진에서 같은 품질이 나오는지는 직접 넣어 봐야 알 수 있습니다.
참조 이미지 10장을 한 장면으로 합치는 편집
편집 기능에서 달라진 것은 넣을 수 있는 참조 이미지 개수입니다. 최대 10장을 받아 여러 대상을 한 장면에 담습니다. 공식 블로그에 실린 예시는 세 가지입니다.
- 단체 사진: 따로 찍은 인물 사진 여섯 장으로 만들었습니다.
- 착장 한 벌: 모델, 옷, 신발, 가방, 모자 사진 다섯 장으로 완성했습니다.
- 거실 하나: 빈 방 사진 한 장과 가구 사진 아홉 장으로 채웠습니다.
국소 편집은 지정 방식이 세 가지입니다. 고칠 곳을 원으로 그리거나 붓으로 칠해 표시할 수 있고, 원본을 가리고 싶지 않으면 원본과 마스크를 따로 넣어도 됩니다. 원과 붓칠은 그 부분의 원래 내용을 덮어 버리는데, 마스크를 분리하면 원본을 그대로 둔 채 고칠 곳만 지정할 수 있습니다.
색이 다른 원을 여러 개 그려 한 번에 여러 곳을 지시하는 방식도 지원합니다. 파란 원 안의 시계는 지우고 빨간 원 안의 머리는 검게 바꾸라는 식으로 한 프롬프트에 여러 지시를 담습니다. 상세페이지 하나에서 고칠 곳이 서너 군데씩 나오는 광고 소재 작업이라면, 이렇게 한 번에 지시하면 모델에 다시 넣는 횟수가 줄어듭니다.
7B로 60.28점을 낸 벤치마크 결과
알리바바는 Qwen-Image-Bench로 자사 모델과 다른 모델의 총점을 비교했습니다. 이 평가표는 Qwen 팀이 이름을 붙여 공개한 것으로, 허깅페이스에 Qwen 조직 저장소로 올라와 있습니다. Qwen-Image-2.1은 60.28점입니다.
그래프에 나온 29개 모델 가운데 일부를 추리면 이렇습니다.
| 모델 | 총점 | 파라미터 |
|---|---|---|
| GPT Image 2.5 Sunburst | 67.01 | 비공개 |
| GPT Image 2 | 64.69 | 비공개 |
| Grok Imagine 2.0 | 63.47 | 비공개 |
| Qwen Image 3 Pro | 62.36 | 비공개 |
| Muse Image | 62.34 | 비공개 |
| MAI Image 2.5 Pro | 61.02 | 비공개 |
| Qwen-Image-2.1 | 60.28 | 7B |
| Nano Banana 2.0 | 59.82 | 비공개 |
| Seedream 5 Pro | 59.53 | 비공개 |
| Qwen-Image-2512 | 52.06 | 20B |
| Hunyuan Image 3.0 | 50.81 | 80B |
읽을 때 두 가지를 같이 봐야 합니다. 먼저 볼 것은 위에 오른 모델 여섯 개가 전부 가중치를 내려받을 수 없는 제품이라는 점입니다. 차트는 그런 모델에 자물쇠를 붙이고 파라미터 수를 비워 두었습니다. 가중치가 열린 Qwen-Image-2.1은 그 바로 아래 60.28점에 있고, 바로 밑이 구글 나노바나나 2.0의 59.82점입니다. 두 모델의 차이는 0.46점이라 크지 않지만, 7B를 내려받아 자기 장비에서 돌릴 수 있다는 점이 다릅니다. 파라미터가 큰 쪽이 점수도 높은 것은 아닙니다. 80B인 Hunyuan Image 3.0이 50.81점이고, 직전 자사 모델인 Qwen-Image-2512와 비교하면 파라미터는 20B에서 7B로 줄었는데 점수는 52.06에서 60.28로 올랐습니다.
다음은 이 평가를 만든 곳이 알리바바라는 점입니다. 평가 항목과 채점 기준을 낸 쪽이 자기 모델까지 같은 표에 올렸으니, 순위를 그대로 성능 서열로 받아들이기는 어렵습니다. 비교 대상에 자사 비공개 제품인 Qwen Image 3 Pro가 더 높은 점수로 함께 올라 있다는 것도 표를 읽을 때 같이 봐야 합니다.
추론 시간을 줄인 어텐션 구조
알리바바는 속도 개선도 함께 발표했습니다. 혼합 입도 어텐션(mixed-granularity attention)이라는 구조를 써서 텍스트는 토큰 단위로, 이미지는 묶음 단위로 나눠 계산합니다. 여기에 입력 이미지와 편집 지시를 첫 단계에서 한 번만 계산해 두고 이후 단계에서 다시 꺼내 쓰는 방식을 더했습니다. 단골손님 주문을 매번 처음부터 받지 않고 적어 둔 쪽지를 펴 보듯, 모델도 여러 장을 넣는 편집일수록 앞서 계산해 둔 값을 더 많이 다시 씁니다.
Apache 2.0에서 연구용 라이선스로 바뀐 배포 조건
기능보다 먼저 확인해야 할 것이 배포 조건입니다. 이번 모델은 Qwen Research License Agreement로 나왔고, LICENSE 파일에 발효일이 2026년 9월 20일로 적혀 있습니다.
핵심 조항은 2조입니다. 이 조항은 사용, 복제, 배포, 수정 권한을 주되 그 권한이 비상업 목적에만 미친다고 대문자로 밝혀 놓았습니다. 같은 문서 1조는 비상업 목적을 연구와 평가로만 한정합니다. 상업적으로 쓰려면 별도 라이선스를 요청하라는 문장과 주소가 이어집니다. 계약 당사자는 알리바바 산하의 Hangzhou Tongyi Laboratory Technology이고 요청 주소는 model-business@notice.qwencloud.com입니다.
Qwen-Image 계열이 지금까지 어떤 조건으로 나왔는지 허깅페이스 저장소에서 확인한 결과입니다.
| 모델 | 공개일 | 라이선스 |
|---|---|---|
| Qwen-Image | 2025년 8월 2일 | Apache 2.0 |
| Qwen-Image-Edit | 2025년 8월 17일 | Apache 2.0 |
| Qwen-Image-Edit-2509 | 2025년 9월 22일 | Apache 2.0 |
| Qwen-Image-Edit-2511 | 2025년 12월 17일 | Apache 2.0 |
| Qwen-Image-Layered | 2025년 12월 17일 | Apache 2.0 |
| Qwen-Image-2512 | 2025년 12월 30일 | Apache 2.0 |
| Qwen-Image-2.1 | 2026년 9월 20일 | Qwen Research License |
모델 여섯 개가 Apache 2.0으로 나오는 동안 상업 이용 제한이 없었습니다. 이번 모델에서 처음으로 조건이 달라졌고, 함께 공개된 프롬프트 재작성 모델 두 가지도 같은 연구 라이선스를 씁니다.
여기서 앞에 미뤄 둔 물음으로 돌아옵니다. 가중치를 내려받을 수 있다는 것과 오픈소스라는 것은 다릅니다. 이 차이를 K2 호라이즌 정리에서 오픈 웨이트와 완전 오픈소스로 나누어 한 번 다뤘습니다. Qwen-Image-2.1은 그 기준으로 봐도 조건이 한 단계 더 까다롭습니다. 가중치만 열린 데다 그 가중치를 쓸 수 있는 목적까지 제한됐기 때문입니다.
재배포 조건도 함께 적혀 있습니다. 모델이나 파생물을 남에게 넘길 때는 라이선스 사본을 함께 주고, 고친 파일에 변경 사실을 표시하고, Notice 파일에 지정된 저작권 문구를 넣어야 합니다. 이 조건은 미세조정한 모델을 팀 안에서 돌려쓸 때도 그대로 적용됩니다.
Qwen-Image-2.1을 업무에 넣기 전 확인할 순서
업무에 넣을지 판단할 때는 기능보다 조건을 먼저 봅니다. 순서는 네 단계입니다.
- 쓸 목적을 먼저 정합니다. 개인 학습이나 사내 검토용 실험이면 그대로 내려받아 써도 됩니다. 결과물이 고객사 산출물이나 판매 상품에 들어가면 상업 이용이므로 별도 계약이 필요합니다.
- 용량과 장비를 확인합니다. 내려받기만 33.13GB이고, 모델은 BF16으로 돌아갑니다. 모델 카드는 GPU 메모리가 모자랄 때 쓸 수 있는 CPU 오프로딩 설정을 함께 안내하지만, 필요한 메모리 수치를 따로 밝히지는 않았습니다.
- 쓰던 도구에 모델을 올려 한 번 돌려 봅니다. ComfyUI와 Diffusers가 공개 당일부터 지원하므로 워크플로를 새로 짜지 않아도 됩니다. Diffusers는 깃허브 최신판이 필요하고 transformers는 5.17 이상을 요구합니다.
- 투명 출력을 직접 시험합니다. 공식 예시는 잘 나온 결과를 고른 것이므로, 실제로 쓰는 제품 사진이나 인물 사진을 넣어 가장자리 처리를 봅니다. 기존 배경 제거 도구 결과와 나란히 놓고 비교하면 판단이 빨라집니다.
상업 이용 계약이 어려운 상황이라면 직전 모델을 계속 쓰는 방법이 남습니다. Qwen-Image-2512와 Qwen-Image-Edit-2511은 Apache 2.0으로 남아 있고 저장소도 그대로입니다. 투명 배경이 꼭 필요하면 같은 조건으로 풀린 Qwen-Image-Layered가 있습니다.
자주 묻는 질문
상업적으로 쓰려면 어떻게 해야 하나요?
알리바바와 별도 상업 라이선스를 맺어야 합니다. LICENSE 파일은 상업적 사용을 원하면 정해진 주소로 라이선스를 요청하라고 안내합니다. 가격이나 계약 조건은 공개되지 않아서, 실제로 어느 정도 비용이 드는지는 문의해야 알 수 있습니다.
판단이 애매한 것은 사내 업무용입니다. 회사 안에서만 쓰더라도 그 결과물이 매출로 이어지는 활동에 들어가면 연구나 평가 목적으로 보기 어렵습니다. 조건을 정확히 나누는 기준은 라이선스 원문과 법률 검토로 정할 부분이라, 지금은 원문에 적힌 문장까지만 전달하겠습니다.
예전 Qwen 이미지 모델을 계속 써도 되나요?
됩니다. 이미 Apache 2.0으로 공개된 모델의 라이선스가 나중에 바뀌지는 않습니다. Apache 2.0 조문에 저작권 라이선스는 한 번 주면 철회할 수 없다고 적혀 있어서, 2025년에 받은 Qwen-Image나 Qwen-Image-2512를 지금 상업적으로 쓰는 것에는 문제가 없습니다.
다만 앞으로 나올 모델도 같은 조건일 것이라고 기대하기는 어려워졌습니다. 이번에 계열 전체의 방침이 달라진 것인지 이 모델만 예외인지는 아직 알 수 없으므로, 새 모델을 붙일 때마다 LICENSE 파일을 먼저 확인하는 편이 안전하다고 생각합니다.
다른 이미지 모델과 비교해 무엇을 고르면 되나요?
배경이 비어 있는 이미지를 많이 만든다면 Qwen-Image-2.1로 줄어드는 작업량이 많습니다. 투명 출력을 한 번에 받는 모델이 아직 흔하지 않고, 자기 장비에서 돌릴 수 있다는 점도 API 제품과 다릅니다.
반대로 결과물을 바로 판매나 광고에 쓴다면 이 모델은 라이선스 때문에 후보에서 빠집니다. 그럴 때는 API로 제공되는 제품 쪽이 계약 관계가 명확합니다. 제품별 차이는 ChatGPT Images 2.5 정리와 나노바나나 사용법에서 각각 다뤘습니다.
3줄 요약
- Qwen-Image-2.1은 알리바바 Qwen 팀이 2026년 9월 20일 공개한 이미지 생성 편집 통합 모델이고 시각 생성부가 7B입니다.
- 프롬프트에 투명 배경이라고 적으면 알파 채널이 붙은 이미지가 바로 나오고 참조 이미지를 10장까지 받아 한 장면으로 합칩니다.
- 직전 모델까지 Apache 2.0이던 라이선스가 비상업 연구용으로 바뀌어 업무에 쓰려면 알리바바와 별도 계약을 맺어야 합니다.
Sources
이 글이 도움이 되셨다면 공유해 주세요
메신저로 바로 보내거나 링크를 복사할 수 있습니다.

Written by
데이터로 설명하는 마케터
Qwen-Image-2.1을 내려받아 회사 상세페이지 이미지를 만들어 판매하려면 무엇이 필요할까요?
이 글이 도움이 되었나요?
다음 단계
이어서 읽기 좋은 글
K2 호라이즌 정리: 오픈 웨이트와 완전 오픈소스의 차이
K2 호라이즌은 아부다비의 IFM이 2026년 9월 3일 공개한 여섯 개짜리 오픈 모델 묶음입니다. 최종 가중치만 여는 오픈 웨이트와 달리 학습 데이터와 코드, 중간 체크포인트, 학습 로그까지 함께 열었고, 그 차이가 무엇을 가능하게 하는지 공식 자료로 정리했습니다.
같이 보면 좋은 글

ChatGPT Images 2.5는 오픈AI가 2026년 9월 8일 공개한 이미지 생성 모델입니다. 지정한 부분만 고치고 나머지를 유지하는 편집 정확도와 최대 50% 줄어든 생성 지연, API에 함께 나온 Flare와 Sunburst의 차이를 공식 발표문으로 정리했습니다.
2026. 9. 10.
나노바나나는 구글 제미나이의 이미지 생성 모델에 붙은 별명입니다. 지금 함께 서비스되는 네 가지 모델의 정식 이름과 해상도, 참조 이미지 장수, 한 장당 가격, 그리고 무료 요금제에서 어디까지 쓸 수 있는지를 구글 공식 문서로 확인해 정리했습니다.
2026. 9. 5.
Jev(제브)는 타입세이프 AI가 2026년 9월 15일 공개한 모델입니다. 글자를 만들지 않고 미리 정해 둔 선택지 가운데 하나를 고른 뒤 그 확률을 함께 돌려줍니다. 무엇이 실제로 새로운지, 회사 자체 평가에서 정확도가 어디쯤인지, 환각하지 않는다는 말이 어디까지 보장하는지를 발표 자료와 외부 실측으로 정리했습니다.
2026. 9. 19.
Astra for Law는 OpenAI가 2026년 9월 17일 공개한 법률 실무용 제품이고, 새 모델이 아니라 GPT-6 아스트라에 법률 검색 인덱스와 작성 지침, 플러그인을 붙인 구성입니다. 무엇이 들어 있는지, 벤치마크 수치를 어떻게 읽어야 하는지, 지금 누가 쓸 수 있고 미국 법 중심이라는 한계가 무엇인지 공식 발표문 기준으로 정리했습니다.
2026. 9. 18.ADVERTISEMENT