알리바바 Qwen 팀의 새 이미지 생성 모델 Qwen-Image-2.1을 RTX 5090 32GB에서 Unsloth Studio로 돌려 봤습니다. 앱이 고른 기본 설정(Auto) 그대로 1024×1024 이미지 한 장에 평균 7.6초가 걸렸고, VRAM은 최대 21.0GB를 썼습니다.
- 맨 처음 한 장만 69초가 걸렸습니다. 준비 작업(컴파일)을 한 번 하기 때문이고, 그 뒤로는 모델을 다시 올려도 첫 장이 7.7초였습니다.
- 짧은 글자는 영어·한글 모두 정확했습니다. 다만 받침과 쌍자음이 많은 한글 메뉴판에서는 "떡볶이"를 "썩복이"로 썼습니다.
- 상업적으로는 쓸 수 없는 모델입니다. 라이선스가 "연구 또는 평가 목적"만 허락합니다. 이전 버전 Qwen-Image는 Apache 2.0이라 상업 이용이 됐는데, 2.1에서 바뀌었습니다.
이 글은 그래서 평가 목적의 테스트로만 썼습니다. 글 속 이미지는 모두 이 테스트에서 만든 예시이고, 이 블로그의 다른 글에는 쓰지 않습니다. 테스트가 끝난 뒤 받은 모델 파일은 지웠습니다.

RTX 5090에서 Unsloth Studio 기본 설정으로 잰 핵심 숫자입니다.
어떻게 테스트했나
| 항목 | 내용 |
|---|---|
| 그래픽카드 | RTX 5090 32GB (드라이버 616.92) |
| 프로그램 | Unsloth Studio 데스크톱(베타), unsloth 2026.9.14, diffusers 0.41.0.dev0, PyTorch 2.11.0 |
| 설정 | 앱이 고른 기본값(Auto) 그대로. 40단계(steps), guidance 1 |
| 질문 | 한국어·영어 장면, 영어·한글 글자, 개수·위치 지시, 수채화, 손, 흐름도, 막대그래프, 인물·캐릭터 등 14가지 |
| 측정 | 같은 시드(20261004)로 고정. 생성 시간은 요청부터 이미지가 돌아올 때까지. VRAM·GPU 사용률·전력은 0.5초마다 기록 |
| 날짜 | 2026년 10월 4일 |
이 블로그는 10월부터 로컬 AI 테스트를 Unsloth Studio로 하고 있고, 먼저 앱 기본값으로 재는 것을 기준으로 합니다. 기본값이 너무 느리면 빨라지는 설정을 따로 찾는데, 이번에는 생성 중 GPU 사용률이 91~99%로 높아서 따로 손대지 않았습니다.
Qwen-Image-2.1은 어떤 모델인가
| 항목 | 내용 |
|---|---|
| 만든 곳 | 알리바바 Qwen 팀 |
| 공개 | 2026년 9월 20일(공식 GitHub 기준) |
| 크기 | 이미지를 그리는 부분 7B(32레이어), 글을 이해하는 부분 Qwen3-VL 8B |
| 특징(제작사 설명) | 투명 배경(RGBA) 이미지, 참고 이미지 최대 10장으로 편집, 글자 표현·인물 조명 개선 |
| 최대 해상도 | 긴 변 2,752픽셀(Unsloth Studio의 2K 설정은 2400×1792까지) |
| 라이선스 | Qwen Research License(연구·평가용, 상업 이용은 따로 허락 필요) |
이 표가 뜻하는 것은, 그림 그리는 부분보다 글을 이해하는 부분이 더 크다는 점입니다. 원본 기준으로 그림 부분은 14.2GB, 글 이해 부분은 17.5GB입니다. 그래서 메모리를 아끼려면 글 이해 부분을 줄이는 것이 효과가 큽니다(아래에서 다시 설명합니다).
상업적으로 쓸 수 있나
쓸 수 없습니다. 라이선스 원문은 허락 범위를 이렇게 정합니다.
"Non-Commercial" shall mean for research or evaluation purposes only.
Qwen-Image-2.1 라이선스(LICENSE 파일)
쉽게 말하면 연구하거나 성능을 평가하는 데만 쓸 수 있고, 돈을 버는 데 쓰려면 Qwen 팀에 따로 상업 라이선스를 신청해야 합니다. 예를 들어 이 모델로 쇼핑몰 상품 사진이나 광고 배너를 만드는 것은 허락 범위 밖입니다. 이 글처럼 직접 돌려 보고 결과를 평가하는 것은 허락 범위 안입니다.
| 모델 | 공개 | 라이선스 |
|---|---|---|
| Qwen-Image | 2025년 8월 | Apache 2.0(상업 이용 가능) |
| Qwen-Image-2512 | 2025년 12월 | Apache 2.0(상업 이용 가능) |
| Qwen-Image-2.1 | 2026년 9월 | Qwen Research License(연구·평가용) |
이 표가 뜻하는 것은, 이름이 비슷해도 2.1부터 조건이 바뀌었다는 점입니다. 예전 Qwen-Image를 업무에 쓰던 곳이라면 2.1로 바꾸기 전에 라이선스를 먼저 확인해야 합니다. 이 글은 라이선스 문구를 읽고 정리한 것이고, 법률 조언은 아닙니다.
Unsloth Studio에서 받는 방법과 크기
Unsloth Studio의 이미지 화면에서 모델 목록을 열면 Qwen-Image-2.1이 두 가지로 나옵니다. Fast FP8(빠름)과 GGUF(느림, 메모리를 적게 씀)입니다. 이 테스트는 추천 목록 맨 위에 있는 Fast FP8로 했습니다.

Fast FP8에 마우스를 올리면 "가중치에 약 27GB 필요, 예산 22.3GB(GPU 31.84GB의 70%)"라는 경고가 나옵니다.
경고만 보면 32GB 그래픽카드에도 안 들어갈 것 같지만, 실제로는 VRAM을 21.0GB까지만 썼습니다. 앱이 경고에 쓴 27GB는 글 이해 부분을 원본 크기(17.5GB)로 계산한 값입니다(앱의 정보 API 기준 INT8 예상 26.7GB). 실제로 올릴 때는 글 이해 부분을 FP8로 줄인 파일(9.4GB)을 받았습니다.
| 실제로 받은 파일 | 크기 | 받은 곳 |
|---|---|---|
| 그림 그리는 부분(INT8) | 7.3GB | unsloth/Qwen-Image-2.1-FP8 |
| 글 이해 부분(FP8) | 9.4GB | unsloth/Qwen-Image-2.1-FP8 |
| VAE·토크나이저 등 | 1.3GB | unsloth/Qwen-Image-2.1 |
| 합계 | 17.2GB |
이 표가 뜻하는 것은, 원본(33.1GB)의 절반 정도만 받았다는 점입니다. 눈여겨볼 점은 이름이 "Fast FP8"인데 그림 부분은 INT8 판을 받았다는 것입니다. 같은 저장소에 FP8 판과 INT8 판이 함께 있고, Auto가 이 PC에서 INT8을 골랐습니다.

Advanced 설정을 펼치면 Auto가 고른 값이 보입니다. 그림 부분 INT8, 글 이해 부분 FP8, 메모리는 일부를 램으로 옮기는 group offload입니다.
"CPU offload: ON"은 모델의 일부를 그래픽카드 메모리 대신 시스템 램에 두었다가 필요할 때 옮기는 방식입니다. 32GB 그래픽카드인데도 Auto가 이 방식을 골랐습니다. 그래도 생성 중 GPU 사용률이 91~99%로 높아서 속도 손해는 크지 않은 것으로 보입니다.

모델이 올라간 화면입니다. 이 모델을 고르면 단계 수가 40, guidance가 1로 자동으로 바뀝니다.
얼마나 빠른가
같은 질문을 같은 시드로 세 번 연달아 만들었습니다.
| 순서 | 1024×1024 생성 시간 | GPU 사용률 평균 | 전력 평균 |
|---|---|---|---|
| 맨 처음(모델을 처음 받고 올린 직후) | 69.1초 | 13.7% | 100W |
| 두 번째 | 7.5초 | 92.2% | 490W |
| 세 번째 | 7.5초 | 99.3% | 535W |
| 모델을 내렸다가 다시 올린 뒤 첫 장 | 7.7초 | 91.5% | 458W |
이 표가 뜻하는 것은, 69초는 맨 처음 한 번만 드는 준비 시간이라는 점입니다. 이때 GPU 사용률이 13.7%로 낮았는데, 계산보다 준비 작업(앱 설정에 "compiled"로 표시되는 최적화)을 하느라 그렇습니다. 준비 결과는 저장돼서, 모델을 내렸다 다시 올려도 첫 장이 7.7초였습니다. 받아 둔 파일로 모델을 다시 올리는 데는 9.2초가 걸렸습니다.

모델을 다시 올릴 때 나오는 표시입니다. 이미 받은 파일이라 9.2초 만에 끝났습니다.
질문 8가지를 1024×1024로 만든 시간은 7.5~7.6초로 거의 같았습니다. 질문이 한국어든 영어든, 사진이든 그림이든 시간 차이가 없었습니다.
해상도를 올리면

같은 질문·같은 시드로 해상도만 바꿨습니다.
| 해상도 | 생성 시간 | VRAM 최대 | GPU 온도 최대 |
|---|---|---|---|
| 768×768 | 3.9초 | 20.9GB | 70℃ |
| 1024×1024 | 7.5초 | 20.9GB | 71℃ |
| 1536×1536 | 21.7초 | 20.9GB | 72℃ |
| 2048×1536 | 32.8초 | 20.9GB | 73℃ |
| 2400×1792(앱의 2K 최대) | 52.1초 | 22.2GB | 73℃ |
이 표가 뜻하는 것은, 해상도를 올리면 시간이 픽셀 수보다 더 빨리 는다는 점입니다. 768×768에서 1536×1536으로 픽셀이 4배가 되자 시간은 5.6배가 됐습니다. 반대로 VRAM은 거의 그대로였고, 2400×1792에서도 22.2GB였습니다. 그래서 큰 이미지가 필요하면 메모리보다 기다리는 시간을 먼저 생각하면 됩니다.
VRAM과 전력
모델만 올려 둔 상태에서 VRAM은 18.2GB였고, 생성 중에는 20.4~21.0GB였습니다. 이 블로그의 판정 기준으로는 제한적입니다. VRAM에는 여유가 10GB 넘게 남았지만, 모델 일부를 시스템 램에 두는 방식(group offload)으로 돌았기 때문입니다. 생성 중 전력은 평균 약 460~560W, 순간 최대 574W였습니다.
16GB 그래픽카드에서는 이번 설정을 그대로 쓰기 어렵고, 목록의 GGUF(느림) 판이 그 경우를 위한 것으로 보입니다. 이 글에서는 GGUF 판을 재지 않았습니다.
결과물은 어떤가
여기서부터는 이미지를 눈으로 보고 평가한 것입니다. 질문마다 한 장씩, 같은 시드로 만든 첫 결과를 그대로 실었습니다(골라내지 않았습니다).
한국어로 물어도 같은 그림이 나온다

왼쪽은 한국어, 오른쪽은 같은 뜻의 영어 질문입니다. 같은 시드에서 구도가 거의 같게 나왔습니다.
"비 오는 밤 서울의 좁은 골목, 작은 우동 가게의 노란 불빛"을 한국어와 영어로 각각 물었습니다. 두 그림의 구도와 불빛 위치가 거의 같았습니다. 한국어 질문도 영어만큼 알아듣는다는 뜻입니다. 다만 두 그림 모두 "우동 가게"라는 것을 알아볼 간판이나 그릇은 그리지 않았습니다.
글자

영어 포스터. 제목과 부제를 틀린 글자 없이 썼습니다.

한글 간판. 큰 글씨와 작은 글씨 모두 정확했습니다. 다만 "카페 입구"라는 장소 대신 나무에 걸린 간판으로 그렸습니다.

한글 메뉴판 3줄. 가격과 "김밥"은 맞았지만 "떡볶이"는 "썩복이", "라면"은 "라먼"으로 틀렸습니다.
짧은 영어와 한글은 정확했습니다. 한글에서 틀린 곳은 "떡볶이"처럼 쌍자음(ㄸ)과 겹받침(ㄲ)이 들어간 글자였습니다. 숫자와 "원"은 모두 맞았습니다. 한글 글자가 꼭 맞아야 하는 이미지라면, 몇 장 만들어 보고 고르거나 글자는 나중에 따로 넣는 편이 안전합니다.

글자·개수·위치를 지시한 질문 7개의 결과입니다.
개수와 위치 지시

"사과 3개, 배 2개"를 정확히 맞췄습니다.

"자전거 왼쪽에 고양이, 오른쪽에 노란 우산"도 지시대로 놓였습니다.
도표

상자 3개와 화살표, 글자가 모두 지시대로 나왔습니다.

막대그래프. 모양과 아래 라벨은 맞았지만, 첫 막대 위 숫자가 "1A3"으로 틀렸고 세로축 숫자(800)도 의미가 없습니다.
단순한 흐름도는 그대로 써도 될 만큼 깔끔했습니다. 숫자가 들어가는 그래프는 모양만 비슷하고 값이 맞지 않으니, 실제 자료로 쓰면 안 됩니다.
사진풍과 그림풍

손가락 수와 모양이 자연스러웠습니다. 키캡에는 글자가 없습니다.

한국어로 "수채화, 한강 공원, 벚꽃"을 물은 결과입니다.

앱의 2K 최대 해상도(2400×1792)로 만든 결과입니다. 52.1초가 걸렸습니다.
인물과 캐릭터
실존 인물이 아닌 가상의 인물로 세 가지를 만들었습니다. 사진풍 인물, 애니메이션풍 캐릭터, 3D 애니메이션풍 캐릭터입니다. 세 장 모두 한국어로 물었고, 1024×1024 한 장에 7.6초 안팎이 걸렸습니다.

사진풍 인물. 확대해 봐도 손가락 수와 모양, 얼굴이 자연스러웠습니다.

애니메이션풍 캐릭터. "은색 단발머리, 큰 헤드폰, 밤의 네온 도시"가 모두 들어갔습니다. "옥상에 서 있다"는 상반신 구도라 잘 드러나지 않습니다.

3D 애니메이션풍 캐릭터. 로봇이 그래픽카드를 두 손으로 들고 있는 모습이 지시대로 나왔습니다.
인물 사진에서 자주 생기는 손가락 문제는 이번 세 장과 앞의 키보드 사진에서 보이지 않았습니다. 다만 질문마다 한 장씩만 본 결과라, 여러 장을 만들면 어색한 장이 섞일 수 있습니다.
앱 화면에서 직접 만들어 보기

앱 화면에서 한글 질문을 넣고 Generate를 누른 모습입니다. 같은 질문이어도 시드가 다르면 다른 그림이 나옵니다.
쓰는 방법은 간단합니다. 이미지 메뉴에서 모델을 고르고, 프롬프트(만들 그림 설명)를 쓰고, Generate를 누르면 됩니다. 만든 이미지는 오른쪽 아래 목록에 쌓이고, Recipe 버튼으로 어떤 설정으로 만들었는지 다시 볼 수 있습니다. 이 글의 반복 측정은 같은 기능을 Unsloth Studio의 API로 불러서 했습니다.
정리
- RTX 5090 + Unsloth Studio 기본 설정에서 1024×1024 한 장 7.6초였습니다. 맨 처음 한 번만 69초가 걸렸습니다.
- 받은 파일은 17.2GB(원본의 절반 정도), VRAM은 최대 21.0GB(2K 최대 해상도에서 22.2GB)였습니다.
- 앱의 "약 27GB 필요" 경고와 달리 32GB 그래픽카드에서 문제없이 돌았습니다.
- 짧은 영어·한글 글자, 개수·위치 지시, 인물 사진의 손과 얼굴은 자연스러웠습니다. 받침이 복잡한 한글과 그래프 숫자는 틀렸습니다.
- 연구·평가용 라이선스라 결과물을 상업적으로 쓸 수 없습니다. 이전 버전(Apache 2.0)과 다릅니다.
이 글의 한계
- RTX 5090 한 대, Unsloth Studio 기본 설정(Auto) 하나로만 쟀습니다. GGUF 판과 다른 프로그램(ComfyUI 등)은 비교하지 않았습니다.
- 이미지 편집(참고 이미지)과 투명 배경 기능은 시험하지 않았습니다.
- 품질은 눈으로 본 평가이고, 질문마다 한 장씩만 봤습니다. 시드가 바뀌면 결과도 달라집니다.
- 측정 날짜는 2026년 10월 4일입니다. Unsloth Studio는 베타라 버전에 따라 받는 파일과 속도가 바뀔 수 있습니다.
자주 묻는 질문
Qwen-Image-2.1로 만든 이미지를 블로그나 쇼핑몰에 써도 되나요?
돈을 버는 데 쓰는 것은 안 됩니다. 라이선스가 연구·평가 목적만 허락하고, 상업 이용은 Qwen 팀의 별도 허락이 필요합니다. 상업적으로 쓸 이미지 모델이 필요하면 이전 버전 Qwen-Image(Apache 2.0)처럼 상업 이용이 허락된 모델을 고르세요.
RTX 5090이 아니어도 돌아가나요?
이 글에서는 5090에서만 쟀습니다. 이번 설정에서 VRAM을 21GB까지 썼으니 24GB 그래픽카드도 들어갈 가능성이 있지만, 직접 확인하지 않았습니다. 16GB 이하라면 Unsloth Studio 목록의 GGUF(느림) 판을 고르게 될 것으로 보입니다.
처음 만들 때 왜 1분 넘게 걸리나요?
맨 처음 한 번은 속도를 높이는 준비 작업(컴파일)을 해서 69초가 걸렸습니다. 그 뒤로는 7.5초 안팎이었고, 모델을 내렸다 다시 올려도 다시 오래 걸리지 않았습니다.
한글 글자를 잘 쓰나요?
"로컬 AI 연구소"처럼 짧은 한글은 정확했습니다. "떡볶이"처럼 쌍자음과 겹받침이 있는 글자는 틀렸습니다. 글자가 꼭 맞아야 하면 여러 장 만들어 고르거나 글자를 따로 넣으세요.
Unsloth Studio에서 받는 용량은 얼마인가요?
Fast FP8을 고르면 17.2GB를 받았습니다(그림 부분 INT8 7.3GB, 글 이해 부분 FP8 9.4GB, 나머지 1.3GB). 원본 전체(33.1GB)를 받지 않습니다.
참고: Qwen-Image-2.1 모델 카드 · Qwen-Image-2.1 라이선스 · Qwen-Image-2.1 GitHub · unsloth/Qwen-Image-2.1-FP8 · Qwen-Image(이전 버전) · 이 블로그의 Unsloth Studio로 바꾼 이유, Unsloth Studio 설정 찾기, GPU 체험
댓글 0개