알리바바의 코딩용 모델 Qwen3-Coder 30B A3B Instruct(unsloth의 UD-Q3_K_XL, 파일 12.86GB)를 RTX 5060 Ti 16GB PC의 Unsloth Studio에서 기본값(Auto) 그대로 돌려 봤습니다. 결론부터 적으면 기본값에서는 초당 약 145토큰(t/s)으로 이 PC에서 잰 30B급 모델 중 가장 빨랐지만, 컨텍스트를 32,768로 늘리자 약 69t/s로 절반이 됐습니다. 같은 질문을 5번 잰 평균이 145.3t/s(최소 138.9, 최대 154.2)입니다.
- PC 전체 VRAM은 14.4GB까지 찼습니다. 모델이 쓴 몫은 약 13.7GB입니다.
- 컨텍스트를 늘릴수록 빠르게 느려집니다. 16,384에서 약 106t/s, 32,768에서 약 69t/s, 131,072에서 약 25t/s였습니다.
- KV 캐시를 q4_0으로 줄이면 많이 회복됩니다. 32,768에서 약 116t/s, 131,072에서 약 59t/s가 나왔습니다.
- 파이썬 8문제를 6번 풀게 했더니 48개 중 40개를 통과했습니다. 8문제를 다 푸는 데 16~20초가 걸렸습니다.
- 생각(Thinking) 기능과 사진 입력이 없는 모델입니다. 산수 문제는 API로 30번 물어 모두 틀렸고, 없는 소설은 줄거리를 지어냈습니다.
이 글의 결과를 20초로 요약한 영상입니다(소리 없음).
이 글의 숫자는 모두 이 PC에서 직접 잰 값입니다. 속도와 정답 수는 Unsloth Studio의 API로 재고, 화면 캡처와 영상은 측정이 끝난 뒤 따로 찍었습니다. 측정은 2026년 10월 7일에 했습니다. 같은 PC, 같은 방법으로 잰 Qwen3.6 35B A3B, Gemma 4 26B A4B QAT와 나란히 비교합니다.

800자 글을 쓰게 한 화면입니다. 답 아래에 초당 131.6토큰이 표시됩니다. 800자를 요청했지만 답은 여섯 줄로 짧습니다.
테스트 PC와 실행 프로그램
| 항목 | 내용 |
|---|---|
| GPU | NVIDIA GeForce RTX 5060 Ti (VRAM 16GB, 전력 제한 180W) |
| GPU 연결 | PCIe 3.0 x8 (메인보드가 PCIe 3.0까지 지원) |
| CPU | Intel Core i5-9400F (6코어 6스레드) |
| 시스템 램 | DDR4 32GB (16GB × 2, 2666MT/s) |
| 저장장치 | Crucial MX500 1TB SATA SSD |
| 운영체제 | Windows 11 Pro, 전원 구성표 균형 조정 |
| 실행 프로그램 | Unsloth Studio 데스크톱(베타) 2026.9.14 |
| 엔진 | llama.cpp 0.5.0-dev (build 11160, commit a3c12db9d, Unsloth가 빌드한 것) |
| GPU 드라이버 | 617.42 (109·110번 글을 잴 때는 616.92) |
| 측정 방법 | Unsloth Studio의 OpenAI 호환 API(127.0.0.1:8888)로 같은 질문을 반복해서 보냄. 속도는 첫 토큰이 나온 뒤부터 잰 생성 속도 |
| 측정 스크립트 | Python 3.14.3, requests 2.34.2, psutil 7.2.2 |
| 샘플링 | API 측정에서는 따로 지정하지 않음. 앱 화면의 기본값은 Temperature 0.7, Top P 0.8, Top K 20 |
| 측정 날짜 | 2026년 10월 7일 |
테스트 PC 두 대의 사양과 측정 방법은 소개 페이지에 있습니다. 테스트 프로그램을 LM Studio에서 Unsloth Studio로 바꾼 이유는 105번 글에 적었습니다.
테스트한 모델: Qwen3-Coder 30B A3B Instruct
알리바바 Qwen 팀이 2025년 7월에 공개한 코딩용 모델입니다. 나온 지 1년이 넘었지만 unsloth의 GGUF 저장소 기준으로 내려받기가 약 650만 회로, 지금도 많이 받는 모델입니다. MoE(Mixture of Experts) 구조라서 전체 파라미터는 30.5B이지만, 토큰 하나를 만들 때는 익스퍼트 128개 중 8개만 씁니다. 그래서 활성 파라미터는 약 3.3B이고, 이름의 A3B가 이 뜻입니다.
| 항목 | 내용 |
|---|---|
| 파라미터 | 전체 30.5B, 활성 약 3.3B |
| 구조 | MoE, 익스퍼트 128개 중 8개, 48레이어 |
| 받은 파일 | unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF의 UD-Q3_K_XL 12.86GB (3비트 양자화) |
| 받는 데 걸린 시간 | 2분 29초 |
| 최대 컨텍스트 | 262,144토큰 |
| 입력 | 글만 (사진 입력 없음) |
| 생각(Thinking) | 없음. 모델 카드에 생각 없는 방식만 지원한다고 적혀 있음 |
| 라이선스 | Apache 2.0 |
4비트 파일인 Q4_K_M은 17.28GB라서 16GB 그래픽카드에 들어가지 않습니다. 그래서 3비트 파일 중 큰 편인 UD-Q3_K_XL을 골랐습니다. 양자화(파일을 줄이는 것)를 더 세게 한 파일이라 4비트보다 답의 품질이 낮을 수 있습니다.
모델 카드에는 이 30B 모델의 벤치마크 점수 표가 없습니다. 에이전트 방식 코딩과 긴 컨텍스트(기본 256K)를 내세운다는 설명만 있어서, 이 글에는 제작사 점수를 싣지 않았습니다.

모델 선택 창입니다. 받아 둔 Qwen3-Coder 30B A3B가 맨 위에 보입니다. 다른 모델과 달리 사진 입력을 뜻하는 눈 모양 표시가 없습니다.
Unsloth Studio 기본값(Auto)은 어떻게 올렸나
실행 설정 창에서 컨텍스트(모델이 한 번에 기억하는 글의 길이)를 기본값인 Auto로 두고 올렸습니다. 모델 말고는 아무 설정도 주지 않았습니다. 예상 메모리는 GPU 37.22GiB로 나오고 GPU 메모리를 넘는다는 경고가 붙습니다. 최대 컨텍스트 262,144 기준으로 계산한 값으로 보이며, Auto는 VRAM에 맞게 컨텍스트를 줄여서 올립니다.

실행 설정 창입니다. 예상 메모리 37.22GiB에 경고가 붙어 있고, 컨텍스트는 Auto입니다.
| 설정 | Auto가 고른 값 | 뜻 |
|---|---|---|
| 컨텍스트 | 8,192 또는 8,448 (올릴 때마다 다름) | 최대 262,144의 약 3%. 그때 남아 있는 VRAM에 맞춰 정하는 것으로 보임 |
| GPU에 올리는 방식 | --fit on 또는 -ngl -1 --fit off | 올릴 때마다 둘 중 하나가 골라졌음. 앞의 것은 VRAM에 맞게 나눠 올리고, 뒤의 것은 레이어를 모두 GPU에 올림 |
| 가속 기능 | --spec-default | Speculative Decoding 기본값. 이 저장소에는 MTP용 파일이 없음 |
| 병렬 슬롯 | --parallel 4 | 요청 4개를 동시에 받을 수 있게 잡음 |
| KV 캐시 | f16 | 줄이지 않은 기본값 |
16GB에서 Auto가 잡은 컨텍스트는 약 8천 토큰입니다. 긴 코드 파일 여러 개를 한꺼번에 넣기에는 작습니다. 이 모델이 내세우는 긴 컨텍스트를 쓰려면 컨텍스트를 직접 늘려야 하고, 그때 속도가 어떻게 되는지가 이 글의 중심입니다.

로드가 끝난 화면입니다. 오른쪽 위에 컨텍스트가 8.2k로 표시됩니다.
VRAM과 시스템 램: 컨텍스트를 늘리면 시스템 램이 찬다
로드 직전과 직후의 GPU 메모리와 PC 전체 램의 차이를 쟀습니다. 로드 전에 윈도우와 다른 프로그램이 VRAM 약 0.7GB, 램 약 9.2GB를 쓰고 있었습니다.
| 컨텍스트 | 모델이 쓴 VRAM | PC 전체 VRAM | 늘어난 시스템 램 | 로드 시간 | 16GB에서 |
|---|---|---|---|---|---|
| 8,192 (Auto) | 13.7GB | 14.4GB | 0.6GB | 9.5초 (다시 로드 9.3초) | 원활 (남는 VRAM 1.5GB로 경계) |
| 32,768 | 13.9GB | 14.6GB | 2.7GB | 12.6초 | 제한적 |
| 65,536 | 13.9GB | 14.6GB | 5.8GB | 18.5초 | 제한적 |
| 131,072 | 13.9GB | 14.6GB | 11.9GB | 41.0초 | 제한적 |
| 262,144 (최대) | 13.9GB | 14.6GB | 15.2GB | 15.5초 | 제한적 |
VRAM은 컨텍스트와 상관없이 14.6GB 근처에서 멈춥니다. 대신 넘치는 부분이 시스템 램으로 갑니다. 131,072에서는 시스템 램이 11.9GB, 최대 컨텍스트에서는 15.2GB 늘었습니다. 같은 PC에서 잰 Qwen3.6 35B A3B는 최대 컨텍스트에서 6.6GB만 늘었습니다. 이 모델은 긴 컨텍스트에서 시스템 램을 두 배 넘게 씁니다. 램이 16GB인 PC라면 131,072부터는 올리기 어렵습니다.
로드 시간은 파일을 받은 직후에 쟀기 때문에, 윈도우가 파일을 이미 메모리에 올려 둔 상태였습니다. PC를 켠 뒤 처음 올릴 때는 이보다 오래 걸립니다. 이 PC는 SATA SSD입니다.
생성 속도: Auto에서 평균 145.3t/s
"집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점"으로 800자 글을 쓰게 했습니다. 5번 이어서 물었습니다.
| 순서 | 생성 속도 | 첫 토큰까지(TTFT) | 답 토큰 | 전체 시간 |
|---|---|---|---|---|
| 1번째 (로드 직후) | 139.6t/s | 0.55초 | 192 | 1.9초 |
| 2번째 | 153.4t/s | 0.39초 | 262 | 2.1초 |
| 3번째 | 138.9t/s | 0.40초 | 253 | 2.2초 |
| 4번째 | 140.5t/s | 0.38초 | 279 | 2.4초 |
| 5번째 | 154.2t/s | 0.39초 | 273 | 2.2초 |
| 평균 (최소~최대, 표준편차) | 145.3t/s (138.9~154.2, 7.8) | 0.42초 | 252 | 2.2초 |
같은 PC에서 Qwen3.6 35B A3B가 90.4t/s, Gemma 4 26B A4B QAT가 92.4t/s였으니 약 60% 빠릅니다. GPU 사용률은 평균 68%였습니다.
조심해서 볼 점이 있습니다. 800자를 써 달라고 했는데 답이 357~509자로 짧았습니다. 답 하나가 2초 남짓에 끝나서, 속도 값이 답 길이에 따라 흔들립니다(표준편차 7.8). 뒤의 설정 비교에서 같은 기본값을 다시 쟀을 때는 121.0, 119.9, 148.6t/s가 나왔습니다. 기본값 속도는 "약 120~155t/s"로 보는 편이 맞습니다.
컨텍스트를 늘리면: 두 배가 될 때마다 크게 내려간다
컨텍스트만 바꿔 다시 로드하며 같은 800자 글을 2번씩 쟀습니다.
| 컨텍스트 | 생성 속도 | 15,000자 요약 TTFT | Qwen3.6 35B A3B (110번 글) |
|---|---|---|---|
| 8,192 (Auto) | 145.3t/s (5번 평균) | (컨텍스트가 작아 재지 못함) | 약 90t/s |
| 16,384 | 107.8 / 104.4t/s | 4.7초 | 약 94t/s |
| 32,768 | 63.4 / 73.7t/s | 7.6초 | 약 94t/s |
| 65,536 | 43.6 / 44.5t/s | 13.5초 | 약 64t/s |
| 131,072 | 24.9 / 24.5t/s | 26.2초 | 약 50t/s |
| 262,144 | 14.5 / 18.8t/s | 67.2초 | 33.4t/s |
기본값에서는 이 모델이 훨씬 빠르지만, 32,768부터는 Qwen3.6 35B A3B가 더 빠릅니다. Qwen3.6은 32,768까지 속도가 그대로였는데, 이 모델은 16,384에서 이미 27% 내려가고 32,768에서 절반이 됩니다. 15,000자 글을 읽고 첫 토큰이 나오기까지 걸리는 시간도 컨텍스트가 커질수록 길어져서, 최대 컨텍스트에서는 1분이 넘었습니다.
까닭은 위의 메모리 표에 있습니다. 컨텍스트를 늘리면 기억 공간(KV 캐시)이 커지고, VRAM에 다 들어가지 않는 부분을 Unsloth Studio가 시스템 램으로 보냅니다. 그만큼 CPU가 일을 나눠 맡아 느려집니다. 32,768에서 GPU 사용률은 30% 안팎이었습니다.
설정을 바꾸면: KV 캐시 q4_0이 가장 효과가 컸다
기본값(Auto)에서 설정을 하나씩만 바꿔 다시 로드하고, 같은 800자 글을 3번씩 쟀습니다(평균). 설정은 Unsloth Studio API의 로드 옵션으로 바꿨습니다. KV 캐시와 Speculative Decoding은 실행 설정 창의 고급 항목에도 있습니다.
| 설정 | 생성 속도 (3번 평균) | 15,000자 요약 TTFT | 모델이 쓴 VRAM | 늘어난 시스템 램 |
|---|---|---|---|---|
| Auto (기본값, 이때 컨텍스트 8,448) | 129.8t/s | - | 13.8GB | 0.6GB |
| 가속 기능 끔 (Speculative Decoding off) | 120.8t/s | - | 13.7GB | 0.5GB |
| 컨텍스트 8,192 + 레이어 GPU 고정 | 112.6t/s | - | 13.7GB | 0.6GB |
| 컨텍스트 32,768, KV 캐시 기본(f16) | 약 69t/s | 7.6초 | 13.9GB | 2.7GB |
| 컨텍스트 32,768, KV 캐시 q8_0 | 95.5t/s | 4.9초 | 13.9GB | 1.4GB |
| 컨텍스트 32,768, KV 캐시 q4_0 | 116.3t/s | 4.1초 | 13.8GB | 0.6GB |
| 컨텍스트 32,768 + 레이어 GPU 고정 | 32.3t/s | 91.5초 | 14.9GB | 1.8GB |
| 컨텍스트 131,072, KV 캐시 기본(f16) | 약 25t/s | 26.2초 | 13.9GB | 11.9GB |
| 컨텍스트 131,072, KV 캐시 q4_0 | 58.7t/s | 8.9초 | 13.9GB | 3.5GB |
| 컨텍스트 262,144, KV 캐시 기본(f16) | 16.1t/s | 58.7초 | 13.9GB | 15.2GB |
| 컨텍스트 262,144, KV 캐시 q4_0 | 36.1t/s | 16.2초 | 13.9GB | 7.4GB |
- 긴 컨텍스트를 쓸 때는 KV 캐시를 q4_0으로 줄입니다. KV 캐시는 지금까지 읽은 글을 기억해 두는 공간입니다. 이것을 줄이자 32,768에서 약 69t/s가 116.3t/s로, 131,072에서 약 25t/s가 58.7t/s로, 262,144에서 16.1t/s가 36.1t/s로 올랐습니다. 시스템 램도 훨씬 덜 씁니다. 줄인 만큼 긴 글에서 답의 정확도가 달라지는지는 재지 않았습니다.
- 레이어를 모두 GPU에 고정하면 오히려 느려졌습니다. 컨텍스트 32,768에서 고정하자 모델이 쓴 VRAM이 14.9GB로 늘어 PC 전체로는 15.5GB가 찼고, 속도는 32.3t/s로 떨어졌습니다. 15,000자를 읽는 데 91.5초가 걸렸습니다. 16GB를 거의 다 채워 VRAM이 넘친 것으로 보입니다(추정). 16GB에서는 Unsloth Studio가 알아서 나누게 두는 편이 낫습니다.
- 기본 컨텍스트에서는 바꿔서 빨라진 설정이 없었습니다. 가속 기능을 끄거나 레이어를 고정해도 기본값보다 빠르지 않았습니다. 답이 짧아 값이 흔들리는 범위 안의 차이입니다.

컨텍스트 32,768에 KV 캐시 q4_0을 고른 화면입니다. 예상 메모리가 13.91GiB로 내려갑니다. 이 글에서 긴 컨텍스트에 가장 효과가 컸던 설정입니다.
다른 곳의 측정과 견주기
같은 모델을 잰 다른 기록 세 가지와 조건을 나란히 놓았습니다. 숫자는 각 글쓴이가 잰 값입니다.
| 항목 | 이 글 | ai.rs (2026년 5월) | llm-benchmark.de (2026년 7월) | Hacker News 댓글 (2025년) |
|---|---|---|---|---|
| 장비 | RTX 5060 Ti 16GB | RTX 5090 32GB | RTX 3090 Ti 24GB | 맥북 프로 64GB |
| 파일 | UD-Q3_K_XL 12.86GB | Q5_K_M 21.7GB | Q4_K_M | Q4 |
| 프로그램 | Unsloth Studio (llama.cpp build 11160) | Ollama 0.19.0 | llama.cpp | llama.cpp |
| 컨텍스트 | 8,192(Auto) / 32,768 | 32K | 16,384 | 적혀 있지 않음 |
| 동시 요청 | 1개 | 1개 | 10개 | 1개 |
| 생성 속도 | 145.3t/s / 약 69t/s (KV q4_0이면 116.3) | 231t/s | 10개 합쳐서 928t/s | 약 50t/s |
RTX 5090 기록은 5비트 파일이 VRAM에 다 들어간 상태에서 컨텍스트 32K로 231t/s입니다. 이 글의 16GB는 3비트 파일인데도 32,768에서 약 69t/s였습니다. 차이의 큰 부분은 VRAM 크기입니다. 16GB에서는 컨텍스트를 늘리면 일부가 시스템 램으로 넘어가기 때문입니다. RTX 3090 Ti 기록의 928t/s는 요청 10개를 동시에 처리한 합계라서, 한 사람이 쓸 때의 속도와 견줄 수 없습니다. 16GB 그래픽카드에서 3비트 파일로 잰 다른 기록은 찾지 못했습니다.
화면에서 돌린 영상
새 채팅을 열고 질문 하나를 보낸 영상입니다(13초, 소리 없음).
영상에는 초당 112.8토큰으로 찍혔습니다. 화면 녹화 프로그램이 CPU를 쓰는 동안 찍었기 때문에 표의 숫자보다 느립니다. 같은 방법으로 찍었을 때 Qwen3.6 35B A3B는 56.8t/s, Gemma 4 26B A4B QAT는 15t/s였습니다. 영상 속 답은 모델이 쓴 내용입니다. 녹화에 쓴 프로그램은 103번 글에서 소개했습니다.
코딩: 파이썬 8문제를 6번, 48개 중 40개 통과
파이썬 함수 8개를 짜게 하고, 숨겨 둔 테스트로 채점했습니다. 문제는 구간 합치기, 로마 숫자 변환, 수식 계산기, 가장 긴 회문, 다음 영업일, 많이 나온 낱말, 나선 순서, 한글 숫자를 정수로 바꾸기입니다. 컨텍스트는 Auto입니다. 다른 모델은 생각 끔 3번, 켬 3번으로 쟀는데, 이 모델은 생각 기능이 없어서 같은 조건으로 6번 풀게 한 셈입니다.
| 회차 | 1 | 2 | 3 | 4 | 5 | 6 | 합계 |
|---|---|---|---|---|---|---|---|
| 통과한 문제 | 7 / 8 | 7 / 8 | 6 / 8 | 7 / 8 | 6 / 8 | 7 / 8 | 40 / 48 |
| 8문제 전체 시간 | 17.3초 | 16.4초 | 17.8초 | 15.9초 | 20.0초 | 18.4초 | - |
| 문제 | 6번 중 통과 |
|---|---|
| 구간 합치기, 로마 숫자, 가장 긴 회문, 다음 영업일, 많이 나온 낱말, 나선 순서 | 6번 모두 통과 |
| 수식 계산기 | 4번 통과 (2번은 일부 테스트에서 틀림) |
| 한글 숫자를 정수로 | 0번 (테스트 10개 중 3~7개만 맞음) |
| 모델 (같은 PC, 같은 문제) | 통과 | 8문제 전체 시간 |
|---|---|---|
| Qwen3-Coder 30B A3B (생각 기능 없음) | 40 / 48 (83%) | 16~20초 |
| Qwen3.6 35B A3B, 생각 끔 | 18 / 24 (75%) | 35~49초 |
| Qwen3.6 35B A3B, 생각 켬 | 20 / 24 (83%) | 5분 36초~5분 45초 |
| Gemma 4 26B A4B QAT, 생각 끔 | 19 / 24 (79%) | - |
| Gemma 4 26B A4B QAT, 생각 켬 | 21 / 24 (88%) | - |
생각 없이 바로 답하는데도, 정답 비율은 다른 두 모델이 생각을 켰을 때와 비슷했습니다. 걸린 시간은 훨씬 짧습니다. Qwen3.6 35B A3B가 생각을 켜고 5분 넘게 걸린 8문제를 이 모델은 20초 안에 끝냈습니다. 다만 문제는 함수 하나를 짜는 짧은 문제 8개이고, 회차마다 한두 문제씩 결과가 달라집니다. 이 차이만으로 어느 모델이 코딩을 더 잘한다고 말하기는 어렵습니다. 한글 숫자 문제("삼천이백오십일"을 3251로)는 세 모델 모두 한 번도 통과하지 못했습니다.

정수를 로마 숫자로 바꾸는 함수를 짜게 한 화면입니다. 주석을 한국어로 달았습니다.
산수: API로는 30번 모두 틀림, 앱 화면에서는 풀이를 쓰고 맞힘
"사과 한 상자에 24개가 들어 있습니다. 3상자를 사서 19개를 먹고, 남은 것을 5명이 똑같이 나누면 한 사람당 몇 개이고 몇 개가 남나요? '한 사람당 X개, 남는 것 Y개' 형식으로만 답하세요."를 물었습니다. 정답은 한 사람당 10개, 남는 것 3개입니다. API로 샘플링 값을 세 가지로 바꿔 10번씩 물었습니다.
| API로 보낸 샘플링 값 | 정답 | 나온 답 |
|---|---|---|
| 지정하지 않음 | 0 / 10 | "11개, 1개", "1개, 5개", "13개, 1개"가 섞여 나옴 |
| Temperature 0.7, Top P 0.8, Top K 20 (앱 화면의 기본값과 같게) | 0 / 10 | "13개, 1개" 등 |
| Temperature 0 | 0 / 10 | "1개, 5개" 10번 |
API로는 형식을 지켜 한 줄로 답했고, 30번 모두 틀렸습니다(기본 측정의 10번까지 더하면 40번). 생각 기능이 없어서 계산 과정을 거치지 않고 바로 답을 적습니다. 걸린 시간은 약 0.5초입니다. Qwen3.6 35B A3B와 Gemma 4 26B A4B QAT도 생각을 끄면 5번 모두 틀렸고, 생각을 켜면 5번 모두 맞았습니다.
그런데 Unsloth Studio 앱 화면에서 같은 질문을 넣자 결과가 달랐습니다. "형식으로만 답하라"는 말을 따르지 않고 풀이를 한 줄씩 쓴 다음, 한 사람당 10개, 남는 것 3개로 맞혔습니다. 화면에서는 한 번만 물었습니다. 샘플링 값을 앱과 같게 맞춘 API에서는 여전히 틀렸으니, 샘플링 때문은 아닙니다. 앱이 모델에 보내는 내용이 API와 다른 것으로 보이지만(추정), 무엇이 다른지는 확인하지 못했습니다. 계산이 들어가는 질문에는 풀이 과정을 쓰게 하는 편이 안전합니다.

앱 화면에서 물은 답입니다. 풀이를 쓰고 맞혔습니다. API로 물었을 때는 한 줄로 답했고 모두 틀렸습니다.
긴 글 요약과 긴 대화
컨텍스트 32,768(KV 캐시 기본)로 올리고 이 블로그의 업데이트 기록을 넣어 세 문장으로 요약하게 했습니다. 100,000자는 컨텍스트 131,072에서 넣었습니다.
| 넣은 글 | 입력 토큰 | TTFT | 생성 속도 | 결과 |
|---|---|---|---|---|
| 3,000자 | 1,805 | 2.1초 | 69.5t/s | 세 문장으로 요약 |
| 15,000자 | 9,086 | 6.4초 | 62.3t/s | 세 문장으로 요약 |
| 100,000자 | 52,236 | 174.3초 | 19.5t/s | 세 문장으로 요약. 앞부분 내용에 치우침 |
5만 토큰짜리 글은 읽는 데만 3분 가까이 걸렸습니다. 이때 시스템 램은 PC 전체로 21.4GB까지 찼습니다. 기본 KV 캐시로는 긴 글을 넣기 어렵습니다.
대화가 길어질 때를 보려고, 앞에 긴 글을 두고 한 문장짜리 질문을 붙였습니다(컨텍스트 32,768).
| 앞에 쌓인 토큰 | TTFT | 생성 속도 |
|---|---|---|
| 1,225 | 1.5초 | 68.1t/s |
| 9,646 | 7.2초 | 62.1t/s |
| 22,510 | 13.3초 | 53.9t/s |
약 2만 3천 토큰이 쌓이면 속도가 53.9t/s로 약 21% 내려가고, 첫 토큰까지 13초가 걸렸습니다. Qwen3.6 35B A3B는 비슷한 길이에서 83.3t/s, 6.2초였습니다.
긴 문서에서 정보 찾기: 5번 모두 찾음
약 11,500토큰짜리 글의 10%, 30%, 50%, 70%, 90% 위치에 "블로그 관리자가 키우는 고양이 보리차는 2019년에 태어났다"는 문장을 하나 숨기고, 고양이 이름과 태어난 해를 물었습니다. 5번 모두 정해 준 형식대로 "이름: 보리차, 태어난 해: 2019"라고 답했습니다. 문장을 숨기지 않은 글에서는 "없음"이라고 답했습니다.
전력과 온도: 기본값에서 평균 54~65W, 최고 64도
800자 글을 쓰는 동안 0.5초마다 그래픽카드 상태를 읽었습니다(2번).
| 항목 | 컨텍스트 8,192 (Auto) | 컨텍스트 32,768 | Qwen3.6 35B A3B (32,768) |
|---|---|---|---|
| 쉬고 있을 때 전력 | 약 11.5W | 약 12W | 약 13W |
| 글 쓰는 동안 평균 전력 | 54~65W | 52~57W | 91~97W |
| 최고 전력 | 143W | 83W | 123W |
| 최고 온도 | 61~64도 | 55도 | 61~63도 |
| 평균 GPU 사용률 | 51~55% | 30~31% | 72% |
| 토큰 하나에 쓴 전기 | 약 0.5~0.6J | 약 0.8~0.9J | 약 1.1J |
기본값에서는 순간 전력이 143W까지 올랐습니다. 다만 답이 2초 남짓에 끝나서 읽은 횟수가 5번씩뿐입니다. 평균 전력은 참고로만 보세요. 컨텍스트 32,768에서는 GPU 사용률이 30%로 내려가고 전력도 덜 씁니다. 일부를 CPU가 맡기 때문입니다.
없는 소설과 사진
실제로 없는 소설("윤서하의 2018년 장편소설 『푸른 등대의 겨울』")의 줄거리를 API로 한 번, 앱 화면에서 한 번 물었습니다. 2번 모두 그런 작품이 없다고 하지 않고 줄거리를 지어냈습니다. 한 번은 1980년대 한국을 배경으로 '이소현'이라는 주인공이 가족과 겪는 정치적 갈등을 다룬다고 했고, 다른 한 번은 1980년 광주를 배경으로 한 가족 이야기라고 했습니다. 지어낸 내용도 서로 달랐습니다. Qwen3.6 35B A3B는 같은 질문에 그런 작품은 확인되지 않는다고 답했습니다. 이 모델은 코딩용이라, 사실을 묻는 용도로는 맞지 않습니다.

없는 소설을 물은 화면입니다. 없는 작품인데 배경, 인물, 주제를 지어냈습니다.
사진 설명은 하지 못했습니다. 이 모델은 글만 입력받고, 저장소에 이미지 입력용 파일이 없습니다. 사진을 붙여 API로 보내면 오류(400)가 돌아옵니다.
API로 받은 한국어 답 32개를 모두 확인했는데, 한자나 다른 나라 글자가 섞인 답은 없었습니다.
정리: 같은 PC의 두 모델과 비교
같은 PC, 같은 프로그램, 같은 질문으로 잰 세 MoE 모델입니다.
| 항목 | Qwen3-Coder 30B A3B | Qwen3.6 35B A3B | Gemma 4 26B A4B QAT |
|---|---|---|---|
| 파일 | UD-Q3_K_XL 12.86GB (3비트) | UD-IQ3_XXS 14.07GB (3비트) | UD-Q4_K_XL 13.27GB (4비트, QAT) |
| 공개 | 2025년 7월 | 2026년 4월 | 2026년 6월 |
| Auto 컨텍스트 | 8,192~8,448 | 8,192~16,640 | 8,192 |
| Auto 속도 (5번 평균) | 145.3t/s | 90.4t/s | 92.4t/s |
| 모델이 쓴 VRAM (Auto) | 13.7GB | 13.2GB | 14.1GB |
| 컨텍스트 32,768 | 약 69t/s (KV q4_0: 116.3) | 약 94t/s | 약 92t/s |
| 컨텍스트 131,072 (기본 / KV q4_0) | 약 25 / 58.7t/s | 약 50 / 66.7t/s | 약 63 / 79.1t/s |
| 컨텍스트 262,144 (기본 / KV q4_0) | 16.1 / 36.1t/s | 33.4 / 54.7t/s | 9.9 / 62.9t/s |
| 생각(Thinking) | 없음 | 있음 (800자 글 36~45초) | 있음 (17~19초) |
| 사진 입력 | 없음 | 있음 | 있음 |
| 산수 (API) | 0/30 | 끔 0/5, 켬 5/5 | 끔 0/5, 켬 5/5 |
| 코딩 8문제 | 40/48 (83%) | 끔 18/24, 켬 20/24 | 끔 19/24, 켬 21/24 |
| 없는 소설 | 줄거리를 지어냄 | 없다고 답함 | - |
- 짧은 코드 질문에는 가장 빠릅니다. 기본값에서 약 145t/s이고, 함수 하나를 2~3초에 짭니다. 생각 단계가 없어서 기다리는 시간이 없습니다.
- 긴 컨텍스트에는 약합니다. 16GB에서는 32,768만 돼도 속도가 절반이 됩니다. 길게 쓰려면 KV 캐시를 q4_0으로 바꿔야 하고, 그래도 131,072 이상에서는 Qwen3.6 35B A3B가 더 빠릅니다.
- 코딩 말고는 맡기기 어렵습니다. 바로 답하게 한 산수는 모두 틀렸고, 없는 소설은 지어냈고, 사진은 받지 않습니다.
- 16GB에서 고른다면: 빠른 코드 자동 완성이나 짧은 함수 작성에는 이 모델이, 긴 파일을 넣거나 계산·설명까지 맡길 때는 Qwen3.6 35B A3B가 맞습니다.
16GB 그래픽카드에서 Gemma 4 12B를 잰 결과는 82번 글에, 내 그래픽카드에서 다른 모델이 어느 정도 속도로 도는지는 GPU 체험에 있습니다.
이 글의 한계
- 2026년 10월 7일, Unsloth Studio 2026.9.14(llama.cpp build 11160), 그래픽 드라이버 617.42 기준입니다. 109·110번 글은 드라이버 616.92에서 쟀습니다. 드라이버가 달라 세 모델의 비교에 작은 차이가 섞였을 수 있습니다.
- UD-Q3_K_XL 파일 하나만 쟀습니다. 다른 3비트 파일이나 4비트 파일은 재지 않았고, 3비트와 4비트의 답 품질 차이도 재지 않았습니다.
- 800자를 요청했는데 답이 357~509자로 짧아서, 답 하나가 2초 남짓에 끝났습니다. 그래서 속도 값이 회차마다 크게 흔들립니다. 같은 기본값을 두 번 쟀을 때 평균이 145.3t/s와 129.8t/s였습니다.
- 5번 반복은 기본값의 800자 글에만 했습니다. 컨텍스트별 표는 2번씩, 설정 비교 표는 3번씩 잰 값이고 요약은 조건마다 한 번입니다.
- Auto가 올릴 때마다 다른 값을 골랐습니다(컨텍스트 8,192 또는 8,448, GPU에 올리는 방식 두 가지). 어느 조건에서 무엇을 고르는지는 확인하지 못했습니다.
- 로드 시간은 파일을 받은 직후에 잰 값입니다. PC를 켠 뒤 처음 올리는 시간은 재지 않았습니다.
- KV 캐시를 줄였을 때 답의 품질이 달라지는지는 재지 않았습니다.
- 없는 소설은 2번만 물었습니다. 앱 화면에서 산수를 맞힌 것은 한 번 물은 결과입니다.
- 코딩 문제는 직접 만든 짧은 8문제입니다. 이 모델이 내세우는 에이전트 방식 코딩(도구를 불러 여러 파일을 고치는 작업)은 시험하지 않았습니다. 도구 호출도 시험하지 않았습니다.
- 전력은 답이 짧아 한 번에 5~7번만 읽었습니다.
- API 측정은 샘플링 값을 지정하지 않았습니다. 앱 화면의 기본값(Temperature 0.7, Top P 0.8, Top K 20)으로 속도와 코딩 문제를 다시 재지는 않았습니다.
- 앱 화면과 API의 답이 다른 까닭은 확인하지 못했습니다.
자주 묻는 질문
RTX 5060 Ti 16GB에서 Qwen3-Coder 30B A3B는 몇 t/s인가요?
UD-Q3_K_XL(12.86GB) 파일을 Unsloth Studio 기본값으로 돌렸을 때 평균 145.3t/s(138.9~154.2)였습니다. 이때 컨텍스트는 8,192입니다. 컨텍스트 32,768에서는 약 69t/s이고, KV 캐시를 q4_0으로 줄이면 116.3t/s입니다.
16GB 그래픽카드에는 어떤 파일을 받아야 하나요?
4비트 파일(Q4_K_M 17.28GB)은 들어가지 않습니다. 이 글에서는 3비트 UD-Q3_K_XL(12.86GB)을 썼고, PC 전체 VRAM이 14.4GB까지 찼습니다.
컨텍스트를 길게 쓰려면 어떻게 하나요?
실행 설정의 고급 항목에서 KV 캐시를 q4_0으로 바꿉니다. 이 PC에서는 131,072에서 약 25t/s가 58.7t/s로 올랐고, 늘어나는 시스템 램도 11.9GB에서 3.5GB로 줄었습니다. 답의 품질이 달라지는지는 재지 않았습니다.
Qwen3.6 35B A3B와 비교하면 어떤가요?
기본값에서는 이 모델이 약 145t/s로 더 빠릅니다(Qwen3.6은 약 90t/s). 컨텍스트 32,768부터는 Qwen3.6이 더 빠릅니다. Qwen3.6은 생각 기능과 사진 입력이 있고, 이 모델은 둘 다 없습니다.
댓글 0개