AI 테스트 RTX-5060TI 16GB

[RTX 5060 Ti 16GB] 16GB 그래픽카드로 Qwen3.6 35B 돌아갈까, 3비트 파일이 VRAM 13.2GB에 초당 90토큰이었다

2026년 10월 05일 9회 1시간 전
[RTX 5060 Ti 16GB] 16GB 그래픽카드로 Qwen3.6 35B 돌아갈까, 3비트 파일이 VRAM 13.2GB에 초당 90토큰이었다

알리바바의 Qwen3.6 35B A3B(unsloth MTP 저장소의 UD-IQ3_XXS, 파일 14.07GB)를 RTX 5060 Ti 16GB PC의 Unsloth Studio에서 기본값(Auto) 그대로 돌려 봤습니다. 결론부터 적으면 모델 전체가 VRAM에 들어갔고, 초당 약 90토큰(t/s)이 나왔습니다. 같은 질문을 5번 잰 평균이 90.4t/s(최소 87.5, 최대 92.7)입니다.

  • VRAM은 약 13.2GB를 썼습니다. 윈도우가 쓰는 몫까지 합쳐 16GB 중 13.9GB였습니다.
  • MTP용 파일을 받았는데 기본값에서는 MTP가 켜지지 않았습니다. Unsloth Studio가 "MTP용 보조 모델까지는 VRAM에 안 들어간다"며 껐습니다. 그래도 속도는 Gemma 4 26B A4B(약 92t/s)와 비슷했습니다.
  • 생각(Thinking)이 깁니다. 800자 글 하나에 생각만 약 3,700~4,600토큰을 써서 답까지 36~45초가 걸렸습니다. 끄면 5~7초입니다.
  • 긴 컨텍스트는 잘 버팁니다. 32,768까지 약 93t/s였고, 최대 컨텍스트 262,144도 KV 캐시를 줄이면 약 55t/s가 나왔습니다.
  • 산수는 생각을 켜야 맞았습니다. 끄면 5번 모두 틀렸고, 켜면 5번 모두 맞았습니다.

이 글의 숫자는 모두 이 PC에서 직접 잰 값입니다. 속도와 정답 수는 Unsloth Studio의 API로 재고, 화면 캡처와 영상은 측정이 끝난 뒤 따로 찍었습니다. 측정은 2026년 10월 5일에 했습니다. 하루 전에 같은 PC, 같은 방법으로 잰 Gemma 4 26B A4B QAT와 나란히 비교합니다.

Unsloth Studio에서 Qwen3.6 35B A3B가 800자 글을 다 쓴 화면, Worked for 24s, 초당 118.0토큰

생각을 켠 채 800자 글을 쓰게 한 화면입니다. 생각에 24초를 썼고, 답 아래에 초당 118.0토큰이 표시됩니다.

테스트 PC와 실행 프로그램

항목내용
GPUNVIDIA GeForce RTX 5060 Ti (VRAM 16GB, 전력 제한 180W)
GPU 연결PCIe 3.0 x8 (메인보드가 PCIe 3.0까지 지원)
CPUIntel Core i5-9400F (6코어 6스레드)
시스템 램DDR4 32GB (16GB × 2, 2666MT/s)
저장장치Crucial MX500 1TB SATA SSD
운영체제Windows 11 Pro, 전원 구성표 균형 조정
실행 프로그램Unsloth Studio 데스크톱(베타) 2026.9.14
엔진llama.cpp 0.5.0-dev (build 11160, commit a3c12db9d, Unsloth가 빌드한 것)
GPU 드라이버616.92
측정 방법Unsloth Studio의 OpenAI 호환 API(127.0.0.1:8888)로 같은 질문을 반복해서 보냄. 속도는 첫 토큰이 나온 뒤부터 잰 생성 속도
측정 스크립트Python 3.14.3, requests 2.34.2, psutil 7.2.2
샘플링따로 지정하지 않음(프로그램 기본값)
측정 날짜2026년 10월 5일

테스트 PC 두 대의 사양과 측정 방법은 소개 페이지에 있습니다. 테스트 프로그램을 LM Studio에서 Unsloth Studio로 바꾼 이유는 105번 글에 적었습니다.

테스트한 모델: Qwen3.6 35B A3B

알리바바 Qwen 팀이 2026년 4월에 공개한 모델입니다. MoE(Mixture of Experts) 구조라서 전체 파라미터는 35B이지만, 토큰 하나를 만들 때는 익스퍼트 256개 중 8개와 공용 1개만 씁니다. 그래서 활성 파라미터는 약 3B이고, 이름의 A3B가 이 뜻입니다. 제작사는 코딩 작업에 맞춘 모델이라고 소개합니다.

항목내용
파라미터전체 35B, 활성 약 3B
구조MoE, 익스퍼트 256개 중 8개 + 공용 1개, 40레이어
받은 파일unsloth/Qwen3.6-35B-A3B-MTP-GGUF의 UD-IQ3_XXS 14.07GB (3비트 양자화)
함께 받는 파일이미지 입력용 파일(mmproj) 0.9GB. 합쳐서 14.97GB, 받는 데 2분 42초
최대 컨텍스트262,144토큰
입력글, 이미지, 영상
라이선스Apache 2.0

unsloth가 권하는 파일은 4비트인 UD-Q4_K_M(22.66GB)입니다. 16GB 그래픽카드에는 들어가지 않아서, 3비트 파일 중 가장 작은 UD-IQ3_XXS를 골랐습니다. 양자화(파일을 줄이는 것)를 더 세게 한 파일이라 4비트보다 답의 품질이 낮을 수 있습니다.

아래는 Qwen 팀이 모델 카드에 적은 벤치마크 점수입니다. 제작사가 직접 잰 값이고, 양자화하지 않은 원본 기준입니다.

벤치마크Qwen3.6 35B A3BQwen3.5 35B A3BGemma 4 26B A4B
SWE-bench Verified73.470.017.4
Terminal-Bench 2.051.540.534.2
MMLU-Pro85.285.382.6
LiveCodeBench v680.474.677.1
AIME2692.791.088.3

제작사 점수로는 코딩 쪽(SWE-bench, Terminal-Bench)에서 Gemma 4 26B A4B와 차이가 큽니다. 다만 이 글에서 돌린 것은 3비트 파일이고, 이 PC에서 낸 코딩 문제 결과는 아래에 따로 적었습니다.

Unsloth Studio 모델 선택 창, On Device 목록에 Qwen3.6-35B-A3B-MTP-GGUF UD-IQ3_XXS 35B 14GB와 Gemma 4 26B, 12B

모델 선택 창입니다. 받아 둔 Qwen3.6 35B A3B(14GB)가 맨 위에 보입니다.

Unsloth Studio 기본값(Auto)은 어떻게 올렸나

실행 설정 창을 열면 컨텍스트(모델이 한 번에 기억하는 글의 길이)가 기본으로 Auto입니다. 예상 메모리는 GPU 21.24GiB, 전체 22.71GiB로 나오고 GPU 메모리를 넘는다는 경고가 붙습니다. 최대 컨텍스트 기준으로 계산한 값으로 보이며, Auto는 VRAM에 맞게 컨텍스트를 줄여서 올립니다.

Unsloth Studio 실행 설정 창, Estimated Memory GPU 21.24GiB, Total 22.71GiB, Context Length Auto, 아래에 MTP를 껐다는 안내문

실행 설정 창입니다. 아래쪽 안내문에 "모델은 VRAM에 들어가지만 MTP용 보조 모델은 들어가지 않아서, Auto가 컨텍스트를 지키고 MTP를 껐다"고 적혀 있습니다.

이 창 아래쪽에 Unsloth Studio가 띄운 안내문이 있습니다.

“This model fits in VRAM but its MTP drafter does not”

Unsloth Studio 실행 설정 창

쉽게 말하면, 모델은 그래픽카드에 다 들어가지만 MTP용 보조 모델까지 올릴 자리는 없다는 뜻입니다. MTP는 작은 보조 모델이 다음 토큰을 미리 예측해 속도를 높이는 기능입니다. 저장소 이름에 MTP가 붙어 있어도, 16GB에서는 기본값으로 켜지지 않았습니다. 안내문은 이어서 "설정에서 MTP를 고르면 더 작은 컨텍스트로 강제로 켤 수 있다"고 알려 줍니다.

Unsloth Studio 실행 설정의 고급 항목, KV Cache Dtype f16, Speculative Decoding Auto, Vision 켬, Reasoning Budget -1

고급 항목의 기본값입니다. KV 캐시 f16, Speculative Decoding Auto, Vision 켬, Reasoning Budget -1(제한 없음)입니다.

Auto로 올렸을 때 실제로 적용된 값은 이렇습니다.

설정Auto가 고른 값뜻
컨텍스트8,192~16,640 (올릴 때마다 다름)그때 남아 있는 VRAM에 맞춰 정하는 것으로 보임. 여러 번 올린 값이 9,472 / 13,312 / 13,568 / 16,128 / 16,384 / 16,640 등
-ngl -1, --fit off레이어를 모두 GPU에모델 전체를 그래픽카드에 올림
--spec-type ngram-modMTP 대신 ngram 방식앞에 나온 글이 되풀이될 때 그대로 미리 채워 넣는 가속 방식
--no-mmproj-offload이미지 입력용 파일은 CPUVRAM을 아끼는 대신 사진을 읽는 시간이 길어짐
--threads 2CPU 스레드 2개모델이 GPU에 다 들어가서 CPU는 적게 씀
KV 캐시f16줄이지 않은 기본값

Gemma 4 26B A4B QAT 때는 Auto가 컨텍스트 8,192, MTP 켬, --fit on(일부를 시스템 램에)으로 올렸습니다. 같은 Auto라도 모델에 따라 고르는 값이 다릅니다.

Unsloth Studio에 Qwen3.6-35B-A3B-MTP-GGUF UD-IQ3_XXS가 로드된 화면, 오른쪽 위 컨텍스트 13.6k

로드가 끝난 화면입니다. 이번에는 컨텍스트가 13.6k로 잡혔습니다.

VRAM과 시스템 램: Auto에서 VRAM 13.2GB, 램 2.1GB

로드 직전과 직후의 GPU 메모리와 PC 전체 램의 차이를 쟀습니다. 로드 전에 윈도우와 다른 프로그램이 VRAM 약 0.7GB, 램 약 9GB를 쓰고 있었습니다.

컨텍스트모델이 쓴 VRAMPC 전체 VRAM늘어난 시스템 램로드 시간16GB에서
9,472 (Auto)13.2GB13.9GB2.1GB28.1초 (다시 로드 11.6초)원활 (남는 VRAM 2.0GB로 경계)
32,76813.5GB14.2GB1.7GB11.7초제한적
65,53613.7GB14.4GB2.4GB17.5초제한적
131,07213.6GB14.3GB3.9GB17.9초제한적
262,144 (최대)13.7GB14.4GB6.6GB18.7초제한적

Auto와 32,768에서는 시스템 램이 2GB 안팎만 늘었습니다. 이미지 입력용 파일(0.9GB)을 CPU에 두는 몫과 프로그램이 쓰는 몫입니다. 65,536부터는 Unsloth Studio가 --fit on으로 바꿔 올리고, 컨텍스트가 커질수록 시스템 램이 늘었습니다. 넘치는 부분을 시스템 램에 두기 때문이고, 그만큼 속도가 내려갑니다(아래 표).

로드 시간은 디스크에서 처음 읽을 때 28.1초, 모델만 내렸다가 바로 다시 올리면 11.6초였습니다. 이 PC는 SATA SSD라서 NVMe SSD보다 오래 걸립니다.

생성 속도: Auto에서 평균 90.4t/s

"집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점"으로 800자 글을 쓰게 했습니다. 생각을 끄고 5번 이어서 물었습니다.

순서생성 속도첫 토큰까지(TTFT)답 토큰전체 시간
1번째 (로드 직후)92.7t/s0.65초4835.9초
2번째90.8t/s0.48초6147.2초
3번째91.3t/s0.44초4795.7초
4번째89.4t/s0.46초5286.4초
5번째87.5t/s0.43초4255.3초
평균 (최소~최대, 표준편차)90.4t/s (87.5~92.7, 2.0)0.49초5066.1초

5번이 고르게 나왔습니다. GPU 사용률은 평균 79%였습니다. Gemma 4 26B A4B QAT는 같은 측정에서 평균 92.4t/s(83.5~96.0), GPU 사용률 42%였습니다. 속도는 비슷한데, 이 모델은 그래픽카드에 다 올라가 있어서 GPU를 더 많이 씁니다.

생각을 켜면: 답까지 36~45초

단계생각 끔생각 켬 (3번)
모델 로드 (한 번만)처음 28.1초, 다시 로드 11.6초
질문을 읽고 첫 토큰까지0.4~0.7초약 0.5초
생각없음약 32~40초 (약 3,700~4,600토큰)
답 쓰기약 5~7초 (425~614토큰)약 3~4초
질문부터 답 끝까지5.3~7.2초36.0 / 35.6 / 44.5초
생성 속도87.5~92.7t/s127.6 / 115.0 / 114.1t/s

생각을 켜면 걸리는 시간의 90% 가까이가 생각 단계입니다. Gemma 4 26B A4B QAT는 같은 글에 생각을 약 1,300토큰만 써서 17~19초에 끝났습니다. 이 모델은 생각을 세 배쯤 길게 합니다. 생각에 쓴 토큰 수는 프로그램이 따로 알려 주지 않아서 글자 수 비율로 어림한 값입니다.

생각을 켰을 때 속도가 114~128t/s로 더 높게 나온 것은 ngram 가속 때문으로 보입니다(추정). 이 모델은 생각 단계에서 답의 초안을 먼저 쓰고, 답에서 그 글을 거의 그대로 다시 씁니다. 되풀이되는 글은 ngram 방식이 미리 채워 넣습니다.

Unsloth Studio에서 Qwen3.6 35B A3B가 800자 글을 쓰기 전에 영어로 글의 구조를 짜고 한국어 초안을 쓰는 생각 내용이 펼쳐진 화면

생각하는 중인 화면입니다. 영어로 글의 구조를 짠 뒤, 생각 안에서 한국어 초안을 먼저 씁니다.

컨텍스트를 늘리면: 32,768까지는 그대로

컨텍스트만 바꿔 다시 로드하며 같은 800자 글을 쟀습니다(생각 끔 2번).

컨텍스트생성 속도 (생각 끔)생각 켬 800자 글15,000자 요약 TTFT사진 TTFT
8,19292.6 / 92.5t/s19.7초3.8초(이 크기에서는 재지 못함)
16,38493.6 / 93.4t/s29.7초3.9초27.8초
32,76893.7 / 93.7t/s34.0초3.9초28.1초
65,53663.9 / 63.4t/s82.7초5.1초28.6초
131,07249.8 / 50.2t/s78.2초7.1초29.1초

32,768까지는 속도가 그대로이고, 65,536에서 약 32%, 131,072에서 약 47% 느려졌습니다. 긴 문서를 넣어야 한다면 32,768이 속도를 잃지 않는 가장 큰 크기입니다. 그보다 크게 쓰려면 다음 절의 KV 캐시 설정을 함께 바꾸는 편이 낫습니다.

설정을 바꾸면: 빨라지는 설정과 느려지는 조건

기본값(Auto)에서 설정을 하나씩만 바꿔 다시 로드하고, 같은 800자 글을 3번씩 쟀습니다(생각 끔 평균). 설정은 Unsloth Studio API의 로드 옵션으로 바꿨습니다. KV 캐시와 Speculative Decoding은 실행 설정 창의 고급 항목에도 있습니다.

설정생성 속도생각 켬 800자 글사진 TTFTPC 전체 VRAM늘어난 시스템 램
Auto (기본값, 이때 컨텍스트 13,312)88.3t/s29.8초69.7초13.9GB1.7GB
가속 기능 끔 (Speculative Decoding off)86.6t/s37.7초69.7초13.8GB1.7GB
컨텍스트 8,192 + 레이어 GPU 고정 (MTP가 켜짐)96.2t/s30.3초10.8초15.6GB1.3GB
이미지 입력용 파일을 GPU에 (--mmproj-offload)60.9t/s70.3초1.8초14.2GB1.5GB
이미지 입력 끔87.2t/s24.6초-14.0GB1.0GB
컨텍스트 32,768, KV 캐시 q4_085.4t/s18.5초69.5초13.8GB1.7GB
컨텍스트 131,072, KV 캐시 기본(f16)약 50t/s78.2초29.1초14.3GB3.9GB
컨텍스트 131,072, KV 캐시 q4_066.7t/s51.8초28.7초14.2GB2.2GB
컨텍스트 262,144, KV 캐시 기본(f16)33.4t/s75.9초30.2초14.3GB6.6GB (최대 17.3GB 사용)
컨텍스트 262,144, KV 캐시 q4_054.7t/s36.0초29.2초14.2GB3.4GB
  • MTP를 켜면 약 9% 빨라졌습니다. 컨텍스트를 8,192로 고정하고 레이어를 모두 GPU에 올리자 MTP가 켜졌고, 88.3t/s가 96.2t/s가 됐습니다. 대신 PC 전체 VRAM이 15.6GB까지 찹니다. 모델 카드는 MTP로 1.5~2배 빨라진다고 적었지만, 이 PC에서는 그만큼은 아니었습니다.
  • 긴 컨텍스트에는 KV 캐시 q4_0이 효과가 큽니다. KV 캐시는 지금까지 읽은 글을 기억해 두는 공간입니다. 이것을 줄이면 131,072에서 약 50t/s가 66.7t/s로, 262,144에서 33.4t/s가 54.7t/s로 올랐습니다. 줄인 만큼 긴 글에서 답의 정확도가 달라지는지는 재지 않았습니다.
  • 최대 컨텍스트 262,144도 쓸 수 있는 속도였습니다. 기본 KV 캐시로도 33.4t/s가 나왔습니다. Gemma 4 26B A4B QAT는 같은 조건에서 9.9t/s였고 시스템 램이 31.7GB까지 찼습니다. 파일은 이 모델이 0.8GB 더 크지만, 긴 컨텍스트에서는 훨씬 잘 버텼습니다.
  • 사진을 자주 쓴다면 이미지 입력용 파일을 GPU에 올립니다. 첫 토큰까지 걸리는 시간이 1.8초로 줄었습니다. 대신 글 속도가 60.9t/s로 약 30% 내려갑니다.
  • 가속 기능(ngram)을 꺼도 짧은 글 속도는 거의 같았습니다. 생각을 켠 글에서만 29.8초가 37.7초로 늘었습니다.

측정할 때 조심할 점이 하나 있습니다. API로 넘긴 추가 옵션(llama_extra_args)은 그다음 로드에도 남습니다. 그래서 설정마다 빈 목록을 먼저 보내 앞 설정이 섞이지 않게 했습니다.

다른 곳의 측정과 견주기

같은 모델을 잰 다른 글 두 편과 조건을 나란히 놓았습니다. 두 글의 숫자는 각 글쓴이가 잰 값입니다.

항목이 글njannasch.dev (2026년 4월)InsiderLLM (2026년 4월, 9월 수정)
그래픽카드RTX 5060 Ti 16GBRTX 5060 Ti 16GBRTX 3090 24GB / RTX 3060 12GB
파일UD-IQ3_XXS 14.07GBIQ3_SUD-Q4_K_M
프로그램Unsloth Studio (llama.cpp build 11160)llama.cpp b8838llama-bench, llama-server
컨텍스트Auto(약 9,000~17,000) / 262,144262,144빈 상태~8K
KV 캐시f16 / q4_0q4_0적혀 있지 않음
MTP꺼짐 (Auto)쓰지 않음쓰지 않음 / 3090에서 켬
생성 속도Auto 90.4t/s, 262,144 + q4_0에서 54.7t/s짧은 글 97t/s, 500토큰 글 78t/s, 10만 8천 토큰을 채운 뒤 46t/s3090: 157.7t/s (MTP 켜면 172.0), 3060: 38.9t/s

같은 RTX 5060 Ti인 첫 번째 글은 컨텍스트 262,144, KV 캐시 q4_0에서 500토큰 글이 78t/s였습니다. 이 글은 같은 조건에서 54.7t/s였습니다. 차이가 나는 까닭으로 세 가지를 짐작할 수 있습니다. 먼저 Unsloth Studio는 이 크기에서 --fit on으로 일부를 시스템 램에 둡니다. 또 병렬 슬롯을 4개로 잡습니다(--parallel 4). 그리고 이 PC의 CPU는 2018년에 나온 6코어입니다. 어느 것이 얼마나 영향을 주는지는 따로 재지 않았습니다. 두 번째 글은 4비트 파일이 VRAM에 다 들어가는 RTX 3090에서 157.7t/s, 다 들어가지 않는 RTX 3060 12GB에서 38.9t/s였습니다. 16GB에서 3비트 파일로 잰 이 글의 90.4t/s는 그 사이에 있습니다.

화면에서 돌린 영상

새 채팅을 열고 질문 하나를 보낸 영상입니다(13초, 소리 없음, 생각 끔).

영상에는 초당 56.8토큰으로 찍혔습니다. 화면 녹화 프로그램이 CPU를 100% 가까이 쓰는 동안 찍었기 때문에 표의 숫자(약 90t/s)보다 느립니다. 같은 방법으로 찍은 Gemma 4 26B A4B QAT는 초당 15토큰까지 떨어졌습니다. 이 모델은 그래픽카드에 다 올라가 있어서 CPU가 바빠도 덜 느려집니다. 답의 내용에는 확인되지 않은 말이 섞여 있습니다(전력 소모를 다른 그래픽카드와 견준 문장 등). 속도를 보여 주려는 영상이니 내용은 참고하지 마세요. 녹화에 쓴 프로그램은 103번 글에서 소개했습니다.

산수: 생각을 끄면 0/5, 켜면 5/5

"사과 한 상자에 24개가 들어 있습니다. 3상자를 사서 19개를 먹고, 남은 것을 5명이 똑같이 나누면 한 사람당 몇 개이고 몇 개가 남나요? '한 사람당 X개, 남는 것 Y개' 형식으로만 답하세요."를 5번씩 물었습니다. 정답은 한 사람당 10개, 남는 것 3개입니다.

생각정답답걸린 시간
끔0 / 5"4개, 2개" 2번, "4개, 0개", "10개, 9개", "9개, 4개"약 0.6초
켬5 / 5"10개, 3개" 5번4.9~10.2초 (생각 약 450~860토큰)

생각을 끄면 계산 없이 바로 답을 적어서 틀리고, 답도 매번 달랐습니다. 형식을 지키지 않은 답도 3번 있었습니다. 계산이 들어가는 질문에는 생각을 켜야 합니다.

Unsloth Studio에서 생각을 켜고 사과 문제를 물은 화면, Worked for 4s, 답 한 사람당 10개 남는 것 3개, 초당 97.5토큰

생각을 켠 답입니다. 4초 생각한 뒤 "한 사람당 10개, 남는 것 3개"로 맞혔습니다.

Unsloth Studio에서 생각을 끄고 사과 문제를 물은 화면, 답 한 사람당 10개 남는 것 4개, 초당 70.5토큰

생각을 끈 답입니다. "한 사람당 10개, 남는 것 4개"로 틀렸습니다.

코딩: 파이썬 8문제를 3번씩, 생각 끔 18/24 · 켬 20/24

파이썬 함수 8개를 짜게 하고, 숨겨 둔 테스트로 채점했습니다. 문제는 구간 합치기, 로마 숫자 변환, 수식 계산기, 가장 긴 회문, 다음 영업일, 많이 나온 낱말, 나선 순서, 한글 숫자를 정수로 바꾸기입니다. 컨텍스트는 Auto이고, 8문제를 처음부터 끝까지 3번 풀게 했습니다.

생각1회2회3회합계8문제 전체 시간
끔 (답 최대 2,000토큰)7 / 85 / 86 / 818 / 2435~49초
켬 (최대 8,000토큰)6 / 87 / 87 / 820 / 245분 36초~5분 45초
문제생각 끔 (3번 중)생각 켬 (3번 중)
구간 합치기, 로마 숫자, 다음 영업일, 나선 순서3번 모두 통과3번 모두 통과
수식 계산기1번 통과 (2번은 실행 중 오류)3번 모두 통과
많이 나온 낱말2번 통과3번 모두 통과
가장 긴 회문3번 모두 통과2번 통과 (1번은 길이가 같은 다른 답을 냄)
한글 숫자를 정수로0번0번 (3번 모두 8,000토큰 안에 못 끝냄)

Gemma 4 26B A4B QAT는 같은 문제에서 생각 끔 19/24, 켬 21/24였습니다. 이 PC에서 낸 8문제로는 두 모델의 차이가 한 문제 안쪽입니다. 제작사 벤치마크의 큰 차이는 여기서 보이지 않았습니다. 다만 이 글은 3비트 파일이고, 문제도 함수 하나를 짜는 짧은 문제입니다. 제작사가 내세우는 저장소 단위 작업(SWE-bench)과는 종류가 다릅니다. 한글 숫자 문제("삼천이백오십일"을 3251로)는 두 모델 모두 여섯 번 다 실패했습니다.

긴 글 요약과 긴 대화

컨텍스트 32,768로 올리고 이 블로그의 업데이트 기록을 넣어 세 문장으로 요약하게 했습니다(생각 끔).

넣은 글TTFT생성 속도결과
3,000자1.4초90.7t/s세 문단, 내용 맞음
15,000자3.4초89.2t/s세 문단, 게임 이름 '한알한알'을 '한알한글'로 잘못 적음

대화가 길어질 때를 보려고, 앞에 긴 글을 두고 한 문장짜리 질문을 붙였습니다.

앞에 쌓인 토큰TTFT생성 속도
1,0171.1초89.0t/s
7,8613.9초87.8t/s
19,1236.2초83.3t/s

약 1만 9천 토큰이 쌓여도 속도는 83.3t/s로 7%만 내려갔습니다. Gemma 4 26B A4B QAT는 비슷한 길이에서 69.9t/s까지 내려갔습니다.

긴 문서에서 정보 찾기: 5번 모두 찾음

약 9,500토큰짜리 글의 10%, 30%, 50%, 70%, 90% 위치에 "블로그 관리자가 키우는 고양이 보리차는 2019년에 태어났다"는 문장을 하나 숨기고, 고양이 이름과 태어난 해를 물었습니다. 5번 모두 보리차와 2019를 찾았습니다. 한 번은 정해 준 형식 대신 "보리차: 2019"라고만 답했습니다. 문장을 숨기지 않은 글에서는 "없음"이라고 답했습니다.

전력과 온도: 평균 약 94W, 최고 63도

800자 글을 쓰는 동안 0.5초마다 그래픽카드 상태를 읽었습니다(컨텍스트 32,768, 생각 끔, 2번).

항목Qwen3.6 35B A3BGemma 4 26B A4B QAT
쉬고 있을 때 전력약 13W약 11.5W
글 쓰는 동안 평균 전력91~97W60~62W
최고 전력123W78W
최고 온도61~63도48~49도
평균 GPU 사용률72%35~36%
토큰 하나에 쓴 전기약 1.1J약 0.75J

그래픽카드가 하는 일이 많은 만큼 전기를 더 씁니다. 그래도 전력 제한 180W의 절반 정도입니다.

없는 소설과 사진

실제로 없는 소설("윤서하의 2018년 장편소설 『푸른 등대의 겨울』")의 줄거리를 2번 물었습니다. 2번 모두 그런 작품은 확인되지 않는다고 답했고 줄거리를 지어내지 않았습니다. 다만 "혹시 이 작품을 찾으시나요" 하며 다른 작가의 책을 예로 들었는데, 그중에는 실제와 다른 제목이 섞여 있었습니다(김애란의 『바깥은 여름』을 『바깥은 겨울』로 적는 식).

Unsloth Studio에서 없는 소설의 줄거리를 묻자 Qwen3.6 35B A3B가 그런 작품을 발표한 사실이 없다고 답하고 다른 작가의 책을 예로 든 화면, 초당 86.8토큰

없는 소설을 물은 화면입니다. 존재하지 않는다고 답한 뒤, 찾는 책일 수 있다며 다른 작가의 책을 예로 들었습니다.

모래시계 두 개가 놓인 사진을 주고 무엇이 보이는지 물었습니다. 설정을 바꿔 가며 API로 9번 물었고, 오른쪽 모래시계 안에 "전자 부품"이나 "회로"가 들어 있다고 맞게 말한 것이 7번, "기계 부품과 전선"이라고 한 것이 2번이었습니다. Gemma 4 26B A4B QAT는 13번 중 7번이었습니다.

사진을 읽는 시간은 깁니다. 첫 토큰까지 28~70초가 걸렸습니다. 이미지 입력용 파일을 CPU에 두기 때문입니다. 같은 기본값인데도 28초일 때와 70초일 때가 있었고, 왜 갈리는지는 확인하지 못했습니다. 사진 한 장에 1분을 기다려야 하면 쓰기 어렵습니다. 사진을 쓸 계획이면 위 설정 표처럼 이미지 입력용 파일을 GPU에 올려야 합니다(1.8초).

Unsloth Studio에서 모래시계 두 개 사진을 붙여 넣고 설명을 받은 화면, 오른쪽 모래시계는 유리 내부에 전자 부품과 회로가 보인다고 답함, 초당 88.9토큰

사진을 붙여 넣고 물은 화면입니다. 설명은 맞았지만 답이 시작되기까지 1분 가까이 기다렸습니다.

한국어 답 23개를 모두 확인했는데, 한자나 다른 나라 글자가 섞인 답은 없었습니다. 생각 내용은 영어로 나옵니다.

정리: 같은 PC의 Gemma 4 26B A4B QAT와 비교

하루 차이로 같은 PC, 같은 프로그램, 같은 질문으로 잰 두 MoE 모델입니다.

항목Qwen3.6 35B A3BGemma 4 26B A4B QAT
파일UD-IQ3_XXS 14.07GB (3비트)UD-Q4_K_XL 13.27GB (4비트, QAT)
Auto 컨텍스트8,192~16,6408,192
Auto에서 MTP꺼짐켜짐
Auto 속도 (5번 평균)90.4t/s92.4t/s
VRAM / 늘어난 시스템 램13.2GB / 2.1GB14.1GB / 3.5GB
GPU 사용률79%42%
다시 로드 시간11.6초22.8초
생각 켬 800자 글36~45초17~19초
컨텍스트 32,768약 94t/s약 92t/s
컨텍스트 131,072 (기본 / KV q4_0)약 50 / 66.7t/s약 63 / 79.1t/s
컨텍스트 262,144 (기본 / KV q4_0)33.4 / 54.7t/s9.9 / 62.9t/s
산수 (끔 / 켬)0/5, 5/50/5, 5/5
코딩 8문제 3번 (끔 / 켬)18/24, 20/2419/24, 21/24
사진 TTFT (기본값)28~70초약 30초
평균 전력91~97W60~62W
녹화하면서 돌릴 때56.8t/s15.0t/s
  • 16GB에 다 들어가는 35B 모델입니다. 3비트 파일이 VRAM 13.2GB에 올라가고 약 90t/s가 나옵니다. 그래픽카드에 다 올라가 있어서 CPU가 느리거나 바빠도 속도가 덜 흔들립니다.
  • 속도는 Gemma 4 26B A4B QAT와 같습니다. 차이는 생각 시간입니다. 생각을 켜면 이 모델이 두 배쯤 오래 걸립니다. 빨리 답을 받는 용도라면 생각을 끄거나 Gemma 쪽이 낫습니다.
  • 이 PC에서 낸 문제로는 두 모델의 정답 수가 거의 같았습니다. 산수는 같고, 코딩은 한 문제 차이입니다. 3비트 파일과 4비트 QAT 파일의 비교라는 점도 감안해야 합니다.
  • 컨텍스트는 32,768까지가 속도를 잃지 않는 선입니다. 더 길게 쓰려면 KV 캐시를 q4_0으로 줄입니다. 최대 262,144에서도 약 55t/s였습니다.
  • 사진은 기본값으로는 쓰기 어렵습니다. 이미지 입력용 파일을 GPU에 올리는 설정으로 바꿔야 합니다.

16GB 그래픽카드에서 Gemma 4 12B를 잰 결과는 82번 글에, 내 그래픽카드에서 다른 모델이 어느 정도 속도로 도는지는 GPU 체험에 있습니다.

이 글의 한계

  • 2026년 10월 5일, Unsloth Studio 2026.9.14(llama.cpp build 11160) 기준입니다. 베타 프로그램이라 버전이 바뀌면 Auto가 고르는 값과 속도가 달라질 수 있습니다.
  • UD-IQ3_XXS 파일 하나만 쟀습니다. 더 큰 3비트 파일(IQ3_S 15.35GB)이나 4비트 파일은 재지 않았습니다. 3비트와 4비트의 답 품질 차이도 재지 않았습니다.
  • 5번 반복은 기본값(Auto)의 생각 끔 800자 글에만 했습니다. 컨텍스트별 표는 2번씩, 설정 비교 표는 3번씩 잰 값이고 사진과 요약은 조건마다 한 번입니다.
  • Auto가 고르는 컨텍스트가 올릴 때마다 달랐습니다(8,192~16,640). 표마다 Auto 컨텍스트가 조금씩 다릅니다.
  • 사진 TTFT가 28초일 때와 70초일 때가 왜 갈리는지 정확한 원인은 확인하지 못했습니다.
  • 설정에서 MTP만 따로 고르는 방법(Speculative Decoding을 MTP로)은 재지 않았습니다. MTP가 켜진 값은 레이어를 GPU에 고정하고 컨텍스트를 8,192로 준 조합 하나입니다.
  • 프로그램을 켠 직후의 첫 실행은 따로 재지 않았습니다.
  • KV 캐시를 줄였을 때 답의 품질이 달라지는지는 재지 않았습니다.
  • 컨텍스트를 실제로 10만 토큰 넘게 채운 상태의 속도는 재지 않았습니다. 가장 길게 채운 것이 약 1만 9천 토큰입니다.
  • 코딩 문제는 직접 만든 짧은 8문제입니다. 제작사가 내세우는 저장소 단위 코딩 작업은 시험하지 않았습니다.
  • 영상 입력은 시험하지 않았습니다.
  • 생각에 쓴 토큰 수는 글자 수 비율로 어림한 값입니다.

자주 묻는 질문

RTX 5060 Ti 16GB에서 Qwen3.6 35B A3B는 몇 t/s인가요?

UD-IQ3_XXS(14.07GB) 파일을 Unsloth Studio 기본값으로 돌렸을 때 800자 글 기준 평균 90.4t/s(87.5~92.7)였습니다. 컨텍스트 32,768까지는 속도가 같고, 131,072에서는 약 50t/s, KV 캐시를 q4_0으로 줄이면 66.7t/s입니다.

16GB 그래픽카드에는 어떤 파일을 받아야 하나요?

4비트 파일(UD-Q4_K_M 22.66GB)은 들어가지 않습니다. 이 글에서는 3비트 UD-IQ3_XXS(14.07GB)를 썼고, VRAM 13.2GB에 다 올라갔습니다. 이미지 입력용 파일 0.9GB를 함께 받습니다.

저장소 이름에 MTP가 있는데 왜 MTP가 안 켜지나요?

Unsloth Studio가 "모델은 VRAM에 들어가지만 MTP용 보조 모델은 들어가지 않는다"며 기본값에서 껐습니다. 컨텍스트를 8,192로 줄이고 레이어를 모두 GPU에 올리자 MTP가 켜졌고, 속도는 88.3t/s에서 96.2t/s가 됐습니다.

Gemma 4 26B A4B와 비교하면 어떤가요?

기본값 속도는 약 90t/s와 약 92t/s로 비슷합니다. Qwen3.6 35B A3B는 VRAM에 다 들어가서 긴 컨텍스트와 CPU가 바쁜 상황에서 더 잘 버텼고, 생각을 켰을 때는 두 배쯤 오래 걸렸습니다. 이 PC에서 낸 산수와 코딩 문제의 정답 수는 거의 같았습니다.

출처

관련 게시글

댓글 0개