Unsloth Studio는 모델을 올릴 때 설정을 알아서 정해 주는 기본값(Auto)이 있습니다. 구글의 Gemma 4 12B QAT(UD-Q4_K_XL, 파일 6.72GB)를 RTX 5090 32GB와 RTX 5060 Ti 16GB에서 똑같이 기본값으로 올려 봤습니다. 결론부터 적으면 같은 기본값인데 두 PC에서 켜진 속도 기능이 달랐습니다.
- RTX 5090 32GB는 MTP가 켜졌습니다. 한국어 800자 글을 초당 232.9토큰(t/s)으로 썼습니다. 같은 질문을 5번 잰 평균이고, 범위는 230.9~234.2입니다. 글 하나가 약 3초에 나옵니다.
- RTX 5060 Ti 16GB는 MTP가 꺼졌습니다. 약 52t/s였고, 글 하나에 약 13초가 걸렸습니다.
- 16GB에서는 컨텍스트를 숫자로 지정하기만 해도 MTP가 켜졌습니다. 속도가 약 94t/s로 1.8배가 됐습니다.
- 5090에서 MTP를 일부러 끄면 약 135t/s였습니다. MTP가 속도를 약 1.6배로 올려 줍니다.
- 답의 수준은 두 PC가 같았습니다. 산수 문제는 두 PC 모두 생각을 켜면 5번 중 5번 맞았습니다.
이 글의 숫자는 두 PC에서 직접 잰 값입니다. 5060 Ti는 2026년 10월 4일에, 5090은 10월 6일에 같은 스크립트로 쟀습니다. 속도는 Unsloth Studio의 API로 재고, 화면 캡처는 측정이 끝난 뒤 따로 찍었습니다.
이 글의 결과를 20초로 요약한 영상입니다(소리 없음). 화면 녹화가 아니라 HTML로 장면을 짜서 영상으로 만드는 도구 hyperframes로 만들었습니다.

두 PC 모두 컨텍스트는 최대값 262,144로 잡혔습니다. 다른 것은 속도 기능입니다.
RTX 5090에서 같은 질문을 보낸 두 화면을 나란히 붙였습니다(7.5초, 소리 없음, 생각 끔). 왼쪽(MTP 켜짐)은 약 3.5초, 오른쪽(MTP 끔)은 약 5.4초에 글이 끝납니다. 화면에 표시된 속도는 222.5t/s와 131.7t/s였습니다. 답은 모델이 쓴 내용입니다.
MTP와 ngram은 무엇인가
둘 다 답을 더 빨리 쓰게 하는 기능입니다. Unsloth Studio 설정 화면에서는 Speculative Decoding이라는 이름으로 묶여 있습니다.
- MTP(Multi-Token Prediction): 작은 보조 모델이 다음 토큰 몇 개를 미리 써 두고, 원래 모델이 그것을 한 번에 검사합니다. 맞으면 그대로 쓰고, 틀리면 원래 모델이 다시 씁니다. 아래 출처의 DEV 정리 글은 이렇게 해도 답이 달라지지 않는다고 설명합니다. Gemma 4 12B는 보조 모델 파일(mtp-gemma-4-12B-it.gguf, 0.25GB)이 따로 있습니다.
- ngram 방식: 보조 모델 없이, 앞에 나온 글에서 같은 낱말 순서가 반복되면 그대로 이어 붙입니다. 코드를 조금만 고쳐 다시 쓰는 일처럼 같은 내용이 반복될 때 도움이 됩니다. 새 글을 쓸 때는 반복되는 부분이 적습니다.
MTP는 보조 모델과 그 작업 공간만큼 VRAM을 더 씁니다. 이 모델에서는 약 0.9GB였습니다(5090에서 켠 것과 끈 것의 차이).
테스트 PC와 실행 프로그램
| 항목 | RTX 5090 PC | RTX 5060 Ti PC |
|---|---|---|
| GPU | RTX 5090 (VRAM 32GB) | RTX 5060 Ti (VRAM 16GB) |
| CPU | Intel Core Ultra 9 285K | Intel Core i5-9400F |
| 시스템 램 | 64GB | DDR4 32GB |
| GPU 드라이버 | 616.92 | 616.92 |
| 실행 프로그램 | Unsloth Studio 데스크톱 0.1.902-beta | Unsloth Studio 데스크톱(베타) |
| 엔진 | llama.cpp b11160 (Unsloth가 빌드한 것) | llama.cpp b11160 (Unsloth가 빌드한 것) |
| 측정 날짜 | 2026년 10월 6일 | 2026년 10월 4일 |
모델 파일은 두 PC 모두 unsloth/gemma-4-12B-it-qat-GGUF의 UD-Q4_K_XL(6.72GB)입니다. 사진을 읽는 파일(mmproj-F16, 0.18GB)과 MTP 보조 모델(0.25GB)이 함께 받아집니다. 라이선스는 Apache 2.0입니다. 질문은 "집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점"을 주제로 800자 글을 쓰게 하는 것이고, 샘플링은 프로그램 기본값입니다. 테스트 PC 두 대의 사양은 소개 페이지에, Unsloth Studio를 쓰는 이유는 105번 글에 있습니다.
기본값으로 올리면 무엇이 정해지나
모델만 고르고 다른 값은 건드리지 않았습니다. Unsloth Studio가 실제로 실행한 llama.cpp 명령을 읽어서 표로 옮겼습니다.
| 항목 | RTX 5090 32GB | RTX 5060 Ti 16GB |
|---|---|---|
| 컨텍스트 | 262,144 | 262,144 |
| 속도 기능 | MTP (--spec-type draft-mtp, 초안 2개) | ngram (--spec-type ngram-mod) |
| GPU에 올린 레이어 | 전부 | 전부 |
| 모델이 쓴 VRAM | 14.4GB | 13.2GB |
| PC 전체 VRAM | 16.2GB (32GB 중) | 13.8GB (16GB 중) |
| 처음 올리는 시간 | 23.6초 | 32.6초 |
| 다시 올리는 시간 | 7.4초 | 약 10초 |
이 표가 뜻하는 것은, 기본값이 두 PC에서 컨텍스트는 똑같이 최대로 잡고, 속도 기능만 다르게 골랐다는 점입니다. 16GB에서는 최대 컨텍스트만으로 13.8GB가 찼습니다. 여기에 MTP가 쓸 0.9GB가량을 더하면 남는 VRAM이 1GB 남짓입니다. 그래서 MTP가 빠진 것으로 보입니다(추정).

RTX 5090에서 기본값으로 올린 뒤의 설정 화면입니다. 컨텍스트와 속도 기능이 모두 Auto입니다.

모델 이름 옆에 올라간 상태(Loaded)가 보이고, 오른쪽 위 숫자가 잡힌 컨텍스트(262.1k)입니다.
Unsloth 저장소의 이슈 기록에도 같은 동작이 나옵니다. 2026년 8월에 올라온 이슈의 로그에는 Auto가 속도 기능을 위해 컨텍스트를 줄이지 않는다는 문구가 있습니다. 다시 말해 기본값은 긴 컨텍스트를 먼저 지키고, 남는 VRAM이 있을 때만 MTP를 켭니다. 오류가 아니라 프로그램이 정한 순서입니다.
RTX 5090: 기본값 그대로 초당 233토큰
같은 질문을 5번 보냈습니다.
| 순서 | 속도 | 쓴 토큰 | 걸린 시간 |
|---|---|---|---|
| 1 | 231.8t/s | 633 | 3.2초 |
| 2 | 234.1t/s | 629 | 3.0초 |
| 3 | 230.9t/s | 659 | 3.2초 |
| 4 | 234.2t/s | 656 | 3.1초 |
| 5 | 233.5t/s | 605 | 2.9초 |
| 평균 | 232.9t/s | 약 3초 |
이 표가 뜻하는 것은, 다섯 번의 차이가 3t/s 안쪽이라 값이 일정하다는 점입니다. 첫 글자는 0.3~0.4초 만에 나왔습니다. 생각(Thinking)을 켜면 생각에 약 1,000~1,200토큰을 더 써서 6.5~7.6초가 걸렸고, 속도는 229~232t/s로 같았습니다. 시스템 램은 모델을 올리기 전 20.8GB에서 23.3GB로 2.5GB 늘었습니다.

기본값(MTP 켜짐)으로, 생각을 켠 채 800자 글을 쓰게 한 화면입니다. 답 아래에 초당 226.3토큰이 보입니다. 화면을 찍는 동안에는 표의 값보다 조금 낮게 나옵니다.
RTX 5090에서 속도 기능을 바꿔 보면
기본값에서 속도 기능 하나만 바꿔 가며 쟀습니다. 설정마다 3번씩, 두 차례 돌려 모두 6번입니다.
| 설정 | 평균 속도 | 범위 | 모델이 쓴 VRAM |
|---|---|---|---|
| 기본값 (MTP, 초안 2개) | 211.3t/s | 187.6~232.2 | 14.4GB |
| MTP, 초안 4개 | 228.9t/s | 210.6~254.6 | 14.4GB |
| ngram 방식 | 133.3t/s | 126.9~141.4 | 13.5GB |
| 속도 기능 끔 | 134.6t/s | 126.2~143.0 | 13.5GB |
이 표가 뜻하는 것은 두 가지입니다. 첫째, MTP를 켜면 끈 것보다 약 1.6배 빠릅니다. 둘째, ngram 방식은 끈 것과 차이가 없었습니다. 새 글을 쓰는 질문이라 반복되는 낱말 순서가 거의 없었기 때문으로 보입니다. 그러니 5060 Ti의 기본값(ngram)은 이 질문에서는 속도 기능이 없는 것과 같습니다.
이 표의 기본값(211.3t/s)은 위 절의 232.9t/s보다 낮습니다. 재는 스크립트가 달라서입니다. 위 절은 서버가 알려 준 생성 속도이고, 이 표는 첫 글자가 나온 뒤부터 끝까지의 시간으로 직접 나눈 값입니다. 그래서 이 표는 표 안의 설정끼리만 비교해 주세요.

막대가 길수록 빠릅니다. ngram 방식과 끈 것은 막대 길이가 거의 같습니다.

속도 기능을 끄고, 생각을 켠 채 같은 질문을 다시 보낸 화면입니다. 초당 139.1토큰으로 내려갔습니다.

속도 기능은 Run settings의 Speculative Decoding에서 고릅니다. Advanced settings를 켜야 보입니다.
RTX 5060 Ti: 컨텍스트만 지정해도 MTP가 켜진다
16GB에서 기본값이 느렸던 것은 MTP가 꺼져서였습니다. 그런데 MTP를 직접 켜지 않고 컨텍스트를 숫자로 지정하기만 해도 MTP가 켜졌습니다. 두 PC에서 같은 스크립트로 네 가지 컨텍스트를 쟀습니다.
| 지정한 컨텍스트 | 5060 Ti 속도 | 5060 Ti PC 전체 VRAM | 5090 속도 | 5090 PC 전체 VRAM |
|---|---|---|---|---|
| 32,768 | 94.2t/s | 10.2GB | 247.9t/s | 11.7GB |
| 65,536 | 94.9t/s | 10.9GB | 245.9t/s | 12.3GB |
| 131,072 | 94.1t/s | 12.2GB | 252.8t/s | 13.6GB |
| 262,144 | 92.9t/s | 14.4GB | 250.3t/s | 16.2GB |
| 지정 안 함 (기본값) | 52.4t/s | 13.8GB | 232.9t/s | 16.2GB |
이 표가 뜻하는 것은 세 가지입니다.
- 16GB에서는 컨텍스트를 지정하면 52t/s에서 약 94t/s가 됩니다. 800자 글 하나가 약 13초에서 약 7초로 줄어듭니다.
- 최대 컨텍스트 262,144를 직접 지정해도 MTP가 켜졌습니다. 이때는 프로그램이 사진을 읽는 부분을 그래픽카드가 아니라 CPU에 올렸습니다(--no-mmproj-offload). VRAM 자리를 그렇게 마련한 것입니다. PC 전체 VRAM은 14.4GB로 16GB에 가깝습니다.
- 32GB에서는 컨텍스트를 줄여도 빨라지지 않습니다. VRAM만 4.5GB 줄어듭니다.
기본값 줄의 5060 Ti 값(52.4t/s)과 5090 값(232.9t/s)은 서버가 알려 준 속도이고, 나머지 줄은 시간을 직접 재서 나눈 값입니다. 5090에서 두 방법의 차이는 7% 안팎이었습니다. 52와 94의 차이는 그보다 훨씬 큽니다.

컨텍스트를 숫자로 지정한 네 경우 모두 두 PC에서 MTP가 켜졌습니다.
16GB에서는 어떻게 설정하면 되나
- 채팅 화면 오른쪽 위의 버튼으로 Run settings를 엽니다.
- Context Length를 Auto에서 숫자로 바꿉니다. 보통의 글쓰기와 요약에는 32,768이나 65,536이면 됩니다.
- 모델을 다시 올립니다.
5060 Ti PC는 이 모델을 컨텍스트 131,072로 올려서 주력으로 쓰고 있습니다. 긴 문서를 넣을 일이 있어도 VRAM이 12.2GB라 3GB 넘게 남습니다.
답의 수준은 달라지나
속도 기능은 답을 쓰는 방법만 바꿉니다. 직접 확인한 범위는 아래와 같습니다.
| 테스트 | RTX 5090 (MTP 켜짐) | RTX 5060 Ti (MTP 꺼짐) |
|---|---|---|
| 산수, 생각 끔 | 5번 중 0번 정답 | 5번 중 1번 정답 |
| 산수, 생각 켬 | 5번 중 5번 정답 | 5번 중 5번 정답 |
| 없는 소설 줄거리 묻기 | 정보가 없다고 답함 | 확인되지 않는다고 답함 |
| 사진 설명 | 모래시계 두 개를 맞게 설명 | 모래시계 두 개를 맞게 설명 |
이 표가 뜻하는 것은, MTP가 켜졌는지와 상관없이 두 PC의 답이 같은 수준이었다는 점입니다. 산수는 "사과 24개짜리 3상자에서 19개를 먹고 5명이 나누면" 하는 문제이고 정답은 한 사람당 10개, 남는 것 3개입니다. 생각을 끄면 두 PC 모두 거의 틀렸고, 켜면 모두 맞았습니다. 이 모델로 계산을 시킬 때는 생각을 켜 두는 편이 좋습니다. 800자 글은 두 PC 모두 소제목과 문단을 갖춘 한국어 글이었고, 외국어가 섞인 부분은 보이지 않았습니다.
긴 글도 넣어 봤습니다. RTX 5090에서 15,000자 글을 요약하게 하면 첫 글자까지 1.2초, 100,000자 글은 8.9초였습니다. 사진 한 장을 설명할 때는 첫 글자까지 0.8초였습니다.
다른 곳의 측정과 견주면
llama.cpp에 Gemma 4 MTP 지원이 들어간 직후, 개발자 커뮤니티 DEV에 올라온 정리 글에는 RTX 4070 Super 12GB에서 Gemma 4 12B Q4가 약 140t/s였고 MTP로 2.5배 빨라졌다는 값이 있습니다. 그 글이 모은 사용자들의 값이고, 누가 어떤 설정으로 쟀는지는 적혀 있지 않습니다.
| 측정 | 그래픽카드 | 속도 | MTP 효과 | 조건 |
|---|---|---|---|---|
| 이 글 | RTX 5090 32GB | 232.9t/s | 약 1.6배 | QAT UD-Q4_K_XL, 초안 2개, 컨텍스트 262,144, 한국어 글 |
| 이 글 | RTX 5060 Ti 16GB | 약 94t/s | 약 1.8배 | 같은 파일, 초안 2개, 컨텍스트 지정 |
| DEV 정리 글(다른 사용자 측정) | RTX 4070 Super 12GB | 약 140t/s | 2.5배 | Q4, 권장 설정은 초안 4개·컨텍스트 32,768. 질문과 언어는 적혀 있지 않음 |
이 표가 뜻하는 것은, MTP 효과가 측정마다 1.6배에서 2.5배까지 다르다는 점입니다. 파일(QAT인지), 초안 개수, 질문 내용이 달라서 그대로 견줄 수는 없습니다. 5060 Ti의 94t/s가 4070 Super의 140t/s보다 낮은 이유도 이 글에서는 확인하지 못했습니다. 다만 이 글에서도 초안을 4개로 늘리면 2개일 때보다 조금 빨랐습니다(211.3 → 228.9t/s).
정리
- Unsloth Studio 기본값은 긴 컨텍스트를 먼저 잡고, VRAM이 남을 때만 MTP를 켭니다.
- 32GB에서는 둘 다 들어갑니다. Gemma 4 12B QAT는 기본값 그대로 약 233t/s였고, 손댈 것이 없었습니다.
- 16GB에서는 기본값이 MTP를 빼서 약 52t/s였습니다. Context Length를 숫자로 지정하면 약 94t/s가 됩니다.
- ngram 방식은 새 글을 쓰는 질문에서는 속도에 도움이 되지 않았습니다.
- 기본값으로 올렸는데 생각보다 느리다면, 실제로 어떤 속도 기능이 켜졌는지부터 확인해 보세요.
같은 현상은 다른 모델에서도 있었습니다. RTX 5060 Ti에서 잰 Qwen3.6 35B A3B도 기본값에서 MTP가 꺼졌고, 설정 화면에 MTP 보조 모델까지는 VRAM에 들어가지 않는다는 안내문이 나왔습니다. Gemma 4 26B A4B QAT는 16GB에서도 기본값으로 MTP가 켜졌는데, 이때는 컨텍스트가 8,192로 작게 잡혔습니다. 내 그래픽카드에 어떤 모델이 들어가는지는 GPU 체험에서 볼 수 있습니다.
이 글의 한계
- 모델 하나(Gemma 4 12B QAT, UD-Q4_K_XL)와 질문 하나(한국어 800자 글)로 잰 결과입니다. 코드처럼 반복이 많은 글에서는 ngram 방식의 결과가 다를 수 있습니다.
- 16GB에서 MTP가 빠진 이유(VRAM이 모자라서)는 실행 명령과 VRAM 사용량, Unsloth 이슈 기록을 보고 짐작한 것입니다. Unsloth Studio의 코드를 읽고 확인하지는 않았습니다.
- 두 PC의 측정 날짜가 이틀 다릅니다. 엔진 버전(llama.cpp b11160)은 같습니다.
- 기본값 속도(서버가 알려 준 값)와 컨텍스트별·설정별 속도(시간을 직접 잰 값)는 재는 방법이 다릅니다. 5090에서 7% 안팎 차이가 났습니다.
- 5060 Ti의 기본값 속도는 3번, 컨텍스트별 속도는 두 PC 모두 2번씩 잰 값입니다.
- MTP를 켠 답과 끈 답이 글자 하나까지 같은지는 확인하지 않았습니다.
- 전력과 온도는 이번에 재지 않았습니다.
- Unsloth Studio는 베타라서 기본값이 정해지는 방식이 바뀔 수 있습니다. 2026년 10월 6일 기준입니다.
자주 묻는 질문
지금 MTP가 켜졌는지 어떻게 확인하나요?
Run settings의 Speculative Decoding이 Auto이면 화면만으로는 알기 어렵습니다. 작업 관리자의 세부 정보 탭에 '명령줄' 열을 추가하고 llama-server.exe 줄을 보면 --spec-type 뒤에 draft-mtp(MTP) 또는 ngram-mod(ngram)가 적혀 있습니다. Speculative Decoding을 MTP로 직접 골라도 됩니다.
16GB 그래픽카드에서는 컨텍스트를 얼마로 잡으면 좋은가요?
이 모델은 32,768부터 262,144까지 속도가 거의 같았습니다(92.9~94.9t/s). 차이는 VRAM입니다. 32,768은 PC 전체 10.2GB, 131,072는 12.2GB였습니다. 다른 프로그램도 같이 쓴다면 32,768이나 65,536이 무난합니다.
32GB 그래픽카드에서도 컨텍스트를 줄이는 것이 좋은가요?
속도 때문이라면 줄일 필요가 없습니다. RTX 5090에서는 네 가지 컨텍스트 모두 246~253t/s였습니다. 영상이나 이미지 프로그램과 VRAM을 나눠 써야 할 때만 줄이면 됩니다. 32,768로 줄이면 4.5GB가 남습니다.
출처
- 모델 파일: unsloth/gemma-4-12B-it-qat-GGUF (Hugging Face)
- Unsloth 이슈 9550: Auto가 컨텍스트를 지키려고 MTP를 빼는 동작 (GitHub, 2026년 8월 23일)
- DEV Community: How to Get 2x Speed on Gemma 4 with Multi-Token Prediction in llama.cpp
댓글 0개