AI 테스트 RTX-5090

[RTX 5090 32GB] 로컬 AI Gemma 4 12B, Unsloth 기본값이면 충분할까, 32GB는 초당 233토큰인데 16GB는 52토큰이었다

2026년 10월 06일 9회 2시간 전
[RTX 5090 32GB] 로컬 AI Gemma 4 12B, Unsloth 기본값이면 충분할까, 32GB는 초당 233토큰인데 16GB는 52토큰이었다

Unsloth Studio는 모델을 올릴 때 설정을 알아서 정해 주는 기본값(Auto)이 있습니다. 구글의 Gemma 4 12B QAT(UD-Q4_K_XL, 파일 6.72GB)를 RTX 5090 32GB와 RTX 5060 Ti 16GB에서 똑같이 기본값으로 올려 봤습니다. 결론부터 적으면 같은 기본값인데 두 PC에서 켜진 속도 기능이 달랐습니다.

  • RTX 5090 32GB는 MTP가 켜졌습니다. 한국어 800자 글을 초당 232.9토큰(t/s)으로 썼습니다. 같은 질문을 5번 잰 평균이고, 범위는 230.9~234.2입니다. 글 하나가 약 3초에 나옵니다.
  • RTX 5060 Ti 16GB는 MTP가 꺼졌습니다. 약 52t/s였고, 글 하나에 약 13초가 걸렸습니다.
  • 16GB에서는 컨텍스트를 숫자로 지정하기만 해도 MTP가 켜졌습니다. 속도가 약 94t/s로 1.8배가 됐습니다.
  • 5090에서 MTP를 일부러 끄면 약 135t/s였습니다. MTP가 속도를 약 1.6배로 올려 줍니다.
  • 답의 수준은 두 PC가 같았습니다. 산수 문제는 두 PC 모두 생각을 켜면 5번 중 5번 맞았습니다.

이 글의 숫자는 두 PC에서 직접 잰 값입니다. 5060 Ti는 2026년 10월 4일에, 5090은 10월 6일에 같은 스크립트로 쟀습니다. 속도는 Unsloth Studio의 API로 재고, 화면 캡처는 측정이 끝난 뒤 따로 찍었습니다.

이 글의 결과를 20초로 요약한 영상입니다(소리 없음). 화면 녹화가 아니라 HTML로 장면을 짜서 영상으로 만드는 도구 hyperframes로 만들었습니다.

같은 모델을 기본값으로 올린 결과 비교. RTX 5060 Ti 16GB는 ngram 방식으로 52.4t/s, RTX 5090 32GB는 MTP가 켜져 232.9t/s

두 PC 모두 컨텍스트는 최대값 262,144로 잡혔습니다. 다른 것은 속도 기능입니다.

RTX 5090에서 같은 질문을 보낸 두 화면을 나란히 붙였습니다(7.5초, 소리 없음, 생각 끔). 왼쪽(MTP 켜짐)은 약 3.5초, 오른쪽(MTP 끔)은 약 5.4초에 글이 끝납니다. 화면에 표시된 속도는 222.5t/s와 131.7t/s였습니다. 답은 모델이 쓴 내용입니다.

MTP와 ngram은 무엇인가

둘 다 답을 더 빨리 쓰게 하는 기능입니다. Unsloth Studio 설정 화면에서는 Speculative Decoding이라는 이름으로 묶여 있습니다.

  • MTP(Multi-Token Prediction): 작은 보조 모델이 다음 토큰 몇 개를 미리 써 두고, 원래 모델이 그것을 한 번에 검사합니다. 맞으면 그대로 쓰고, 틀리면 원래 모델이 다시 씁니다. 아래 출처의 DEV 정리 글은 이렇게 해도 답이 달라지지 않는다고 설명합니다. Gemma 4 12B는 보조 모델 파일(mtp-gemma-4-12B-it.gguf, 0.25GB)이 따로 있습니다.
  • ngram 방식: 보조 모델 없이, 앞에 나온 글에서 같은 낱말 순서가 반복되면 그대로 이어 붙입니다. 코드를 조금만 고쳐 다시 쓰는 일처럼 같은 내용이 반복될 때 도움이 됩니다. 새 글을 쓸 때는 반복되는 부분이 적습니다.

MTP는 보조 모델과 그 작업 공간만큼 VRAM을 더 씁니다. 이 모델에서는 약 0.9GB였습니다(5090에서 켠 것과 끈 것의 차이).

테스트 PC와 실행 프로그램

항목RTX 5090 PCRTX 5060 Ti PC
GPURTX 5090 (VRAM 32GB)RTX 5060 Ti (VRAM 16GB)
CPUIntel Core Ultra 9 285KIntel Core i5-9400F
시스템 램64GBDDR4 32GB
GPU 드라이버616.92616.92
실행 프로그램Unsloth Studio 데스크톱 0.1.902-betaUnsloth Studio 데스크톱(베타)
엔진llama.cpp b11160 (Unsloth가 빌드한 것)llama.cpp b11160 (Unsloth가 빌드한 것)
측정 날짜2026년 10월 6일2026년 10월 4일

모델 파일은 두 PC 모두 unsloth/gemma-4-12B-it-qat-GGUF의 UD-Q4_K_XL(6.72GB)입니다. 사진을 읽는 파일(mmproj-F16, 0.18GB)과 MTP 보조 모델(0.25GB)이 함께 받아집니다. 라이선스는 Apache 2.0입니다. 질문은 "집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점"을 주제로 800자 글을 쓰게 하는 것이고, 샘플링은 프로그램 기본값입니다. 테스트 PC 두 대의 사양은 소개 페이지에, Unsloth Studio를 쓰는 이유는 105번 글에 있습니다.

기본값으로 올리면 무엇이 정해지나

모델만 고르고 다른 값은 건드리지 않았습니다. Unsloth Studio가 실제로 실행한 llama.cpp 명령을 읽어서 표로 옮겼습니다.

항목RTX 5090 32GBRTX 5060 Ti 16GB
컨텍스트262,144262,144
속도 기능MTP (--spec-type draft-mtp, 초안 2개)ngram (--spec-type ngram-mod)
GPU에 올린 레이어전부전부
모델이 쓴 VRAM14.4GB13.2GB
PC 전체 VRAM16.2GB (32GB 중)13.8GB (16GB 중)
처음 올리는 시간23.6초32.6초
다시 올리는 시간7.4초약 10초

이 표가 뜻하는 것은, 기본값이 두 PC에서 컨텍스트는 똑같이 최대로 잡고, 속도 기능만 다르게 골랐다는 점입니다. 16GB에서는 최대 컨텍스트만으로 13.8GB가 찼습니다. 여기에 MTP가 쓸 0.9GB가량을 더하면 남는 VRAM이 1GB 남짓입니다. 그래서 MTP가 빠진 것으로 보입니다(추정).

Unsloth Studio의 Run settings 화면. Context Length Auto, Speculative Decoding Auto, 예상 GPU 메모리 13.96GiB

RTX 5090에서 기본값으로 올린 뒤의 설정 화면입니다. 컨텍스트와 속도 기능이 모두 Auto입니다.

Unsloth Studio 모델 목록에 gemma-4-12B-it-qat-GGUF가 Loaded로 표시되고 오른쪽 위에 262.1k가 보이는 화면

모델 이름 옆에 올라간 상태(Loaded)가 보이고, 오른쪽 위 숫자가 잡힌 컨텍스트(262.1k)입니다.

Unsloth 저장소의 이슈 기록에도 같은 동작이 나옵니다. 2026년 8월에 올라온 이슈의 로그에는 Auto가 속도 기능을 위해 컨텍스트를 줄이지 않는다는 문구가 있습니다. 다시 말해 기본값은 긴 컨텍스트를 먼저 지키고, 남는 VRAM이 있을 때만 MTP를 켭니다. 오류가 아니라 프로그램이 정한 순서입니다.

RTX 5090: 기본값 그대로 초당 233토큰

같은 질문을 5번 보냈습니다.

순서속도쓴 토큰걸린 시간
1231.8t/s6333.2초
2234.1t/s6293.0초
3230.9t/s6593.2초
4234.2t/s6563.1초
5233.5t/s6052.9초
평균232.9t/s약 3초

이 표가 뜻하는 것은, 다섯 번의 차이가 3t/s 안쪽이라 값이 일정하다는 점입니다. 첫 글자는 0.3~0.4초 만에 나왔습니다. 생각(Thinking)을 켜면 생각에 약 1,000~1,200토큰을 더 써서 6.5~7.6초가 걸렸고, 속도는 229~232t/s로 같았습니다. 시스템 램은 모델을 올리기 전 20.8GB에서 23.3GB로 2.5GB 늘었습니다.

Unsloth Studio에서 Gemma 4 12B QAT가 800자 글을 다 쓴 화면. 답 아래에 226.3 tok/s 표시

기본값(MTP 켜짐)으로, 생각을 켠 채 800자 글을 쓰게 한 화면입니다. 답 아래에 초당 226.3토큰이 보입니다. 화면을 찍는 동안에는 표의 값보다 조금 낮게 나옵니다.

RTX 5090에서 속도 기능을 바꿔 보면

기본값에서 속도 기능 하나만 바꿔 가며 쟀습니다. 설정마다 3번씩, 두 차례 돌려 모두 6번입니다.

설정평균 속도범위모델이 쓴 VRAM
기본값 (MTP, 초안 2개)211.3t/s187.6~232.214.4GB
MTP, 초안 4개228.9t/s210.6~254.614.4GB
ngram 방식133.3t/s126.9~141.413.5GB
속도 기능 끔134.6t/s126.2~143.013.5GB

이 표가 뜻하는 것은 두 가지입니다. 첫째, MTP를 켜면 끈 것보다 약 1.6배 빠릅니다. 둘째, ngram 방식은 끈 것과 차이가 없었습니다. 새 글을 쓰는 질문이라 반복되는 낱말 순서가 거의 없었기 때문으로 보입니다. 그러니 5060 Ti의 기본값(ngram)은 이 질문에서는 속도 기능이 없는 것과 같습니다.

이 표의 기본값(211.3t/s)은 위 절의 232.9t/s보다 낮습니다. 재는 스크립트가 달라서입니다. 위 절은 서버가 알려 준 생성 속도이고, 이 표는 첫 글자가 나온 뒤부터 끝까지의 시간으로 직접 나눈 값입니다. 그래서 이 표는 표 안의 설정끼리만 비교해 주세요.

RTX 5090에서 속도 기능별 속도. 기본값 MTP 211.3, MTP 초안 4개 228.9, ngram 133.3, 끔 134.6t/s

막대가 길수록 빠릅니다. ngram 방식과 끈 것은 막대 길이가 거의 같습니다.

MTP를 끄고 같은 질문을 다시 보낸 화면. 답 아래에 139.1 tok/s 표시

속도 기능을 끄고, 생각을 켠 채 같은 질문을 다시 보낸 화면입니다. 초당 139.1토큰으로 내려갔습니다.

Speculative Decoding 메뉴를 연 화면. Auto, MTP, DSpark, DFlash, Ngram, MTP+Ngram, Off 항목

속도 기능은 Run settings의 Speculative Decoding에서 고릅니다. Advanced settings를 켜야 보입니다.

RTX 5060 Ti: 컨텍스트만 지정해도 MTP가 켜진다

16GB에서 기본값이 느렸던 것은 MTP가 꺼져서였습니다. 그런데 MTP를 직접 켜지 않고 컨텍스트를 숫자로 지정하기만 해도 MTP가 켜졌습니다. 두 PC에서 같은 스크립트로 네 가지 컨텍스트를 쟀습니다.

지정한 컨텍스트5060 Ti 속도5060 Ti PC 전체 VRAM5090 속도5090 PC 전체 VRAM
32,76894.2t/s10.2GB247.9t/s11.7GB
65,53694.9t/s10.9GB245.9t/s12.3GB
131,07294.1t/s12.2GB252.8t/s13.6GB
262,14492.9t/s14.4GB250.3t/s16.2GB
지정 안 함 (기본값)52.4t/s13.8GB232.9t/s16.2GB

이 표가 뜻하는 것은 세 가지입니다.

  • 16GB에서는 컨텍스트를 지정하면 52t/s에서 약 94t/s가 됩니다. 800자 글 하나가 약 13초에서 약 7초로 줄어듭니다.
  • 최대 컨텍스트 262,144를 직접 지정해도 MTP가 켜졌습니다. 이때는 프로그램이 사진을 읽는 부분을 그래픽카드가 아니라 CPU에 올렸습니다(--no-mmproj-offload). VRAM 자리를 그렇게 마련한 것입니다. PC 전체 VRAM은 14.4GB로 16GB에 가깝습니다.
  • 32GB에서는 컨텍스트를 줄여도 빨라지지 않습니다. VRAM만 4.5GB 줄어듭니다.

기본값 줄의 5060 Ti 값(52.4t/s)과 5090 값(232.9t/s)은 서버가 알려 준 속도이고, 나머지 줄은 시간을 직접 재서 나눈 값입니다. 5090에서 두 방법의 차이는 7% 안팎이었습니다. 52와 94의 차이는 그보다 훨씬 큽니다.

컨텍스트를 지정했을 때 두 PC의 VRAM과 속도 표. 5060 Ti는 92.9~94.9t/s, 5090은 245.9~252.8t/s

컨텍스트를 숫자로 지정한 네 경우 모두 두 PC에서 MTP가 켜졌습니다.

16GB에서는 어떻게 설정하면 되나

  1. 채팅 화면 오른쪽 위의 버튼으로 Run settings를 엽니다.
  2. Context Length를 Auto에서 숫자로 바꿉니다. 보통의 글쓰기와 요약에는 32,768이나 65,536이면 됩니다.
  3. 모델을 다시 올립니다.

5060 Ti PC는 이 모델을 컨텍스트 131,072로 올려서 주력으로 쓰고 있습니다. 긴 문서를 넣을 일이 있어도 VRAM이 12.2GB라 3GB 넘게 남습니다.

답의 수준은 달라지나

속도 기능은 답을 쓰는 방법만 바꿉니다. 직접 확인한 범위는 아래와 같습니다.

테스트RTX 5090 (MTP 켜짐)RTX 5060 Ti (MTP 꺼짐)
산수, 생각 끔5번 중 0번 정답5번 중 1번 정답
산수, 생각 켬5번 중 5번 정답5번 중 5번 정답
없는 소설 줄거리 묻기정보가 없다고 답함확인되지 않는다고 답함
사진 설명모래시계 두 개를 맞게 설명모래시계 두 개를 맞게 설명

이 표가 뜻하는 것은, MTP가 켜졌는지와 상관없이 두 PC의 답이 같은 수준이었다는 점입니다. 산수는 "사과 24개짜리 3상자에서 19개를 먹고 5명이 나누면" 하는 문제이고 정답은 한 사람당 10개, 남는 것 3개입니다. 생각을 끄면 두 PC 모두 거의 틀렸고, 켜면 모두 맞았습니다. 이 모델로 계산을 시킬 때는 생각을 켜 두는 편이 좋습니다. 800자 글은 두 PC 모두 소제목과 문단을 갖춘 한국어 글이었고, 외국어가 섞인 부분은 보이지 않았습니다.

긴 글도 넣어 봤습니다. RTX 5090에서 15,000자 글을 요약하게 하면 첫 글자까지 1.2초, 100,000자 글은 8.9초였습니다. 사진 한 장을 설명할 때는 첫 글자까지 0.8초였습니다.

다른 곳의 측정과 견주면

llama.cpp에 Gemma 4 MTP 지원이 들어간 직후, 개발자 커뮤니티 DEV에 올라온 정리 글에는 RTX 4070 Super 12GB에서 Gemma 4 12B Q4가 약 140t/s였고 MTP로 2.5배 빨라졌다는 값이 있습니다. 그 글이 모은 사용자들의 값이고, 누가 어떤 설정으로 쟀는지는 적혀 있지 않습니다.

측정그래픽카드속도MTP 효과조건
이 글RTX 5090 32GB232.9t/s약 1.6배QAT UD-Q4_K_XL, 초안 2개, 컨텍스트 262,144, 한국어 글
이 글RTX 5060 Ti 16GB약 94t/s약 1.8배같은 파일, 초안 2개, 컨텍스트 지정
DEV 정리 글(다른 사용자 측정)RTX 4070 Super 12GB약 140t/s2.5배Q4, 권장 설정은 초안 4개·컨텍스트 32,768. 질문과 언어는 적혀 있지 않음

이 표가 뜻하는 것은, MTP 효과가 측정마다 1.6배에서 2.5배까지 다르다는 점입니다. 파일(QAT인지), 초안 개수, 질문 내용이 달라서 그대로 견줄 수는 없습니다. 5060 Ti의 94t/s가 4070 Super의 140t/s보다 낮은 이유도 이 글에서는 확인하지 못했습니다. 다만 이 글에서도 초안을 4개로 늘리면 2개일 때보다 조금 빨랐습니다(211.3 → 228.9t/s).

정리

  • Unsloth Studio 기본값은 긴 컨텍스트를 먼저 잡고, VRAM이 남을 때만 MTP를 켭니다.
  • 32GB에서는 둘 다 들어갑니다. Gemma 4 12B QAT는 기본값 그대로 약 233t/s였고, 손댈 것이 없었습니다.
  • 16GB에서는 기본값이 MTP를 빼서 약 52t/s였습니다. Context Length를 숫자로 지정하면 약 94t/s가 됩니다.
  • ngram 방식은 새 글을 쓰는 질문에서는 속도에 도움이 되지 않았습니다.
  • 기본값으로 올렸는데 생각보다 느리다면, 실제로 어떤 속도 기능이 켜졌는지부터 확인해 보세요.

같은 현상은 다른 모델에서도 있었습니다. RTX 5060 Ti에서 잰 Qwen3.6 35B A3B도 기본값에서 MTP가 꺼졌고, 설정 화면에 MTP 보조 모델까지는 VRAM에 들어가지 않는다는 안내문이 나왔습니다. Gemma 4 26B A4B QAT는 16GB에서도 기본값으로 MTP가 켜졌는데, 이때는 컨텍스트가 8,192로 작게 잡혔습니다. 내 그래픽카드에 어떤 모델이 들어가는지는 GPU 체험에서 볼 수 있습니다.

이 글의 한계

  • 모델 하나(Gemma 4 12B QAT, UD-Q4_K_XL)와 질문 하나(한국어 800자 글)로 잰 결과입니다. 코드처럼 반복이 많은 글에서는 ngram 방식의 결과가 다를 수 있습니다.
  • 16GB에서 MTP가 빠진 이유(VRAM이 모자라서)는 실행 명령과 VRAM 사용량, Unsloth 이슈 기록을 보고 짐작한 것입니다. Unsloth Studio의 코드를 읽고 확인하지는 않았습니다.
  • 두 PC의 측정 날짜가 이틀 다릅니다. 엔진 버전(llama.cpp b11160)은 같습니다.
  • 기본값 속도(서버가 알려 준 값)와 컨텍스트별·설정별 속도(시간을 직접 잰 값)는 재는 방법이 다릅니다. 5090에서 7% 안팎 차이가 났습니다.
  • 5060 Ti의 기본값 속도는 3번, 컨텍스트별 속도는 두 PC 모두 2번씩 잰 값입니다.
  • MTP를 켠 답과 끈 답이 글자 하나까지 같은지는 확인하지 않았습니다.
  • 전력과 온도는 이번에 재지 않았습니다.
  • Unsloth Studio는 베타라서 기본값이 정해지는 방식이 바뀔 수 있습니다. 2026년 10월 6일 기준입니다.

자주 묻는 질문

지금 MTP가 켜졌는지 어떻게 확인하나요?

Run settings의 Speculative Decoding이 Auto이면 화면만으로는 알기 어렵습니다. 작업 관리자의 세부 정보 탭에 '명령줄' 열을 추가하고 llama-server.exe 줄을 보면 --spec-type 뒤에 draft-mtp(MTP) 또는 ngram-mod(ngram)가 적혀 있습니다. Speculative Decoding을 MTP로 직접 골라도 됩니다.

16GB 그래픽카드에서는 컨텍스트를 얼마로 잡으면 좋은가요?

이 모델은 32,768부터 262,144까지 속도가 거의 같았습니다(92.9~94.9t/s). 차이는 VRAM입니다. 32,768은 PC 전체 10.2GB, 131,072는 12.2GB였습니다. 다른 프로그램도 같이 쓴다면 32,768이나 65,536이 무난합니다.

32GB 그래픽카드에서도 컨텍스트를 줄이는 것이 좋은가요?

속도 때문이라면 줄일 필요가 없습니다. RTX 5090에서는 네 가지 컨텍스트 모두 246~253t/s였습니다. 영상이나 이미지 프로그램과 VRAM을 나눠 써야 할 때만 줄이면 됩니다. 32,768로 줄이면 4.5GB가 남습니다.

출처

관련 게시글

댓글 0개