AI 테스트 RTX-5060TI 16GB

[RTX 5060 Ti 16GB] 16GB 그래픽카드에서 Gemma 4 26B는 얼마나 빠를까, Unsloth Studio 기본값으로 초당 94토큰이었다

2026년 10월 04일 6회 1시간 전
[RTX 5060 Ti 16GB] 16GB 그래픽카드에서 Gemma 4 26B는 얼마나 빠를까, Unsloth Studio 기본값으로 초당 94토큰이었다

구글의 Gemma 4 26B A4B QAT(unsloth UD-Q4_K_XL, 파일 13.27GB)를 RTX 5060 Ti 16GB PC의 Unsloth Studio에서 기본값(Auto) 그대로 돌려 봤습니다. 결론부터 적으면 초당 약 94토큰(t/s)이 나왔습니다. 같은 PC의 LM Studio에서 기본 설정으로 쟀을 때는 약 21t/s였습니다(87번 글, 파일은 Q4_0 15.63GB).

  • VRAM은 약 14.1GB를 썼습니다. 윈도우가 쓰는 몫까지 합치면 16GB 중 14.7GB라서 판정은 "제한적"입니다.
  • Auto는 컨텍스트를 8,192로 잡았습니다. 컨텍스트를 131,072까지 늘려도 로드는 됐지만 속도는 약 63t/s로 내려갔습니다.
  • 산수는 생각(Thinking)을 켜야 맞았습니다. 끄면 5번 모두 틀렸고, 켜면 5번 모두 맞았습니다.
  • 사진을 읽을 때는 첫 토큰까지 약 30초가 걸렸습니다. 이미지 입력용 파일을 CPU에 두기 때문입니다.

이 글의 숫자는 모두 이 PC에서 직접 잰 값입니다. 속도와 정답 수는 Unsloth Studio의 API로 재고, 화면 캡처와 영상은 측정이 끝난 뒤 따로 찍었습니다. 모델을 받아서 측정을 끝내기까지 2026년 10월 4일 하루에 했습니다.

Unsloth Studio에서 Gemma 4 26B A4B QAT가 800자 글을 다 쓴 화면, Worked for 15s, 초당 91.1토큰

생각을 켠 채 800자 글을 쓰게 한 화면입니다. 생각에 15초를 썼고, 답 아래에 초당 91.1토큰이 표시됩니다.

테스트 PC와 실행 프로그램

부품사양
GPUNVIDIA GeForce RTX 5060 Ti (VRAM 16GB, 전력 제한 180W)
GPU 연결PCIe 3.0 x8 (메인보드가 PCIe 3.0까지 지원)
CPUIntel Core i5-9400F (6코어 6스레드)
시스템 램DDR4 32GB (16GB × 2, 2666MT/s)
저장장치Crucial MX500 1TB SATA SSD
운영체제Windows 11 Pro
실행 프로그램Unsloth Studio 데스크톱(베타) 2026.9.14, llama.cpp b11160
측정 방법Unsloth Studio의 OpenAI 호환 API(127.0.0.1:8888)로 같은 질문을 반복해서 보냄. 속도는 첫 토큰이 나온 뒤부터 잰 생성 속도

이 블로그는 로컬 AI 테스트 프로그램을 LM Studio에서 Unsloth Studio로 바꿨습니다. 이유는 105번 글에 적었습니다. 테스트 PC 두 대의 사양과 측정 방법은 소개 페이지에 있습니다.

테스트한 모델: Gemma 4 26B A4B QAT

구글이 만든 Gemma 4 가운데 MoE(Mixture of Experts) 구조를 쓴 모델입니다. 전체 파라미터는 25.2B이지만, 토큰 하나를 만들 때는 익스퍼트 128개 중 8개와 공용 1개만 씁니다. 그래서 활성 파라미터는 약 4B이고, 이름의 A4B가 이 뜻입니다. QAT는 양자화(파일을 줄이는 것)를 미리 감안하고 학습시켰다는 뜻입니다.

항목내용
파라미터전체 25.2B, 활성 약 4B
구조MoE, 익스퍼트 128개 중 8개 + 공용 1개, 30레이어
받은 파일unsloth UD-Q4_K_XL 13.27GB
함께 받는 파일이미지 입력용 파일(mmproj) 1.11GB, MTP용 작은 모델 0.24GB. 합쳐서 14.62GB, 받는 데 약 3분
최대 컨텍스트262,144토큰
입력글, 이미지
라이선스Apache 2.0

아래는 구글이 모델 카드에 적은 벤치마크 점수입니다. 제작사가 직접 잰 값이고, 양자화하지 않은 원본 기준입니다.

벤치마크Gemma 4 12BGemma 4 26B A4BGemma 4 31B
MMLU Pro77.282.685.2
AIME 202677.588.389.2
LiveCodeBench v672.077.180.0
Codeforces165917182150

제작사 점수로는 26B A4B가 12B보다 모든 항목에서 높습니다. 이 PC에서 직접 낸 문제에서는 어땠는지는 아래 정리 절에서 비교합니다.

Unsloth Studio 모델 선택 창, On Device 목록에 gemma-4-26B-A4B-it-qat-GGUF UD-Q4_K_XL 26B 14GB와 gemma-4-12B-it-qat-GGUF 12B 6.7GB

모델 선택 창입니다. 받아 둔 Gemma 4 26B A4B QAT(14GB)와 12B QAT(6.7GB)가 보입니다. 눈 모양은 이미지를 읽을 수 있다는 표시입니다.

Unsloth Studio 기본값(Auto)은 어떻게 올렸나

모델 이름 옆의 설정을 열면 실행 설정 창이 나옵니다. 컨텍스트(모델이 한 번에 기억하는 글의 길이)는 기본이 Auto입니다. 예상 메모리가 GPU 22.68GiB, 전체 24.24GiB로 나오고 "Exceeds GPU memory"(GPU 메모리를 넘음)라는 경고가 붙습니다. 최대 컨텍스트 기준으로 계산한 값으로 보이며, Auto로 두면 VRAM에 맞게 컨텍스트를 줄여서 올립니다.

Unsloth Studio 실행 설정 창, Estimated Memory GPU 22.68GiB, Total 24.24GiB, Exceeds GPU memory 경고, Context Length Auto

실행 설정 창입니다. 예상 메모리가 VRAM을 넘는다고 경고하지만, Context Length가 Auto라서 그대로 로드됩니다.

Unsloth Studio 실행 설정의 고급 항목, KV Cache f16, Speculative Decoding Auto, Vision 켬, Reasoning Budget -1

고급 항목의 기본값입니다. KV 캐시 f16, Speculative Decoding Auto, Vision 켬, Reasoning Budget -1(제한 없음)입니다.

Auto로 올렸을 때 실제로 적용된 값은 이렇습니다.

설정Auto가 고른 값뜻
컨텍스트8,192한 번에 기억하는 토큰 수. 최대는 262,144
--fit on켬VRAM에 맞춰 올릴 양을 프로그램이 정함
--spec-type draft-mtpMTP 켬작은 보조 모델이 다음 토큰을 미리 예측해 속도를 높이는 기능(Speculative Decoding의 한 종류)
--no-mmproj-offload이미지 입력용 파일은 CPUVRAM을 아끼는 대신 사진을 읽는 시간이 길어짐
KV 캐시f16줄이지 않은 기본값

같은 PC에서 Gemma 4 12B QAT를 Auto로 올리면 컨텍스트는 262,144로 잡히고 MTP는 켜지지 않았습니다. 모델 크기에 따라 Auto가 고르는 값이 다릅니다.

Unsloth Studio 오른쪽 위에 Starting model, Loading cached model into memory 알림

모델을 고르면 오른쪽 위에 로드 중이라는 알림이 뜹니다.

Unsloth Studio에 gemma-4-26B-A4B-it-qat-GGUF UD-Q4_K_XL이 로드된 화면, 오른쪽 위 컨텍스트 8.2k

로드가 끝난 화면입니다. 오른쪽 위에 컨텍스트 8.2k가 표시됩니다.

VRAM: Auto에서 14.1GB

로드 직전과 직후의 GPU 메모리 차이를 쟀습니다. 로드 전에 윈도우와 다른 프로그램이 약 0.6GB를 쓰고 있었습니다.

컨텍스트모델이 쓴 VRAMPC 전체 VRAM로드 시간16GB에서
8,192 (Auto)14.1GB14.7GB24.4초제한적
32,76814.3GB14.9GB24.1초제한적
65,53614.2GB14.9GB26.4초제한적
131,07214.5GB15.1GB35.9초제한적

컨텍스트를 16배로 늘려도 VRAM은 0.4GB밖에 늘지 않았습니다. --fit on이 VRAM을 넘지 않게 맞추기 때문으로 보입니다(추정). 대신 아래 표처럼 속도가 내려갑니다. 어느 크기든 남는 VRAM이 2GB가 안 돼서 판정은 "제한적"입니다. 다른 GPU 작업과 같이 쓰기는 어렵습니다.

생성 속도: Auto에서 약 94t/s

"집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점"으로 800자 글을 쓰게 했습니다. 생각을 끈 것 3번, 켠 것 3번입니다.

생각생성 속도생각에 쓴 토큰답까지 걸린 시간
끔96.6 / 94.6 / 90.3 t/s06.6~8.2초
켬96.0 / 97.9 / 98.4 t/s약 1,090~1,24015.3~17.4초

생각을 켜도 속도는 같고, 생각하는 만큼 시간이 더 걸립니다. 800자 글 기준으로 약 9초가 더 들었습니다. 생각에 쓴 토큰 수는 프로그램이 따로 알려 주지 않아서 글자 수 비율로 어림한 값입니다.

Unsloth Studio에서 Gemma 4 26B A4B QAT가 800자 글을 쓰기 전에 생각하는 내용이 펼쳐져 보이는 화면

생각을 켜면 답을 쓰기 전에 생각하는 내용이 먼저 나옵니다.

컨텍스트를 늘리면 속도가 내려간다

컨텍스트만 바꿔 다시 로드하며 같은 800자 글을 쟀습니다(생각 끔 2번).

컨텍스트생성 속도 (생각 끔)생각 켬 800자 글15,000자 요약 TTFT사진 TTFT
8,192 (Auto)100 / 101 t/s17.8초4.2초29.9초
16,384100 / 99 t/s14.0초4.2초29.2초
32,76893 / 92 t/s19.0초4.6초30.5초
65,53682 / 79 t/s21.3초5.5초29.7초
131,07263 / 64 t/s21.3초6.9초29.7초

TTFT는 첫 토큰까지 걸린 시간입니다. 16,384까지는 속도가 같고, 32,768에서 약 8%, 131,072에서 약 37% 느려졌습니다. 긴 문서를 다룰 일이 없다면 Auto(8,192)나 16,384가 가장 빠릅니다. 긴 문서를 넣는다면 32,768이 속도를 크게 잃지 않는 선입니다.

화면에서 돌린 영상

새 채팅을 열고 질문 하나를 보낸 영상입니다(28초, 소리 없음).

이 영상의 속도는 초당 15토큰으로, 위 표의 숫자보다 훨씬 느립니다. 화면 녹화 프로그램이 CPU를 100% 가까이 쓰는 동안 찍었기 때문입니다. 이 PC의 CPU는 6코어입니다. 이 모델은 평소에도 GPU 사용률이 35~47%에 그쳐서, 일부 작업이 CPU에서 도는 것으로 보입니다(추정). 그래서 CPU가 바쁘면 속도가 크게 떨어집니다. 표의 숫자는 녹화하지 않을 때 잰 값입니다. 녹화에 쓴 프로그램은 103번 글에서 소개했습니다.

산수: 생각을 끄면 0/5, 켜면 5/5

"사과 한 상자에 24개가 들어 있습니다. 3상자를 사서 19개를 먹고, 남은 것을 5명이 똑같이 나누면 한 사람당 몇 개이고 몇 개가 남나요?"를 5번씩 물었습니다. 정답은 한 사람당 10개, 남는 것 3개입니다.

생각정답답걸린 시간
끔0 / 5"11개, 1개" 3번, "10개, 1개" 2번약 0.6초
켬5 / 5"10개, 3개" 5번2.5~3.8초 (생각 약 200~300토큰)

생각을 끄면 계산 과정 없이 바로 답을 적어서 틀립니다. 3초만 더 쓰면 맞히므로, 계산이 들어가는 질문에는 생각을 켜 두는 편이 낫습니다. LM Studio로 쟀을 때도 끔 0/5, 켬 5/5로 같았습니다.

Unsloth Studio에서 생각을 켜고 사과 문제를 물은 화면, 답 한 사람당 10개 남는 것 3개, 초당 100.7토큰

생각을 켠 답입니다. 3초 생각한 뒤 "한 사람당 10개, 남는 것 3개"로 맞혔습니다.

Unsloth Studio에서 생각을 끄고 사과 문제를 물은 화면, 답 한 사람당 11개 남는 것 1개, 초당 95.4토큰

생각을 끈 답입니다. "한 사람당 11개, 남는 것 1개"로 틀렸습니다.

코딩: 파이썬 8문제 중 6~7문제

파이썬 함수 8개를 짜게 하고, 숨겨 둔 테스트로 채점했습니다. 문제는 구간 합치기, 로마 숫자 변환, 수식 계산기, 가장 긴 회문, 다음 영업일, 많이 나온 낱말, 나선 순서, 한글 숫자를 정수로 바꾸기입니다. 컨텍스트는 Auto(8,192)입니다.

생각통과전체 시간틀린 문제
끔 (답 최대 2,000토큰)6 / 858초수식 계산기, 한글 숫자 (둘 다 2,000토큰 안에 못 끝냄)
켬 (최대 8,000토큰)7 / 84분 47초한글 숫자 (8,000토큰 안에 못 끝냄)

통과한 문제는 생각을 꺼도 2~3초에 답이 나왔습니다. 틀린 문제는 코드가 틀렸다기보다 답이 길어져서 정해 둔 토큰 안에 끝내지 못한 경우입니다. 직접 만든 8문제라서 다른 곳의 점수와 비교할 수는 없고, 같은 PC의 다른 모델과 비교하는 용도입니다.

Unsloth Studio의 API 요청 기록 화면, 요청마다 초당 81~87토큰과 답이 보이고 오른쪽에 나선 순서 문제의 질문과 답 코드

Unsloth Studio의 API 기록 화면입니다. 측정에 쓴 요청과 답, 속도가 하나씩 남습니다.

긴 글 요약과 긴 대화

컨텍스트 32,768로 올리고 이 블로그의 업데이트 기록을 넣어 세 문장으로 요약하게 했습니다(생각 끔).

넣은 글입력 토큰TTFT생성 속도결과
3,000자1,6071.8초82.7t/s번호 붙인 세 문장, 내용 맞음
15,000자7,9803.9초69.8t/s번호 붙인 세 문장, 내용 맞음

대화가 길어질 때를 보려고, 앞에 긴 글을 두고 한 문장짜리 질문을 붙였습니다.

앞에 쌓인 토큰TTFT생성 속도
1,1001.2초92.3t/s
8,4954.4초78.8t/s
20,8967.4초69.9t/s

2만 토큰이 쌓여도 첫 토큰까지 7.4초였습니다. LM Studio 기본 설정에서는 10만 자 요약의 첫 토큰까지 78초가 걸렸는데, 조건이 달라 바로 비교할 수는 없지만 기다리는 시간은 훨씬 짧았습니다.

긴 문서에서 정보 찾기: 5번 모두 찾음

약 1만 토큰짜리 글의 10%, 30%, 50%, 70%, 90% 위치에 "블로그 관리자가 키우는 고양이 보리차는 2019년에 태어났다"는 문장을 하나 숨기고, 고양이 이름과 태어난 해를 물었습니다. 5번 모두 "이름: 보리차, 태어난 해: 2019년"으로 답했습니다. 문장을 숨기지 않은 글에서는 "없음"이라고 답했습니다. 첫 토큰까지는 1.1~6.1초였습니다.

전력과 온도: 평균 약 60W, 최고 49도

800자 글을 쓰는 동안 0.5초마다 그래픽카드 상태를 읽었습니다(컨텍스트 32,768, 생각 끔).

항목값
쉬고 있을 때 전력약 11.5W
글 쓰는 동안 평균 전력60~62W
최고 전력78W
최고 온도48~49도
평균 GPU 사용률35~36%
토큰 하나에 쓴 전기약 0.75J

전력 제한 180W인 카드가 평균 60W만 썼습니다. GPU 사용률도 35% 안팎입니다. 활성 파라미터가 4B뿐인 MoE 구조라서 토큰 하나를 만들 때 GPU가 하는 계산이 적고, 나머지 시간은 CPU 쪽 작업을 기다리는 것으로 보입니다(추정). LM Studio로 쟀을 때도 GPU 사용률이 절반을 넘지 않았습니다.

없는 소설과 사진

실제로 없는 소설("윤서하의 2018년 장편소설 『푸른 등대의 겨울』")의 줄거리를 물었습니다. 그런 작품은 확인되지 않는다고 답했고, 줄거리를 지어내지 않았습니다.

Unsloth Studio에서 없는 소설의 줄거리를 묻자 Gemma 4 26B A4B QAT가 정보가 확인되지 않는다고 답한 화면, 초당 98.3토큰

없는 소설을 물은 화면입니다. 확인되지 않는다고 답하고, 실존하지 않는 작품일 수 있다고 적었습니다.

모래시계 두 개가 놓인 사진을 주고 무엇이 보이는지 물었습니다. 오른쪽 모래시계 안에 회로 기판이 들어 있다는 점까지 맞게 설명했습니다. 다만 첫 토큰까지 약 30초가 걸렸습니다. 이미지 입력용 파일을 CPU에 두는 설정(--no-mmproj-offload) 때문입니다. 같은 PC의 Gemma 4 12B QAT는 이 파일이 VRAM에 올라가서 약 1.2초였습니다.

Unsloth Studio에서 모래시계 두 개 사진을 붙여 넣고 설명을 받은 화면, 오른쪽 모래시계 안에 회로 기판이 있다고 답함, 초당 97.4토큰

사진을 붙여 넣고 물은 화면입니다. 설명은 맞았지만 답이 시작되기까지 약 30초를 기다려야 했습니다.

한국어 답 21개를 모두 확인했는데, 한자나 다른 나라 글자가 섞인 답은 없었습니다.

정리: 같은 PC의 Gemma 4 12B QAT와 비교

같은 날, 같은 프로그램(Unsloth Studio)으로 잰 Gemma 4 12B QAT(UD-Q4_K_XL)와 나란히 놓았습니다. 맨 오른쪽은 9월 29일에 LM Studio 기본 설정으로 잰 같은 모델의 다른 파일(Q4_0)입니다.

항목Gemma 4 26B A4B QAT (Unsloth)Gemma 4 12B QAT (Unsloth)Gemma 4 26B A4B QAT (LM Studio)
파일UD-Q4_K_XL 13.27GBUD-Q4_K_XL 6.26GBQ4_0 15.63GB
Auto(기본) 컨텍스트8,192262,1448,192
Auto(기본) 속도약 94t/s약 52t/s (MTP 꺼짐)약 21t/s
컨텍스트 32,768 속도약 92t/s92~96t/s (MTP 켜짐)-
컨텍스트 32,768 VRAM14.3GB9.6GB-
컨텍스트 131,07214.5GB, 약 63t/s11.5GB, 92~96t/s-
산수 (끔 / 켬)0/5, 5/51/5, 5/50/5, 5/5
코딩 8문제 (끔 / 켬)6/8, 7/86/8, 7/8-
사진 TTFT약 30초약 1.2초-
  • Unsloth Studio 기본값만으로 LM Studio 기본 설정보다 4배 넘게 빨랐습니다. 다만 파일이 다르고(13.27GB와 15.63GB), Unsloth Studio는 MTP를 켜고 VRAM을 14.1GB까지 썼습니다. LM Studio 때는 12.4GB였습니다. 프로그램 차이, 파일 차이, 설정 차이가 함께 들어 있는 숫자입니다.
  • 이 PC에서 낸 문제에서는 12B와 결과가 같았습니다. 산수와 코딩 8문제 통과 수가 거의 같습니다. 문제 수가 적어서 26B가 더 낫다는 것도, 같다는 것도 이 결과만으로 말하기는 어렵습니다. 제작사 벤치마크에서는 26B A4B가 더 높습니다.
  • 16GB에서는 12B가 쓰기 편합니다. 12B는 컨텍스트 131,072에서도 11.5GB에 속도가 그대로이고, 사진도 1초 남짓에 읽습니다. 26B A4B는 VRAM을 거의 다 쓰고, 컨텍스트를 늘리면 느려지고, 사진은 30초를 기다려야 합니다.
  • 26B A4B를 쓴다면 컨텍스트는 Auto나 32,768까지가 속도를 잃지 않는 선입니다.

16GB 그래픽카드에서 Gemma 4 12B를 처음 잰 결과는 82번 글에 있습니다. 내 그래픽카드에서 다른 모델이 어느 정도 속도로 도는지는 GPU 체험에서 볼 수 있습니다.

이 글의 한계

  • 2026년 10월 4일, Unsloth Studio 2026.9.14(llama.cpp b11160) 기준입니다. 베타 프로그램이라 버전이 바뀌면 Auto가 고르는 값과 속도가 달라질 수 있습니다.
  • 레이어 몇 개가 CPU로 갔는지는 확인하지 못했습니다. GPU 사용률이 35~47%였다는 것만 쟀습니다.
  • UD-Q4_K_XL 파일 하나만 쟀습니다. LM Studio 때의 Q4_0 파일을 Unsloth Studio에서 다시 재지는 않았습니다.
  • 컨텍스트 262,144, KV 캐시를 줄인 설정, 이미지 입력용 파일을 VRAM에 올리는 설정은 재지 않았습니다.
  • 코딩 문제는 직접 만든 8문제이고, 문제마다 한 번씩만 풀게 했습니다.
  • 생각에 쓴 토큰 수는 글자 수 비율로 어림한 값입니다.
  • 영상은 녹화 때문에 속도가 느리게 찍혔습니다. 녹화가 속도를 얼마나 떨어뜨리는지는 따로 재지 않았습니다.

자주 묻는 질문

RTX 5060 Ti 16GB에서 Gemma 4 26B A4B QAT는 몇 t/s인가요?

Unsloth Studio 기본값(Auto, 컨텍스트 8,192)에서 800자 글 기준 약 94t/s였습니다. 컨텍스트를 32,768로 늘리면 약 92t/s, 131,072로 늘리면 약 63t/s입니다.

VRAM은 얼마나 쓰나요?

모델이 약 14.1GB를 썼고, 윈도우가 쓰는 몫까지 합치면 16GB 중 14.7GB였습니다. 컨텍스트를 131,072로 늘려도 15.1GB로 로드는 됩니다. 다만 다른 GPU 작업과 같이 쓰기는 어렵습니다.

16GB 그래픽카드에서는 Gemma 4 12B와 26B A4B 중 무엇이 낫나요?

이 PC에서 낸 산수와 코딩 문제에서는 결과가 거의 같았고, 속도도 비슷했습니다. 12B는 VRAM이 4GB 넘게 남고 사진도 빨리 읽어서 16GB에서는 쓰기 편합니다. 제작사 벤치마크 점수는 26B A4B가 더 높습니다.

사진을 읽을 때 왜 30초나 걸리나요?

Unsloth Studio가 이 모델을 올릴 때 이미지 입력용 파일(mmproj)을 CPU에 두기 때문입니다. VRAM을 아끼려는 설정입니다. 사진을 읽은 뒤 답을 쓰는 속도는 글만 물을 때와 같습니다.

출처

관련 게시글

댓글 0개