AI 테스트 RTX-5060TI 16GB

[RTX 5060 Ti 16GB] 로컬 AI Gemma 4 E2B, 가장 작은 모델은 얼마나 쓸 만할까, VRAM 3.6GB에 초당 197토큰이었다

2026년 10월 10일 2회 7시간 전
[RTX 5060 Ti 16GB] 로컬 AI Gemma 4 E2B, 가장 작은 모델은 얼마나 쓸 만할까, VRAM 3.6GB에 초당 197토큰이었다

구글의 가장 작은 Gemma 4 모델인 Gemma 4 E2B(unsloth의 QAT UD-Q4_K_XL, 파일 2.44GB)를 RTX 5060 Ti 16GB PC의 Unsloth Studio에서 기본값(Auto) 그대로 돌려 봤습니다. 결론부터 적으면 VRAM 약 3.6GB만 쓰고 초당 약 197토큰(t/s)이 나왔고, 컨텍스트를 최대(131,072)로 올려도 속도가 그대로였습니다. 같은 질문을 5번 잰 평균이 197.5t/s(최소 194.9, 최대 200.4)입니다.

  • 기본값이 곧 최대 컨텍스트였습니다. Auto가 컨텍스트를 131,072로 잡고 MTP도 켰습니다. 16GB 그래픽카드에서 VRAM은 11GB 넘게 남습니다.
  • 생각(Thinking)을 켜도 빠릅니다. 800자 글 하나가 생각 끔 약 4초, 켬 약 8초였습니다. 산수는 생각을 끄면 5번 모두 틀리고, 켜면 5번 모두 맞았습니다(1~2초).
  • 없는 소설을 지어내지 않았습니다. 2번 물어 2번 모두 모른다고 답했습니다.
  • 파이썬 8문제는 3번 풀어 24개 중 16개를 통과했습니다. 생각을 켜도 16개로 같았습니다.
  • 사진은 0.4초 만에 읽기 시작하지만, 자세히 보지는 못했습니다. 사진 속 물건의 특징을 맞게 말한 것은 8번 중 1번이었습니다.

이 글의 결과를 20초로 요약한 영상입니다(소리 없음).

이 글의 숫자는 모두 이 PC에서 직접 잰 값입니다. 속도와 정답 수는 Unsloth Studio의 API로 재고, 화면 캡처와 영상은 측정이 끝난 뒤 따로 찍었습니다. 측정은 2026년 10월 9일에 했습니다. 같은 PC에서 잰 Qwen3-Coder 30B A3B, Gemma 4 26B A4B QAT와 견줍니다.

Unsloth Studio에서 Gemma 4 E2B가 800자 글을 다 쓴 화면, 소제목과 목록이 있는 글의 끝부분과 마무리 문단, 답 아래에 초당 191.6토큰

생각을 켠 채(앱 기본값) 800자 글을 쓰게 한 화면입니다. 답 아래에 초당 191.6토큰이 표시됩니다.

테스트 PC와 실행 프로그램

항목내용
GPUNVIDIA GeForce RTX 5060 Ti (VRAM 16GB, 전력 제한 180W)
GPU 연결PCIe 3.0 x8 (메인보드가 PCIe 3.0까지 지원)
CPUIntel Core i5-9400F (6코어 6스레드)
시스템 램DDR4 32GB (16GB × 2, 2666MT/s)
저장장치Crucial MX500 1TB SATA SSD
운영체제Windows 11 Pro, 전원 구성표 균형 조정
실행 프로그램Unsloth Studio 데스크톱(베타) 2026.9.14
엔진llama.cpp 0.5.0-dev (build 11160, commit a3c12db9d, Unsloth가 빌드한 것)
GPU 드라이버617.42
측정 방법Unsloth Studio의 OpenAI 호환 API(127.0.0.1:8888)로 같은 질문을 반복해서 보냄. 속도는 첫 토큰이 나온 뒤부터 잰 생성 속도
측정 스크립트Python 3.14.3, requests 2.34.2, psutil 7.2.2
샘플링따로 지정하지 않음(프로그램 기본값)
측정 날짜2026년 10월 9일

테스트 PC 두 대의 사양과 측정 방법은 소개 페이지에 있습니다. 로컬 AI를 처음 써 본다면 로컬 AI 시작하기 1편부터 보면 됩니다.

테스트한 모델: Gemma 4 E2B

구글이 2026년에 공개한 Gemma 4 가운데 가장 작은 모델입니다. 이름의 E는 "실효(effective)" 파라미터를 뜻합니다. 임베딩까지 합친 전체 파라미터는 5.1B이지만, 계산에 실제로 쓰는 파라미터는 2.3B라는 뜻입니다. unsloth 저장소에는 휴대폰용 파일도 따로 올라와 있습니다.

항목내용
파라미터실효 2.3B (임베딩 포함 5.1B)
구조35레이어. 층마다 작은 임베딩을 따로 두는 방식(Per-Layer Embeddings)
받은 파일unsloth/gemma-4-E2B-it-qat-GGUF의 UD-Q4_K_XL 2.44GB (4비트, QAT)
함께 받은 파일이미지 입력용 파일(mmproj) 0.92GB, MTP용 파일 0.06GB. 합쳐서 3.41GB, 받는 데 49초
최대 컨텍스트모델 카드 128K, Unsloth Studio에서 131,072토큰
입력글, 사진, 소리(30초까지). 영상은 장면을 나눠서
생각(Thinking)있음. 켜고 끌 수 있음
라이선스Apache 2.0

QAT는 양자화(파일을 줄이는 것)를 미리 염두에 두고 학습시킨 파일이라는 뜻입니다. 같은 4비트라도 줄인 뒤의 품질 손실이 적다고 알려져 있습니다. 이 글에서는 QAT 파일과 일반 4비트 파일의 품질 차이를 따로 재지 않았습니다.

아래는 구글이 모델 카드에 적은 벤치마크 점수입니다. 제작사가 직접 잰 값이고, 양자화하지 않은 원본 기준입니다.

벤치마크Gemma 4 E2BGemma 4 E4BGemma 4 12B
MMLU Pro60.0%69.4%77.2%
AIME 2026 (도구 없이)37.5%42.5%77.5%
LiveCodeBench v644.0%52.0%72.0%
GPQA Diamond43.4%58.6%78.8%
MMMU Pro (사진 이해)44.2%52.6%69.1%

제작사 점수로는 12B와 차이가 큽니다. 특히 수학(AIME)과 코딩(LiveCodeBench)에서 12B의 절반에서 60% 수준입니다. 작은 만큼 빠르고 가볍지만, 어려운 문제에서는 큰 모델을 따라가지 못한다는 뜻입니다.

Unsloth Studio 모델 선택 창, On Device 목록에 gemma-4-E2B-it-qat-GGUF UD-Q4_K_XL 2.6GB와 gemma-4-12B-it-qat-GGUF 12B 6.7GB

모델 선택 창입니다. 받아 둔 Gemma 4 E2B(2.6GB)가 맨 위에 보입니다.

Unsloth Studio 기본값(Auto)은 어떻게 올렸나

실행 설정 창에서 컨텍스트(모델이 한 번에 기억하는 글의 길이)를 기본값인 Auto로 두고 올렸습니다. 예상 메모리는 GPU 5.06GiB, 전체 5.81GiB로 나옵니다. 큰 모델을 올릴 때 붙던 "GPU 메모리를 넘는다"는 경고가 없습니다.

Unsloth Studio 실행 설정 창, Estimated Memory GPU 5.06GiB, Total 5.81GiB, Context Length Auto, 최대 131,072

실행 설정 창입니다. 예상 메모리 5.06GiB에 경고가 없고, 컨텍스트는 Auto입니다.

설정Auto가 고른 값뜻
컨텍스트131,072이 모델의 최대값. VRAM이 넉넉해서 줄이지 않음
-ngl -1 --fit off레이어를 모두 GPU에모델 전체를 그래픽카드에 올림
--spec-type draft-mtpMTP 켬작은 보조 모델이 다음 토큰을 미리 예측해 속도를 높이는 기능
이미지 입력용 파일GPU에 올림사진을 바로 읽을 수 있음
KV 캐시f16줄이지 않은 기본값

같은 PC에서 잰 큰 모델들은 Auto가 컨텍스트를 약 8천 토큰으로 줄이거나 MTP를 껐습니다(Qwen3.6 35B A3B, Qwen3-Coder 30B A3B). Gemma 4 E2B는 16GB에서 아무것도 줄이지 않고 올라갑니다. 설정을 손댈 일이 없는 모델입니다.

Unsloth Studio 실행 설정의 고급 항목, KV Cache Dtype f16, Speculative Decoding Auto, Parallel Slots auto, Vision 켬

고급 항목의 기본값입니다. KV 캐시 f16, Speculative Decoding Auto, Vision 켬입니다.

Unsloth Studio에 gemma-4-E2B-it-qat-GGUF UD-Q4_K_XL이 로드된 화면, 오른쪽 위 컨텍스트 131.1k, 입력칸에 Thinking 표시

로드가 끝난 화면입니다. 오른쪽 위에 컨텍스트 131.1k가 보이고, 입력칸에 Thinking(생각)이 켜져 있습니다.

VRAM과 시스템 램: 최대 컨텍스트에서도 VRAM 3.6GB

로드 직전과 직후의 GPU 메모리와 PC 전체 램의 차이를 쟀습니다. 로드 전에 윈도우와 다른 프로그램이 VRAM 약 0.6GB, 램 약 9.5GB를 쓰고 있었습니다.

컨텍스트모델이 쓴 VRAMPC 전체 VRAM늘어난 시스템 램로드 시간16GB에서
8,1922.7GB3.3GB--원활
32,7682.9GB3.5GB2.1GB9.3초원활
65,5363.2GB3.7GB2.2GB9.4초원활
131,072 (Auto, 최대)3.6GB4.3GB2.3GB처음 34.4초, 다시 로드 9.4초원활 (남는 VRAM 약 11.6GB)

컨텍스트를 8,192에서 131,072로 16배 늘려도 VRAM은 0.9GB만 늘었습니다. 최대 컨텍스트에서 PC 전체 VRAM이 4.3GB라서, 8GB 그래픽카드에서도 최대 컨텍스트로 돌릴 수 있는 크기입니다(8GB 카드에서 직접 재지는 않았습니다). 16GB에서는 이 모델을 올려 둔 채 이미지 생성 같은 다른 GPU 작업을 함께 돌릴 자리가 남습니다.

API로 컨텍스트 262,144를 요청해 봤는데, 131,072로 올라갔습니다. 이 모델의 최대값이 131,072라서 그 위로는 올라가지 않습니다.

로드 시간은 디스크에서 처음 읽을 때 34.4초, 내렸다가 바로 다시 올리면 9.4초였습니다. 이 PC는 SATA SSD입니다.

생성 속도: Auto에서 평균 197.5t/s

"집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점"으로 800자 글을 쓰게 했습니다. 생각을 끄고 5번 이어서 물었습니다.

순서생성 속도첫 토큰까지(TTFT)답 토큰전체 시간
1번째 (로드 직후)196.6t/s0.22초7604.1초
2번째200.4t/s0.08초8104.1초
3번째200.0t/s0.04초7964.0초
4번째194.9t/s0.07초7313.8초
5번째195.5t/s0.12초8714.6초
평균 (최소~최대, 표준편차)197.5t/s (194.9~200.4, 2.6)0.10초7944.1초

5번이 고르게 나왔습니다. 같은 PC에서 Qwen3-Coder 30B A3B가 145.3t/s, Gemma 4 26B A4B QAT가 92.4t/s였습니다. 다만 800자를 써 달라고 했는데 답은 1,492~1,764자로 두 배쯤 길었습니다. 분량 요청을 잘 지키지 않습니다.

생각을 켜면: 답까지 약 8초

단계생각 끔 (5번)생각 켬 (3번)
모델 로드 (한 번만)처음 34.4초, 다시 로드 9.4초
질문을 읽고 첫 토큰까지0.04~0.22초약 0.1초
생각없음약 4초 (803~926토큰)
답 쓰기약 4초 (731~871토큰)약 4초
질문부터 답 끝까지3.8~4.6초7.8 / 8.5 / 7.9초
생성 속도194.9~200.4t/s204.8 / 200.3 / 205.8t/s

생각을 켜도 8초 안팎입니다. 같은 질문에 Gemma 4 26B A4B QAT는 17~19초, Qwen3.6 35B A3B는 36~45초가 걸렸습니다. 생각을 켠 채로 써도 기다리는 시간이 짧습니다.

컨텍스트를 늘려도: 속도가 그대로

컨텍스트만 바꿔 다시 로드하며 같은 800자 글을 쟀습니다(생각 끔 2번).

컨텍스트생성 속도 (생각 끔)생각 켬 800자 글15,000자 요약 TTFT사진 TTFT
8,192207.1 / 209.2t/s8.2초1.1초0.41초
32,768206.8 / 209.9t/s6.6초1.1초0.42초
65,536207.6 / 208.4t/s6.6초1.2초0.40초
131,072 (최대)204.0 / 207.2t/s6.8초1.1초0.44초

8,192부터 131,072까지 속도 차이가 없습니다. 같은 PC의 Qwen3-Coder 30B A3B는 컨텍스트 32,768에서 속도가 절반이 됐습니다. 이 모델은 VRAM에 다 들어가서 컨텍스트 크기를 고민할 필요가 없습니다.

설정을 바꾸면: 기본값보다 빨라지는 설정은 없었다

기본값(Auto)에서 설정을 하나씩만 바꿔 다시 로드하고, 같은 800자 글을 3번씩 쟀습니다(생각 끔 평균). 설정은 Unsloth Studio API의 로드 옵션으로 바꿨습니다.

설정생성 속도 (3번 평균)생각 켬 800자 글사진 TTFT모델이 쓴 VRAM
Auto (기본값, 컨텍스트 131,072, MTP 켬)191.1t/s7.3초0.41초3.7GB
MTP 끔 (Speculative Decoding off)161.4t/s10.1초0.45초3.5GB
컨텍스트 32,768195.4t/s6.2초0.40초2.9GB
이미지 입력 끔184.8t/s5.6초-2.5GB
KV 캐시 q4_0162.0t/s6.2초0.42초3.5GB
레이어 GPU 고정177.1t/s6.1초0.46초3.7GB
  • MTP가 약 18%를 보탭니다. 끄면 191.1t/s가 161.4t/s로 내려갑니다. 기본값이 이미 켜 두고 있으니 건드릴 필요가 없습니다.
  • KV 캐시를 줄이면 오히려 느려졌습니다. 큰 모델에서는 긴 컨텍스트 속도를 살려 주던 설정인데, 이 모델은 VRAM이 남아서 얻는 것이 없고 162.0t/s로 내려갔습니다.
  • VRAM을 더 아끼려면 이미지 입력을 끕니다. 모델이 쓰는 VRAM이 3.7GB에서 2.5GB로 줄어듭니다. 사진을 쓰지 않을 때만 해당합니다.
  • 기본값을 같은 조건으로 여러 번 쟀을 때 191~202t/s 사이에서 움직였습니다. 표에서 10t/s 안쪽의 차이는 의미를 두기 어렵습니다.

다른 곳의 측정과 견주기

같은 모델을 잰 다른 글 두 편과 조건을 나란히 놓았습니다. 숫자는 각 글쓴이가 잰 값입니다.

항목이 글ai-muninn (2026년 4월)DEV Community 글 (2026년)
장비RTX 5060 Ti 16GB맥북 프로 M1 Max 32GB / 엔비디아 GB10 128GB / 애플 M4 16GB라즈베리 파이 5 (8GB)
파일QAT UD-Q4_K_XL 2.44GBOllama의 gemma4:e2b (약 7.2GB, 양자화 종류는 적혀 있지 않음)적혀 있지 않음
프로그램Unsloth Studio (llama.cpp build 11160)Ollama 0.20.0~0.20.3llama.cpp
컨텍스트131,072GB10은 65,536, 나머지는 적혀 있지 않음4,096
MTP켬 (기본값)적혀 있지 않음적혀 있지 않음
생성 속도197.5t/s (MTP를 끄면 161.4)81.4 / 53.4 / 42.1t/s약 8~12t/s

맥북과 견주면 이 PC가 2.4~4.7배 빠르게 나왔습니다. 다만 조건이 다릅니다. 저쪽은 Ollama가 받는 7.2GB 파일이고 이 글은 2.44GB짜리 4비트 QAT 파일입니다. MTP를 썼는지도 저쪽 글에는 적혀 있지 않습니다. MTP를 끈 값(161.4t/s)으로 견줘도 이 PC가 약 2배입니다. 엔비디아도 공식 블로그에 RTX 5090에서 잰 값을 실었지만, 숫자가 그림으로만 나와 있어 여기에는 옮기지 못했습니다.

화면에서 돌린 영상

새 채팅을 열고 질문 하나를 보낸 영상입니다(11초, 소리 없음, 생각 끔).

영상에는 초당 140.2토큰으로 찍혔습니다. 화면 녹화 프로그램이 CPU를 쓰는 동안 찍었기 때문에 표의 숫자(약 197t/s)보다 느립니다. 답의 내용에는 확인되지 않은 말이 섞여 있을 수 있습니다. 속도를 보여 주려는 영상이니 내용은 참고하지 마세요. 녹화에 쓴 프로그램은 103번 글에서 소개했습니다.

산수: 생각을 끄면 0/5, 켜면 5/5

"사과 한 상자에 24개가 들어 있습니다. 3상자를 사서 19개를 먹고, 남은 것을 5명이 똑같이 나누면 한 사람당 몇 개이고 몇 개가 남나요? '한 사람당 X개, 남는 것 Y개' 형식으로만 답하세요."를 5번씩 물었습니다. 정답은 한 사람당 10개, 남는 것 3개입니다.

생각정답답걸린 시간
끔0 / 5"11개, 2개", "한 사람당 2개, 남는 것 1개", "3", "7", "3개"약 0.1초
켬5 / 5"한 사람당 10개, 남는 것 3개" 5번1.0~1.7초 (생각 228~407토큰)

생각을 끄면 계산 없이 바로 답을 적어서 틀리고, 정해 준 형식도 5번 중 4번 지키지 않았습니다. 생각을 켜면 5번 모두 맞았고, 2초가 걸리지 않았습니다. 이 모델은 생각을 켜도 빠르니, 계산이 들어가는 질문에는 생각을 켜 두는 편이 낫습니다. Unsloth Studio 앱은 기본으로 생각이 켜져 있습니다.

Unsloth Studio에서 생각을 켜고 사과 문제를 물은 화면, Worked for 1s, 답 한 사람당 10개 남는 것 3개, 초당 252.6토큰

생각을 켠 답입니다. 1초 생각한 뒤 "한 사람당 10개, 남는 것 3개"로 맞혔습니다.

Unsloth Studio에서 생각을 끄고 사과 문제를 물은 화면, 답 2개 4개, 초당 116.8토큰

생각을 끈 답입니다. "2개, 4개"로 틀렸고 형식도 지키지 않았습니다.

코딩: 파이썬 8문제를 3번씩, 생각 끔 16/24 · 켬 16/24

파이썬 함수 8개를 짜게 하고, 숨겨 둔 테스트로 채점했습니다. 문제는 구간 합치기, 로마 숫자 변환, 수식 계산기, 가장 긴 회문, 다음 영업일, 많이 나온 낱말, 나선 순서, 한글 숫자를 정수로 바꾸기입니다. 8문제를 처음부터 끝까지 3번 풀게 했습니다.

생각1회2회3회합계8문제 전체 시간
끔 (답 최대 2,000토큰)6 / 86 / 84 / 816 / 2422~30초
켬 (최대 8,000토큰)6 / 85 / 85 / 816 / 2457~65초
문제생각 끔 (3번 중)생각 켬 (3번 중)
가장 긴 회문, 많이 나온 낱말3번 모두 통과3번 모두 통과
구간 합치기, 로마 숫자3번 모두 통과2번 통과
다음 영업일, 나선 순서2번 통과3번 모두 통과
수식 계산기0번0번
한글 숫자를 정수로0번 (3번 모두 2,000토큰 안에 못 끝냄)0번
모델 (같은 PC, 같은 문제)생각 끔생각 켬
Gemma 4 E2B (2.44GB)16 / 2416 / 24
Qwen3.6 35B A3B (14.07GB)18 / 2420 / 24
Gemma 4 26B A4B QAT (13.27GB)19 / 2421 / 24
Qwen3-Coder 30B A3B (12.86GB, 생각 기능 없음)40 / 48

파일 크기가 5분의 1인데도 쉬운 문제 여섯 개는 대부분 풀었습니다. 큰 모델과 갈린 곳은 수식 계산기입니다. 다른 모델들은 여러 번 통과했는데 이 모델은 여섯 번 모두 실패했습니다. 생각을 켜도 정답 수가 늘지 않았고 시간만 두 배 넘게 걸렸습니다. 산수와 달리 코딩에서는 생각의 효과가 보이지 않았습니다. 다만 문제가 8개뿐이고 회차마다 한두 문제씩 결과가 달라지니, 작은 차이는 우연일 수 있습니다.

Unsloth Studio에서 Gemma 4 E2B에게 정수를 로마 숫자로 바꾸는 파이썬 함수를 짜게 한 화면, 규칙 설명 뒤에 Python 코드 제목과 함수 설명이 달린 int_to_roman 코드

정수를 로마 숫자로 바꾸는 함수를 짜게 한 화면입니다. 규칙을 먼저 설명하고 코드를 썼습니다.

긴 글 요약과 긴 대화

이 블로그의 업데이트 기록을 넣어 세 문장으로 요약하게 했습니다(생각 끔). 3,000자와 15,000자는 컨텍스트 32,768, 100,000자는 131,072에서 넣었습니다.

넣은 글입력 토큰TTFT생성 속도결과
3,000자1,6030.4초210.1t/s번호를 붙인 세 항목으로 요약
15,000자7,9760.9초187.2t/s세 갈래로 나눠 요약. 문장 수는 세 개를 넘음
100,000자48,6069.9초137.3t/s번호를 붙인 세 항목으로 요약

약 4만 9천 토큰짜리 글을 9.9초 만에 읽고 답을 쓰기 시작했습니다. 같은 글에 Qwen3-Coder 30B A3B는 174초가 걸렸습니다. 다만 "세 문장으로"라는 요청은 세 번 모두 그대로 지키지 않았습니다. 세 항목으로 나누되 항목마다 문장이 길거나 여럿이었습니다.

대화가 길어질 때를 보려고, 앞에 긴 글을 두고 한 문장짜리 질문을 붙였습니다(컨텍스트 32,768).

앞에 쌓인 토큰TTFT생성 속도
1,0960.3초208.0t/s
8,4911.1초204.8t/s
20,8922.2초193.0t/s

약 2만 1천 토큰이 쌓여도 속도는 7%만 내려갔고, 첫 토큰까지 2.2초였습니다.

긴 문서에서 정보 찾기: 5번 모두 찾음

약 10,300토큰짜리 글의 10%, 30%, 50%, 70%, 90% 위치에 "블로그 관리자가 키우는 고양이 보리차는 2019년에 태어났다"는 문장을 하나 숨기고, 고양이 이름과 태어난 해를 물었습니다. 5번 모두 정해 준 형식대로 보리차와 2019를 답했습니다(첫 토큰까지 1.4초). 문장을 숨기지 않은 글에서는 "없음"이라고 답했습니다.

전력과 온도: 평균 약 78W, 최고 54도

800자 글을 쓰는 동안 0.5초마다 그래픽카드 상태를 읽었습니다(컨텍스트 32,768, 생각 끔, 2번).

항목Gemma 4 E2BQwen3.6 35B A3BGemma 4 26B A4B QAT
쉬고 있을 때 전력약 12W약 13W약 11.5W
글 쓰는 동안 평균 전력78~79W91~97W60~62W
최고 전력96W123W78W
최고 온도52~54도61~63도48~49도
평균 GPU 사용률59~60%72%35~36%
토큰 하나에 쓴 전기약 0.4J약 1.1J약 0.75J

토큰 하나를 만드는 데 드는 전기가 약 0.4J로, 이 PC에서 잰 모델 중 가장 적습니다. 전력은 비슷하게 쓰지만 같은 시간에 훨씬 많은 토큰을 만들기 때문입니다.

없는 소설과 사진

실제로 없는 소설("윤서하의 2018년 장편소설 『푸른 등대의 겨울』")의 줄거리를 API로 한 번, 앱 화면에서 한 번 물었습니다. 2번 모두 그 작품의 줄거리를 가지고 있지 않다고 답했고, 지어내지 않았습니다. 서점 사이트에서 찾아보라고 안내했습니다. 같은 PC의 Qwen3-Coder 30B A3B는 2번 모두 줄거리를 지어냈습니다. 작은 모델인데도 모르는 것을 모른다고 답했습니다.

Unsloth Studio에서 없는 소설의 줄거리를 묻자 Gemma 4 E2B가 구체적인 줄거리를 가지고 있지 않다고 답한 화면, 초당 205.7토큰

없는 소설을 물은 화면입니다. 줄거리를 가지고 있지 않다고 답했습니다.

모래시계 두 개가 놓인 사진을 주고 무엇이 보이는지 물었습니다. 설정을 바꿔 가며 API로 물었고, 답의 글을 확인한 것은 8번입니다.

  • 읽는 속도는 빠릅니다. 첫 토큰까지 0.4초였습니다. 로드 뒤 처음 사진을 넣었을 때만 3.5초가 걸렸습니다. 같은 PC의 Qwen3.6 35B A3B는 기본값에서 28~70초였습니다.
  • 자세히 보지는 못했습니다. 8번 모두 모래시계 두 개가 탁자에 놓여 있다고는 말했습니다. 하지만 이 사진의 특징인 "오른쪽 모래시계 안에 전자 부품이 들어 있다"를 말한 것은 1번뿐입니다. 한 번은 모래시계를 "물시계"라고 했습니다. Qwen3.6 35B A3B는 9번 중 7번, Gemma 4 26B A4B QAT는 13번 중 7번 맞게 말했습니다.

사진에 무엇이 있는지 대강 아는 용도로는 빠르게 쓸 수 있지만, 세부를 물을 때는 큰 모델이 필요합니다. 소리 입력은 이 글에서 시험하지 않았습니다.

API로 받은 한국어 답 80개를 모두 확인했는데, 한자나 다른 나라 글자가 섞인 답은 없었습니다.

정리: 같은 PC의 다른 모델과 비교

항목Gemma 4 E2BGemma 4 26B A4B QATQwen3-Coder 30B A3B
파일QAT UD-Q4_K_XL 2.44GBQAT UD-Q4_K_XL 13.27GBUD-Q3_K_XL 12.86GB
Auto 컨텍스트131,072 (최대)8,1928,192
Auto 속도 (5번 평균)197.5t/s92.4t/s145.3t/s
모델이 쓴 VRAM (Auto)3.6GB14.1GB13.7GB
컨텍스트 131,072약 205t/s약 63t/s약 25t/s
생각 켬 800자 글약 8초17~19초생각 기능 없음
산수 (끔 / 켬)0/5, 5/50/5, 5/50/10
코딩 8문제 3번 (끔 / 켬)16/24, 16/2419/24, 21/2440/48
없는 소설모른다고 답함-지어냄
사진 TTFT (기본값)0.4초약 30초사진 입력 없음
사진 특징을 맞게 말한 횟수8번 중 1번13번 중 7번-
토큰 하나에 쓴 전기약 0.4J약 0.75J약 0.5~0.6J
  • 16GB에서는 설정 없이 가장 편하게 도는 모델입니다. 기본값이 최대 컨텍스트이고, VRAM 3.6GB에 약 197t/s입니다. 긴 문서를 넣어도 속도가 떨어지지 않습니다.
  • 생각을 켜 두고 쓰는 편이 낫습니다. 켜도 답이 8초 안에 나오고, 산수는 켜야 맞습니다.
  • 어려운 일에는 큰 모델이 필요합니다. 코딩 정답 수는 큰 모델보다 적고, 사진의 세부는 놓쳤습니다. 분량이나 문장 수 같은 요청도 그대로 지키지 않을 때가 있었습니다.
  • 맞는 용도: 긴 글을 빨리 요약하거나 정보를 찾을 때, 다른 GPU 작업과 함께 올려 둘 때, VRAM이 작은 그래픽카드에서 쓸 때입니다.

16GB 그래픽카드에서 한 단계 큰 Gemma 4 12B를 잰 결과는 82번 글에, 내 그래픽카드에서 다른 모델이 어느 정도 속도로 도는지는 GPU 체험에 있습니다.

이 글의 한계

  • 2026년 10월 9일, Unsloth Studio 2026.9.14(llama.cpp build 11160), 그래픽 드라이버 617.42 기준입니다. 109·110번 글의 비교 값은 드라이버 616.92에서 잰 것입니다.
  • QAT UD-Q4_K_XL 파일 하나만 쟀습니다. 더 작은 UD-Q2_K_XL(2.04GB)이나 QAT가 아닌 파일은 재지 않았고, 파일에 따른 답 품질 차이도 재지 않았습니다.
  • 5번 반복은 기본값의 생각 끔 800자 글에만 했습니다. 컨텍스트별 표는 2번씩, 설정 비교 표는 3번씩 잰 값이고 요약은 조건마다 한 번입니다.
  • 같은 기본값을 다시 쟀을 때 평균이 191~202t/s 사이에서 움직였습니다. 설정 비교 표의 작은 차이는 이 범위 안입니다.
  • 컨텍스트를 실제로 가장 길게 채운 것은 약 4만 9천 토큰입니다. 13만 토큰 가까이 채운 상태의 속도는 재지 않았습니다.
  • 소리 입력과 영상 입력은 시험하지 않았습니다.
  • 사진은 한 장으로만 물었습니다. 컨텍스트별 표의 사진 답은 글을 따로 저장하지 않아 내용을 확인하지 못했습니다.
  • 8GB 그래픽카드에서 직접 재지는 않았습니다. "8GB에서도 돌 크기"라는 말은 이 PC에서 쓴 VRAM을 보고 한 추정입니다.
  • 코딩 문제는 직접 만든 짧은 8문제입니다.
  • 생각에 쓴 토큰 수는 프로그램이 알려 준 값을 그대로 적었습니다.
  • 모델 카드가 권하는 샘플링 값(temperature 1.0, top_p 0.95, top_k 64)을 따로 지정하지 않고 프로그램 기본값으로 쟀습니다.
  • 프로그램을 켠 직후의 첫 실행은 따로 재지 않았습니다.

자주 묻는 질문

RTX 5060 Ti 16GB에서 Gemma 4 E2B는 몇 t/s인가요?

QAT UD-Q4_K_XL(2.44GB) 파일을 Unsloth Studio 기본값으로 돌렸을 때 800자 글 기준 평균 197.5t/s(194.9~200.4)였습니다. 컨텍스트 8,192부터 131,072까지 속도가 같았습니다.

VRAM은 얼마나 쓰나요?

최대 컨텍스트 131,072에서 모델이 3.6GB, PC 전체로 4.3GB였습니다. 이미지 입력을 끄면 2.5GB까지 줄어듭니다.

생각(Thinking)은 켜야 하나요?

계산이 들어가는 질문이면 켜는 편이 낫습니다. 산수 문제를 생각을 끄면 5번 모두 틀렸고, 켜면 5번 모두 맞았습니다. 켜도 800자 글 하나가 약 8초였습니다. 코딩 문제에서는 켜도 정답 수가 늘지 않았습니다.

Gemma 4 12B 대신 써도 되나요?

빠르고 가벼운 대신 어려운 일에서는 밀립니다. 구글이 잰 점수로도 12B와 차이가 크고, 이 PC에서 낸 코딩 문제와 사진 설명에서도 큰 모델보다 못했습니다. 긴 글 요약이나 정보 찾기처럼 속도가 중요한 일에 맞습니다.

출처

관련 게시글

댓글 0개