구글의 가장 작은 Gemma 4 모델인 Gemma 4 E2B(unsloth의 QAT UD-Q4_K_XL, 파일 2.44GB)를 RTX 5060 Ti 16GB PC의 Unsloth Studio에서 기본값(Auto) 그대로 돌려 봤습니다. 결론부터 적으면 VRAM 약 3.6GB만 쓰고 초당 약 197토큰(t/s)이 나왔고, 컨텍스트를 최대(131,072)로 올려도 속도가 그대로였습니다. 같은 질문을 5번 잰 평균이 197.5t/s(최소 194.9, 최대 200.4)입니다.
- 기본값이 곧 최대 컨텍스트였습니다. Auto가 컨텍스트를 131,072로 잡고 MTP도 켰습니다. 16GB 그래픽카드에서 VRAM은 11GB 넘게 남습니다.
- 생각(Thinking)을 켜도 빠릅니다. 800자 글 하나가 생각 끔 약 4초, 켬 약 8초였습니다. 산수는 생각을 끄면 5번 모두 틀리고, 켜면 5번 모두 맞았습니다(1~2초).
- 없는 소설을 지어내지 않았습니다. 2번 물어 2번 모두 모른다고 답했습니다.
- 파이썬 8문제는 3번 풀어 24개 중 16개를 통과했습니다. 생각을 켜도 16개로 같았습니다.
- 사진은 0.4초 만에 읽기 시작하지만, 자세히 보지는 못했습니다. 사진 속 물건의 특징을 맞게 말한 것은 8번 중 1번이었습니다.
이 글의 결과를 20초로 요약한 영상입니다(소리 없음).
이 글의 숫자는 모두 이 PC에서 직접 잰 값입니다. 속도와 정답 수는 Unsloth Studio의 API로 재고, 화면 캡처와 영상은 측정이 끝난 뒤 따로 찍었습니다. 측정은 2026년 10월 9일에 했습니다. 같은 PC에서 잰 Qwen3-Coder 30B A3B, Gemma 4 26B A4B QAT와 견줍니다.

생각을 켠 채(앱 기본값) 800자 글을 쓰게 한 화면입니다. 답 아래에 초당 191.6토큰이 표시됩니다.
테스트 PC와 실행 프로그램
| 항목 | 내용 |
|---|---|
| GPU | NVIDIA GeForce RTX 5060 Ti (VRAM 16GB, 전력 제한 180W) |
| GPU 연결 | PCIe 3.0 x8 (메인보드가 PCIe 3.0까지 지원) |
| CPU | Intel Core i5-9400F (6코어 6스레드) |
| 시스템 램 | DDR4 32GB (16GB × 2, 2666MT/s) |
| 저장장치 | Crucial MX500 1TB SATA SSD |
| 운영체제 | Windows 11 Pro, 전원 구성표 균형 조정 |
| 실행 프로그램 | Unsloth Studio 데스크톱(베타) 2026.9.14 |
| 엔진 | llama.cpp 0.5.0-dev (build 11160, commit a3c12db9d, Unsloth가 빌드한 것) |
| GPU 드라이버 | 617.42 |
| 측정 방법 | Unsloth Studio의 OpenAI 호환 API(127.0.0.1:8888)로 같은 질문을 반복해서 보냄. 속도는 첫 토큰이 나온 뒤부터 잰 생성 속도 |
| 측정 스크립트 | Python 3.14.3, requests 2.34.2, psutil 7.2.2 |
| 샘플링 | 따로 지정하지 않음(프로그램 기본값) |
| 측정 날짜 | 2026년 10월 9일 |
테스트 PC 두 대의 사양과 측정 방법은 소개 페이지에 있습니다. 로컬 AI를 처음 써 본다면 로컬 AI 시작하기 1편부터 보면 됩니다.
테스트한 모델: Gemma 4 E2B
구글이 2026년에 공개한 Gemma 4 가운데 가장 작은 모델입니다. 이름의 E는 "실효(effective)" 파라미터를 뜻합니다. 임베딩까지 합친 전체 파라미터는 5.1B이지만, 계산에 실제로 쓰는 파라미터는 2.3B라는 뜻입니다. unsloth 저장소에는 휴대폰용 파일도 따로 올라와 있습니다.
| 항목 | 내용 |
|---|---|
| 파라미터 | 실효 2.3B (임베딩 포함 5.1B) |
| 구조 | 35레이어. 층마다 작은 임베딩을 따로 두는 방식(Per-Layer Embeddings) |
| 받은 파일 | unsloth/gemma-4-E2B-it-qat-GGUF의 UD-Q4_K_XL 2.44GB (4비트, QAT) |
| 함께 받은 파일 | 이미지 입력용 파일(mmproj) 0.92GB, MTP용 파일 0.06GB. 합쳐서 3.41GB, 받는 데 49초 |
| 최대 컨텍스트 | 모델 카드 128K, Unsloth Studio에서 131,072토큰 |
| 입력 | 글, 사진, 소리(30초까지). 영상은 장면을 나눠서 |
| 생각(Thinking) | 있음. 켜고 끌 수 있음 |
| 라이선스 | Apache 2.0 |
QAT는 양자화(파일을 줄이는 것)를 미리 염두에 두고 학습시킨 파일이라는 뜻입니다. 같은 4비트라도 줄인 뒤의 품질 손실이 적다고 알려져 있습니다. 이 글에서는 QAT 파일과 일반 4비트 파일의 품질 차이를 따로 재지 않았습니다.
아래는 구글이 모델 카드에 적은 벤치마크 점수입니다. 제작사가 직접 잰 값이고, 양자화하지 않은 원본 기준입니다.
| 벤치마크 | Gemma 4 E2B | Gemma 4 E4B | Gemma 4 12B |
|---|---|---|---|
| MMLU Pro | 60.0% | 69.4% | 77.2% |
| AIME 2026 (도구 없이) | 37.5% | 42.5% | 77.5% |
| LiveCodeBench v6 | 44.0% | 52.0% | 72.0% |
| GPQA Diamond | 43.4% | 58.6% | 78.8% |
| MMMU Pro (사진 이해) | 44.2% | 52.6% | 69.1% |
제작사 점수로는 12B와 차이가 큽니다. 특히 수학(AIME)과 코딩(LiveCodeBench)에서 12B의 절반에서 60% 수준입니다. 작은 만큼 빠르고 가볍지만, 어려운 문제에서는 큰 모델을 따라가지 못한다는 뜻입니다.

모델 선택 창입니다. 받아 둔 Gemma 4 E2B(2.6GB)가 맨 위에 보입니다.
Unsloth Studio 기본값(Auto)은 어떻게 올렸나
실행 설정 창에서 컨텍스트(모델이 한 번에 기억하는 글의 길이)를 기본값인 Auto로 두고 올렸습니다. 예상 메모리는 GPU 5.06GiB, 전체 5.81GiB로 나옵니다. 큰 모델을 올릴 때 붙던 "GPU 메모리를 넘는다"는 경고가 없습니다.

실행 설정 창입니다. 예상 메모리 5.06GiB에 경고가 없고, 컨텍스트는 Auto입니다.
| 설정 | Auto가 고른 값 | 뜻 |
|---|---|---|
| 컨텍스트 | 131,072 | 이 모델의 최대값. VRAM이 넉넉해서 줄이지 않음 |
-ngl -1 --fit off | 레이어를 모두 GPU에 | 모델 전체를 그래픽카드에 올림 |
--spec-type draft-mtp | MTP 켬 | 작은 보조 모델이 다음 토큰을 미리 예측해 속도를 높이는 기능 |
| 이미지 입력용 파일 | GPU에 올림 | 사진을 바로 읽을 수 있음 |
| KV 캐시 | f16 | 줄이지 않은 기본값 |
같은 PC에서 잰 큰 모델들은 Auto가 컨텍스트를 약 8천 토큰으로 줄이거나 MTP를 껐습니다(Qwen3.6 35B A3B, Qwen3-Coder 30B A3B). Gemma 4 E2B는 16GB에서 아무것도 줄이지 않고 올라갑니다. 설정을 손댈 일이 없는 모델입니다.

고급 항목의 기본값입니다. KV 캐시 f16, Speculative Decoding Auto, Vision 켬입니다.

로드가 끝난 화면입니다. 오른쪽 위에 컨텍스트 131.1k가 보이고, 입력칸에 Thinking(생각)이 켜져 있습니다.
VRAM과 시스템 램: 최대 컨텍스트에서도 VRAM 3.6GB
로드 직전과 직후의 GPU 메모리와 PC 전체 램의 차이를 쟀습니다. 로드 전에 윈도우와 다른 프로그램이 VRAM 약 0.6GB, 램 약 9.5GB를 쓰고 있었습니다.
| 컨텍스트 | 모델이 쓴 VRAM | PC 전체 VRAM | 늘어난 시스템 램 | 로드 시간 | 16GB에서 |
|---|---|---|---|---|---|
| 8,192 | 2.7GB | 3.3GB | - | - | 원활 |
| 32,768 | 2.9GB | 3.5GB | 2.1GB | 9.3초 | 원활 |
| 65,536 | 3.2GB | 3.7GB | 2.2GB | 9.4초 | 원활 |
| 131,072 (Auto, 최대) | 3.6GB | 4.3GB | 2.3GB | 처음 34.4초, 다시 로드 9.4초 | 원활 (남는 VRAM 약 11.6GB) |
컨텍스트를 8,192에서 131,072로 16배 늘려도 VRAM은 0.9GB만 늘었습니다. 최대 컨텍스트에서 PC 전체 VRAM이 4.3GB라서, 8GB 그래픽카드에서도 최대 컨텍스트로 돌릴 수 있는 크기입니다(8GB 카드에서 직접 재지는 않았습니다). 16GB에서는 이 모델을 올려 둔 채 이미지 생성 같은 다른 GPU 작업을 함께 돌릴 자리가 남습니다.
API로 컨텍스트 262,144를 요청해 봤는데, 131,072로 올라갔습니다. 이 모델의 최대값이 131,072라서 그 위로는 올라가지 않습니다.
로드 시간은 디스크에서 처음 읽을 때 34.4초, 내렸다가 바로 다시 올리면 9.4초였습니다. 이 PC는 SATA SSD입니다.
생성 속도: Auto에서 평균 197.5t/s
"집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점"으로 800자 글을 쓰게 했습니다. 생각을 끄고 5번 이어서 물었습니다.
| 순서 | 생성 속도 | 첫 토큰까지(TTFT) | 답 토큰 | 전체 시간 |
|---|---|---|---|---|
| 1번째 (로드 직후) | 196.6t/s | 0.22초 | 760 | 4.1초 |
| 2번째 | 200.4t/s | 0.08초 | 810 | 4.1초 |
| 3번째 | 200.0t/s | 0.04초 | 796 | 4.0초 |
| 4번째 | 194.9t/s | 0.07초 | 731 | 3.8초 |
| 5번째 | 195.5t/s | 0.12초 | 871 | 4.6초 |
| 평균 (최소~최대, 표준편차) | 197.5t/s (194.9~200.4, 2.6) | 0.10초 | 794 | 4.1초 |
5번이 고르게 나왔습니다. 같은 PC에서 Qwen3-Coder 30B A3B가 145.3t/s, Gemma 4 26B A4B QAT가 92.4t/s였습니다. 다만 800자를 써 달라고 했는데 답은 1,492~1,764자로 두 배쯤 길었습니다. 분량 요청을 잘 지키지 않습니다.
생각을 켜면: 답까지 약 8초
| 단계 | 생각 끔 (5번) | 생각 켬 (3번) |
|---|---|---|
| 모델 로드 (한 번만) | 처음 34.4초, 다시 로드 9.4초 | |
| 질문을 읽고 첫 토큰까지 | 0.04~0.22초 | 약 0.1초 |
| 생각 | 없음 | 약 4초 (803~926토큰) |
| 답 쓰기 | 약 4초 (731~871토큰) | 약 4초 |
| 질문부터 답 끝까지 | 3.8~4.6초 | 7.8 / 8.5 / 7.9초 |
| 생성 속도 | 194.9~200.4t/s | 204.8 / 200.3 / 205.8t/s |
생각을 켜도 8초 안팎입니다. 같은 질문에 Gemma 4 26B A4B QAT는 17~19초, Qwen3.6 35B A3B는 36~45초가 걸렸습니다. 생각을 켠 채로 써도 기다리는 시간이 짧습니다.
컨텍스트를 늘려도: 속도가 그대로
컨텍스트만 바꿔 다시 로드하며 같은 800자 글을 쟀습니다(생각 끔 2번).
| 컨텍스트 | 생성 속도 (생각 끔) | 생각 켬 800자 글 | 15,000자 요약 TTFT | 사진 TTFT |
|---|---|---|---|---|
| 8,192 | 207.1 / 209.2t/s | 8.2초 | 1.1초 | 0.41초 |
| 32,768 | 206.8 / 209.9t/s | 6.6초 | 1.1초 | 0.42초 |
| 65,536 | 207.6 / 208.4t/s | 6.6초 | 1.2초 | 0.40초 |
| 131,072 (최대) | 204.0 / 207.2t/s | 6.8초 | 1.1초 | 0.44초 |
8,192부터 131,072까지 속도 차이가 없습니다. 같은 PC의 Qwen3-Coder 30B A3B는 컨텍스트 32,768에서 속도가 절반이 됐습니다. 이 모델은 VRAM에 다 들어가서 컨텍스트 크기를 고민할 필요가 없습니다.
설정을 바꾸면: 기본값보다 빨라지는 설정은 없었다
기본값(Auto)에서 설정을 하나씩만 바꿔 다시 로드하고, 같은 800자 글을 3번씩 쟀습니다(생각 끔 평균). 설정은 Unsloth Studio API의 로드 옵션으로 바꿨습니다.
| 설정 | 생성 속도 (3번 평균) | 생각 켬 800자 글 | 사진 TTFT | 모델이 쓴 VRAM |
|---|---|---|---|---|
| Auto (기본값, 컨텍스트 131,072, MTP 켬) | 191.1t/s | 7.3초 | 0.41초 | 3.7GB |
| MTP 끔 (Speculative Decoding off) | 161.4t/s | 10.1초 | 0.45초 | 3.5GB |
| 컨텍스트 32,768 | 195.4t/s | 6.2초 | 0.40초 | 2.9GB |
| 이미지 입력 끔 | 184.8t/s | 5.6초 | - | 2.5GB |
| KV 캐시 q4_0 | 162.0t/s | 6.2초 | 0.42초 | 3.5GB |
| 레이어 GPU 고정 | 177.1t/s | 6.1초 | 0.46초 | 3.7GB |
- MTP가 약 18%를 보탭니다. 끄면 191.1t/s가 161.4t/s로 내려갑니다. 기본값이 이미 켜 두고 있으니 건드릴 필요가 없습니다.
- KV 캐시를 줄이면 오히려 느려졌습니다. 큰 모델에서는 긴 컨텍스트 속도를 살려 주던 설정인데, 이 모델은 VRAM이 남아서 얻는 것이 없고 162.0t/s로 내려갔습니다.
- VRAM을 더 아끼려면 이미지 입력을 끕니다. 모델이 쓰는 VRAM이 3.7GB에서 2.5GB로 줄어듭니다. 사진을 쓰지 않을 때만 해당합니다.
- 기본값을 같은 조건으로 여러 번 쟀을 때 191~202t/s 사이에서 움직였습니다. 표에서 10t/s 안쪽의 차이는 의미를 두기 어렵습니다.
다른 곳의 측정과 견주기
같은 모델을 잰 다른 글 두 편과 조건을 나란히 놓았습니다. 숫자는 각 글쓴이가 잰 값입니다.
| 항목 | 이 글 | ai-muninn (2026년 4월) | DEV Community 글 (2026년) |
|---|---|---|---|
| 장비 | RTX 5060 Ti 16GB | 맥북 프로 M1 Max 32GB / 엔비디아 GB10 128GB / 애플 M4 16GB | 라즈베리 파이 5 (8GB) |
| 파일 | QAT UD-Q4_K_XL 2.44GB | Ollama의 gemma4:e2b (약 7.2GB, 양자화 종류는 적혀 있지 않음) | 적혀 있지 않음 |
| 프로그램 | Unsloth Studio (llama.cpp build 11160) | Ollama 0.20.0~0.20.3 | llama.cpp |
| 컨텍스트 | 131,072 | GB10은 65,536, 나머지는 적혀 있지 않음 | 4,096 |
| MTP | 켬 (기본값) | 적혀 있지 않음 | 적혀 있지 않음 |
| 생성 속도 | 197.5t/s (MTP를 끄면 161.4) | 81.4 / 53.4 / 42.1t/s | 약 8~12t/s |
맥북과 견주면 이 PC가 2.4~4.7배 빠르게 나왔습니다. 다만 조건이 다릅니다. 저쪽은 Ollama가 받는 7.2GB 파일이고 이 글은 2.44GB짜리 4비트 QAT 파일입니다. MTP를 썼는지도 저쪽 글에는 적혀 있지 않습니다. MTP를 끈 값(161.4t/s)으로 견줘도 이 PC가 약 2배입니다. 엔비디아도 공식 블로그에 RTX 5090에서 잰 값을 실었지만, 숫자가 그림으로만 나와 있어 여기에는 옮기지 못했습니다.
화면에서 돌린 영상
새 채팅을 열고 질문 하나를 보낸 영상입니다(11초, 소리 없음, 생각 끔).
영상에는 초당 140.2토큰으로 찍혔습니다. 화면 녹화 프로그램이 CPU를 쓰는 동안 찍었기 때문에 표의 숫자(약 197t/s)보다 느립니다. 답의 내용에는 확인되지 않은 말이 섞여 있을 수 있습니다. 속도를 보여 주려는 영상이니 내용은 참고하지 마세요. 녹화에 쓴 프로그램은 103번 글에서 소개했습니다.
산수: 생각을 끄면 0/5, 켜면 5/5
"사과 한 상자에 24개가 들어 있습니다. 3상자를 사서 19개를 먹고, 남은 것을 5명이 똑같이 나누면 한 사람당 몇 개이고 몇 개가 남나요? '한 사람당 X개, 남는 것 Y개' 형식으로만 답하세요."를 5번씩 물었습니다. 정답은 한 사람당 10개, 남는 것 3개입니다.
| 생각 | 정답 | 답 | 걸린 시간 |
|---|---|---|---|
| 끔 | 0 / 5 | "11개, 2개", "한 사람당 2개, 남는 것 1개", "3", "7", "3개" | 약 0.1초 |
| 켬 | 5 / 5 | "한 사람당 10개, 남는 것 3개" 5번 | 1.0~1.7초 (생각 228~407토큰) |
생각을 끄면 계산 없이 바로 답을 적어서 틀리고, 정해 준 형식도 5번 중 4번 지키지 않았습니다. 생각을 켜면 5번 모두 맞았고, 2초가 걸리지 않았습니다. 이 모델은 생각을 켜도 빠르니, 계산이 들어가는 질문에는 생각을 켜 두는 편이 낫습니다. Unsloth Studio 앱은 기본으로 생각이 켜져 있습니다.

생각을 켠 답입니다. 1초 생각한 뒤 "한 사람당 10개, 남는 것 3개"로 맞혔습니다.

생각을 끈 답입니다. "2개, 4개"로 틀렸고 형식도 지키지 않았습니다.
코딩: 파이썬 8문제를 3번씩, 생각 끔 16/24 · 켬 16/24
파이썬 함수 8개를 짜게 하고, 숨겨 둔 테스트로 채점했습니다. 문제는 구간 합치기, 로마 숫자 변환, 수식 계산기, 가장 긴 회문, 다음 영업일, 많이 나온 낱말, 나선 순서, 한글 숫자를 정수로 바꾸기입니다. 8문제를 처음부터 끝까지 3번 풀게 했습니다.
| 생각 | 1회 | 2회 | 3회 | 합계 | 8문제 전체 시간 |
|---|---|---|---|---|---|
| 끔 (답 최대 2,000토큰) | 6 / 8 | 6 / 8 | 4 / 8 | 16 / 24 | 22~30초 |
| 켬 (최대 8,000토큰) | 6 / 8 | 5 / 8 | 5 / 8 | 16 / 24 | 57~65초 |
| 문제 | 생각 끔 (3번 중) | 생각 켬 (3번 중) |
|---|---|---|
| 가장 긴 회문, 많이 나온 낱말 | 3번 모두 통과 | 3번 모두 통과 |
| 구간 합치기, 로마 숫자 | 3번 모두 통과 | 2번 통과 |
| 다음 영업일, 나선 순서 | 2번 통과 | 3번 모두 통과 |
| 수식 계산기 | 0번 | 0번 |
| 한글 숫자를 정수로 | 0번 (3번 모두 2,000토큰 안에 못 끝냄) | 0번 |
| 모델 (같은 PC, 같은 문제) | 생각 끔 | 생각 켬 |
|---|---|---|
| Gemma 4 E2B (2.44GB) | 16 / 24 | 16 / 24 |
| Qwen3.6 35B A3B (14.07GB) | 18 / 24 | 20 / 24 |
| Gemma 4 26B A4B QAT (13.27GB) | 19 / 24 | 21 / 24 |
| Qwen3-Coder 30B A3B (12.86GB, 생각 기능 없음) | 40 / 48 | |
파일 크기가 5분의 1인데도 쉬운 문제 여섯 개는 대부분 풀었습니다. 큰 모델과 갈린 곳은 수식 계산기입니다. 다른 모델들은 여러 번 통과했는데 이 모델은 여섯 번 모두 실패했습니다. 생각을 켜도 정답 수가 늘지 않았고 시간만 두 배 넘게 걸렸습니다. 산수와 달리 코딩에서는 생각의 효과가 보이지 않았습니다. 다만 문제가 8개뿐이고 회차마다 한두 문제씩 결과가 달라지니, 작은 차이는 우연일 수 있습니다.

정수를 로마 숫자로 바꾸는 함수를 짜게 한 화면입니다. 규칙을 먼저 설명하고 코드를 썼습니다.
긴 글 요약과 긴 대화
이 블로그의 업데이트 기록을 넣어 세 문장으로 요약하게 했습니다(생각 끔). 3,000자와 15,000자는 컨텍스트 32,768, 100,000자는 131,072에서 넣었습니다.
| 넣은 글 | 입력 토큰 | TTFT | 생성 속도 | 결과 |
|---|---|---|---|---|
| 3,000자 | 1,603 | 0.4초 | 210.1t/s | 번호를 붙인 세 항목으로 요약 |
| 15,000자 | 7,976 | 0.9초 | 187.2t/s | 세 갈래로 나눠 요약. 문장 수는 세 개를 넘음 |
| 100,000자 | 48,606 | 9.9초 | 137.3t/s | 번호를 붙인 세 항목으로 요약 |
약 4만 9천 토큰짜리 글을 9.9초 만에 읽고 답을 쓰기 시작했습니다. 같은 글에 Qwen3-Coder 30B A3B는 174초가 걸렸습니다. 다만 "세 문장으로"라는 요청은 세 번 모두 그대로 지키지 않았습니다. 세 항목으로 나누되 항목마다 문장이 길거나 여럿이었습니다.
대화가 길어질 때를 보려고, 앞에 긴 글을 두고 한 문장짜리 질문을 붙였습니다(컨텍스트 32,768).
| 앞에 쌓인 토큰 | TTFT | 생성 속도 |
|---|---|---|
| 1,096 | 0.3초 | 208.0t/s |
| 8,491 | 1.1초 | 204.8t/s |
| 20,892 | 2.2초 | 193.0t/s |
약 2만 1천 토큰이 쌓여도 속도는 7%만 내려갔고, 첫 토큰까지 2.2초였습니다.
긴 문서에서 정보 찾기: 5번 모두 찾음
약 10,300토큰짜리 글의 10%, 30%, 50%, 70%, 90% 위치에 "블로그 관리자가 키우는 고양이 보리차는 2019년에 태어났다"는 문장을 하나 숨기고, 고양이 이름과 태어난 해를 물었습니다. 5번 모두 정해 준 형식대로 보리차와 2019를 답했습니다(첫 토큰까지 1.4초). 문장을 숨기지 않은 글에서는 "없음"이라고 답했습니다.
전력과 온도: 평균 약 78W, 최고 54도
800자 글을 쓰는 동안 0.5초마다 그래픽카드 상태를 읽었습니다(컨텍스트 32,768, 생각 끔, 2번).
| 항목 | Gemma 4 E2B | Qwen3.6 35B A3B | Gemma 4 26B A4B QAT |
|---|---|---|---|
| 쉬고 있을 때 전력 | 약 12W | 약 13W | 약 11.5W |
| 글 쓰는 동안 평균 전력 | 78~79W | 91~97W | 60~62W |
| 최고 전력 | 96W | 123W | 78W |
| 최고 온도 | 52~54도 | 61~63도 | 48~49도 |
| 평균 GPU 사용률 | 59~60% | 72% | 35~36% |
| 토큰 하나에 쓴 전기 | 약 0.4J | 약 1.1J | 약 0.75J |
토큰 하나를 만드는 데 드는 전기가 약 0.4J로, 이 PC에서 잰 모델 중 가장 적습니다. 전력은 비슷하게 쓰지만 같은 시간에 훨씬 많은 토큰을 만들기 때문입니다.
없는 소설과 사진
실제로 없는 소설("윤서하의 2018년 장편소설 『푸른 등대의 겨울』")의 줄거리를 API로 한 번, 앱 화면에서 한 번 물었습니다. 2번 모두 그 작품의 줄거리를 가지고 있지 않다고 답했고, 지어내지 않았습니다. 서점 사이트에서 찾아보라고 안내했습니다. 같은 PC의 Qwen3-Coder 30B A3B는 2번 모두 줄거리를 지어냈습니다. 작은 모델인데도 모르는 것을 모른다고 답했습니다.

없는 소설을 물은 화면입니다. 줄거리를 가지고 있지 않다고 답했습니다.
모래시계 두 개가 놓인 사진을 주고 무엇이 보이는지 물었습니다. 설정을 바꿔 가며 API로 물었고, 답의 글을 확인한 것은 8번입니다.
- 읽는 속도는 빠릅니다. 첫 토큰까지 0.4초였습니다. 로드 뒤 처음 사진을 넣었을 때만 3.5초가 걸렸습니다. 같은 PC의 Qwen3.6 35B A3B는 기본값에서 28~70초였습니다.
- 자세히 보지는 못했습니다. 8번 모두 모래시계 두 개가 탁자에 놓여 있다고는 말했습니다. 하지만 이 사진의 특징인 "오른쪽 모래시계 안에 전자 부품이 들어 있다"를 말한 것은 1번뿐입니다. 한 번은 모래시계를 "물시계"라고 했습니다. Qwen3.6 35B A3B는 9번 중 7번, Gemma 4 26B A4B QAT는 13번 중 7번 맞게 말했습니다.
사진에 무엇이 있는지 대강 아는 용도로는 빠르게 쓸 수 있지만, 세부를 물을 때는 큰 모델이 필요합니다. 소리 입력은 이 글에서 시험하지 않았습니다.
API로 받은 한국어 답 80개를 모두 확인했는데, 한자나 다른 나라 글자가 섞인 답은 없었습니다.
정리: 같은 PC의 다른 모델과 비교
| 항목 | Gemma 4 E2B | Gemma 4 26B A4B QAT | Qwen3-Coder 30B A3B |
|---|---|---|---|
| 파일 | QAT UD-Q4_K_XL 2.44GB | QAT UD-Q4_K_XL 13.27GB | UD-Q3_K_XL 12.86GB |
| Auto 컨텍스트 | 131,072 (최대) | 8,192 | 8,192 |
| Auto 속도 (5번 평균) | 197.5t/s | 92.4t/s | 145.3t/s |
| 모델이 쓴 VRAM (Auto) | 3.6GB | 14.1GB | 13.7GB |
| 컨텍스트 131,072 | 약 205t/s | 약 63t/s | 약 25t/s |
| 생각 켬 800자 글 | 약 8초 | 17~19초 | 생각 기능 없음 |
| 산수 (끔 / 켬) | 0/5, 5/5 | 0/5, 5/5 | 0/10 |
| 코딩 8문제 3번 (끔 / 켬) | 16/24, 16/24 | 19/24, 21/24 | 40/48 |
| 없는 소설 | 모른다고 답함 | - | 지어냄 |
| 사진 TTFT (기본값) | 0.4초 | 약 30초 | 사진 입력 없음 |
| 사진 특징을 맞게 말한 횟수 | 8번 중 1번 | 13번 중 7번 | - |
| 토큰 하나에 쓴 전기 | 약 0.4J | 약 0.75J | 약 0.5~0.6J |
- 16GB에서는 설정 없이 가장 편하게 도는 모델입니다. 기본값이 최대 컨텍스트이고, VRAM 3.6GB에 약 197t/s입니다. 긴 문서를 넣어도 속도가 떨어지지 않습니다.
- 생각을 켜 두고 쓰는 편이 낫습니다. 켜도 답이 8초 안에 나오고, 산수는 켜야 맞습니다.
- 어려운 일에는 큰 모델이 필요합니다. 코딩 정답 수는 큰 모델보다 적고, 사진의 세부는 놓쳤습니다. 분량이나 문장 수 같은 요청도 그대로 지키지 않을 때가 있었습니다.
- 맞는 용도: 긴 글을 빨리 요약하거나 정보를 찾을 때, 다른 GPU 작업과 함께 올려 둘 때, VRAM이 작은 그래픽카드에서 쓸 때입니다.
16GB 그래픽카드에서 한 단계 큰 Gemma 4 12B를 잰 결과는 82번 글에, 내 그래픽카드에서 다른 모델이 어느 정도 속도로 도는지는 GPU 체험에 있습니다.
이 글의 한계
- 2026년 10월 9일, Unsloth Studio 2026.9.14(llama.cpp build 11160), 그래픽 드라이버 617.42 기준입니다. 109·110번 글의 비교 값은 드라이버 616.92에서 잰 것입니다.
- QAT UD-Q4_K_XL 파일 하나만 쟀습니다. 더 작은 UD-Q2_K_XL(2.04GB)이나 QAT가 아닌 파일은 재지 않았고, 파일에 따른 답 품질 차이도 재지 않았습니다.
- 5번 반복은 기본값의 생각 끔 800자 글에만 했습니다. 컨텍스트별 표는 2번씩, 설정 비교 표는 3번씩 잰 값이고 요약은 조건마다 한 번입니다.
- 같은 기본값을 다시 쟀을 때 평균이 191~202t/s 사이에서 움직였습니다. 설정 비교 표의 작은 차이는 이 범위 안입니다.
- 컨텍스트를 실제로 가장 길게 채운 것은 약 4만 9천 토큰입니다. 13만 토큰 가까이 채운 상태의 속도는 재지 않았습니다.
- 소리 입력과 영상 입력은 시험하지 않았습니다.
- 사진은 한 장으로만 물었습니다. 컨텍스트별 표의 사진 답은 글을 따로 저장하지 않아 내용을 확인하지 못했습니다.
- 8GB 그래픽카드에서 직접 재지는 않았습니다. "8GB에서도 돌 크기"라는 말은 이 PC에서 쓴 VRAM을 보고 한 추정입니다.
- 코딩 문제는 직접 만든 짧은 8문제입니다.
- 생각에 쓴 토큰 수는 프로그램이 알려 준 값을 그대로 적었습니다.
- 모델 카드가 권하는 샘플링 값(temperature 1.0, top_p 0.95, top_k 64)을 따로 지정하지 않고 프로그램 기본값으로 쟀습니다.
- 프로그램을 켠 직후의 첫 실행은 따로 재지 않았습니다.
자주 묻는 질문
RTX 5060 Ti 16GB에서 Gemma 4 E2B는 몇 t/s인가요?
QAT UD-Q4_K_XL(2.44GB) 파일을 Unsloth Studio 기본값으로 돌렸을 때 800자 글 기준 평균 197.5t/s(194.9~200.4)였습니다. 컨텍스트 8,192부터 131,072까지 속도가 같았습니다.
VRAM은 얼마나 쓰나요?
최대 컨텍스트 131,072에서 모델이 3.6GB, PC 전체로 4.3GB였습니다. 이미지 입력을 끄면 2.5GB까지 줄어듭니다.
생각(Thinking)은 켜야 하나요?
계산이 들어가는 질문이면 켜는 편이 낫습니다. 산수 문제를 생각을 끄면 5번 모두 틀렸고, 켜면 5번 모두 맞았습니다. 켜도 800자 글 하나가 약 8초였습니다. 코딩 문제에서는 켜도 정답 수가 늘지 않았습니다.
Gemma 4 12B 대신 써도 되나요?
빠르고 가벼운 대신 어려운 일에서는 밀립니다. 구글이 잰 점수로도 12B와 차이가 크고, 이 PC에서 낸 코딩 문제와 사진 설명에서도 큰 모델보다 못했습니다. 긴 글 요약이나 정보 찾기처럼 속도가 중요한 일에 맞습니다.
댓글 0개