구글의 Gemma 4 12B QAT 모델(Q4_0, 7.15GB)을 RTX 5090 PC의 LM Studio에서 직접 돌려 봤습니다. 설정은 LM Studio가 이 모델에 기본으로 잡아 주는 값을 그대로 썼고, 화면 캡처와 측정 기록을 함께 남깁니다. 결과부터 말하면 기본 설정에서 초당 약 145토큰이 나왔고, VRAM은 약 9GB만 썼습니다. 그리고 생각(thinking) 기능을 끄면 간단한 산수를 5번 모두 틀렸습니다.
테스트 PC 사양
| 부품 | 사양 |
|---|---|
| GPU | NVIDIA GeForce RTX 5090 (VRAM 32GB, 전력 제한 575W, PCIe 5.0 x16) |
| GPU 드라이버 | 616.92 (CUDA 13.4) |
| CPU | Intel Core Ultra 9 285K (24코어 24스레드) |
| 메인보드 | ASUS ROG MAXIMUS Z890 HERO |
| 메모리 | DDR5 64GB (32GB × 2, 6000MT/s) |
| 저장장치 | 삼성 NVMe SSD 1TB |
| 운영체제 | Windows 11 Pro (빌드 26200) |
| LM Studio | 0.4.25 |
| 추론 엔진 | llama.cpp CUDA 12 런타임 2.45.0 (LM Studio 기본 선택) |
모델을 올리기 전 GPU 메모리 사용량은 1,283MiB였습니다. 윈도우 화면과 다른 프로그램이 쓰는 양이라, 아래 VRAM 수치에서는 불러오기 직전 값을 뺀 만큼을 모델이 쓴 양으로 봤습니다.
테스트한 모델: Gemma 4 12B QAT
Gemma 4는 구글 딥마인드가 공개한 모델 제품군이고, 12B는 파라미터가 120억 개인 중간 크기 모델입니다. 이번에 쓴 파일은 LM Studio 모델 페이지의 google/gemma-4-12b-qat로, 4비트(Q4_0)로 줄인 GGUF 파일입니다.
이름의 QAT는 양자화 인식 학습(Quantization-Aware Training)의 줄임말입니다. 보통은 다 학습한 모델을 나중에 4비트로 줄이는데, QAT는 4비트로 줄일 것을 전제로 학습시킵니다. 구글 모델 카드는 이 방식이 bfloat16 원본과 비슷한 품질을 유지하면서 필요한 메모리를 크게 줄인다고 설명합니다. 라이선스는 Apache 2.0입니다 (Gemma 4 12B QAT 모델 카드).
| 항목 | 내용 |
|---|---|
| 파일 | gemma-4-12B-it-QAT-Q4_0.gguf, 7.15GB |
| 양자화 | Q4_0 (4비트) |
| 최대 컨텍스트 | 262,144토큰 |
| 기능 | 이미지 입력(비전), 도구 호출, 생각(thinking) |
| 라이선스 | Apache 2.0 |

LM Studio의 My Models 화면. 오른쪽에 Q4_0, 7.15GB, 비전·도구·생각 기능 아이콘이 보입니다.
LM Studio 기본 설정값
설정은 하나도 바꾸지 않고, LM Studio가 이 모델에 잡아 주는 기본값으로 테스트했습니다. 컨텍스트 길이 테스트만 예외입니다.
불러오기(Load) 설정

Load 탭의 기본값. 컨텍스트 8,192, GPU 오프로드 48(전체 층)입니다.

아래로 내리면 Flash Attention이 기본으로 켜져 있고, KV 캐시 양자화는 꺼져 있습니다.
| 설정 | 기본값 | 뜻 |
|---|---|---|
| 컨텍스트 길이 | 8,192 | 한 번에 기억하는 토큰 수. 모델은 최대 262,144까지 지원합니다 |
| GPU 오프로드 | 48 (전체) | 모델의 48개 층을 모두 GPU에 올립니다 |
| Flash Attention | 켬 | 긴 입력에서 메모리와 시간을 아끼는 계산 방식 |
| KV 캐시를 GPU에 저장 | 켬 | 대화 내용 캐시를 GPU 메모리에 둡니다 |
| CPU 스레드 | 9 | CPU가 거드는 작업에 쓰는 스레드 수 |
| 평가 배치 / 물리 배치 | 2048 / 512 | 입력을 한 번에 몇 토큰씩 처리할지 |
| 최대 동시 예측 | 4 | 동시에 받을 수 있는 요청 수(실험 기능) |
| KV 캐시 양자화 | 끔 | 켜면 메모리를 아끼지만 품질이 떨어질 수 있습니다 |

불러오기 창에서 LM Studio가 계산한 예상 메모리는 GPU 8.20GB였습니다.
추론(Inference) 설정

Inference 탭. 생각(Enable Thinking)이 기본으로 켜져 있고, 온도는 1입니다.

샘플링 기본값. Top K 64, Top P 0.95, Min P 0.05, 반복 패널티 1입니다.
눈여겨볼 점은 생각 기능이 기본으로 켜져 있다는 것입니다. 답하기 전에 모델이 먼저 풀이 과정을 만들고, 그다음에 답을 씁니다. 아래 테스트에서 이 설정이 결과를 크게 바꿨습니다.
테스트 1. 불러오는 시간과 VRAM
모델을 불러오는 데 5.2초가 걸렸습니다. 다만 이 PC에서 모델 파일을 이미 한 번 읽은 뒤라, 파일이 메모리 캐시에 있던 상태의 값입니다. 컨텍스트 길이만 바꿔 다시 불러오며 VRAM을 잰 결과는 다음과 같습니다.
| 컨텍스트 길이 | 불러온 뒤 GPU 메모리 | 모델이 쓴 양 | 불러오는 시간 |
|---|---|---|---|
| 8,192 (기본값) | 10,472MiB | 약 9.0GB | 5.2초 |
| 32,768 | 10,941MiB | 약 9.3GB | 4.7초 |
| 131,072 | 12,596MiB | 약 11.0GB | 4.7초 |
| 262,144 (최대) | 14,757MiB | 약 13.1GB | 4.7초 |
컨텍스트를 최대인 262,144로 늘려도 모델이 쓰는 VRAM은 약 13.1GB였습니다. 32GB인 RTX 5090에서는 절반도 쓰지 않는 셈이라, 이 모델 하나를 돌리면서 다른 모델을 함께 올릴 여유가 충분합니다. 컨텍스트를 32배로 늘렸는데 메모리는 4GB 남짓만 늘어난 점도 눈에 띕니다.
테스트 2. 생성 속도
"집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점을 800자 정도로 써 주세요"를 물었습니다. LM Studio 채팅 화면에서 한 번, 같은 조건의 API 요청으로 생각 켬·끔 각각 3번씩 잰 기록입니다.

채팅 화면. 답하기 전에 6.64초 동안 생각한 뒤 글을 썼습니다.

답변 아래 통계. 초당 139.44토큰, 1,470토큰 생성, 첫 토큰까지 0.99초입니다.
| 회차 | 생각 | 초당 토큰 | 생성 토큰 (그중 생각) | 첫 토큰까지 | 답이 끝날 때까지 |
|---|---|---|---|---|---|
| 채팅 화면 | 켬 | 139.44 | 1,470 | 0.99초 | - |
| API 1 | 켬 | 144.8 | 1,331 (802) | 0.06초 | 9.3초 |
| API 2 | 켬 | 143.1 | 1,363 (781) | 0.04초 | 9.7초 |
| API 3 | 켬 | 145.0 | 1,969 (1,359) | 0.04초 | 13.7초 |
| API 1 | 끔 | 146.6 | 737 (0) | 0.04초 | 5.2초 |
| API 2 | 끔 | 147.6 | 694 (0) | 0.03초 | 4.8초 |
| API 3 | 끔 | 147.0 | 582 (0) | 0.03초 | 4.1초 |
생성 속도 자체는 생각을 켜든 끄든 초당 143~148토큰으로 거의 같았습니다. 차이는 만드는 토큰의 양입니다. 생각을 켜면 답과 별개로 780~1,360토큰의 풀이를 먼저 만들기 때문에, 같은 글을 받는 데 9~14초가 걸렸습니다. 끄면 4~5초였습니다. 초당 145토큰은 사람이 읽는 속도보다 훨씬 빨라서, 어느 쪽이든 대화할 때 기다린다는 느낌은 거의 없었습니다.
테스트 3. 생각 기능을 끄면 산수를 틀린다
"사과 한 상자에 24개가 들어 있습니다. 3상자를 사서 19개를 먹고, 남은 것을 5명이 똑같이 나누면 한 사람당 몇 개이고 몇 개가 남나요?"를 물었습니다. 정답은 24 × 3 = 72개에서 19개를 빼 53개, 53 ÷ 5 = 한 사람당 10개, 3개 남음입니다.

생각을 켠 기본 설정. 1.63초 동안 단계별로 계산한 뒤 정답을 냈습니다.

생각을 끈 경우. 곧바로 "한 사람당 11개, 남는 것 4개"라는 틀린 답을 냈습니다.
한 번의 결과로 판단하지 않으려고 같은 질문을 API로 5번씩 더 물었습니다.
| 설정 | 정답 횟수 | 나온 답 | 평균 응답 시간 | 평균 생각 토큰 |
|---|---|---|---|---|
| 생각 켬 (기본값) | 5번 중 5번 | 5번 모두 "10개, 3개 남음" | 2.1초 | 276 |
| 생각 끔 | 5번 중 0번 | 11개·1개, 10개·1개, 11개·1개, 10개·1개, 11개·4개 | 0.2초 | 0 |
생각을 끄면 0.2초 만에 답하지만 5번 모두 틀렸고, 틀린 답도 매번 달랐습니다. 생각을 켜면 2초 정도 더 걸리는 대신 5번 모두 맞혔습니다. 계산이나 논리가 들어가는 질문이라면 생각 기능은 기본값대로 켜 두는 것이 맞습니다. 생각 과정은 한국어로 물어도 영어로 진행됐습니다.
테스트 4. 긴 글을 넣었을 때
이 블로그의 업데이트 기록을 3,000자, 15,000자, 100,000자로 잘라 넣고 세 문장으로 요약하게 했습니다. 입력이 컨텍스트에 들어가도록 앞의 두 개는 컨텍스트 32,768, 마지막은 131,072로 불러왔고, 요약 시간만 보려고 생각은 껐습니다.
| 입력 | 입력 토큰 | 첫 글자까지 | 생성 속도 |
|---|---|---|---|
| 3,000자 | 1,607 | 0.49초 | 초당 141.2토큰 |
| 15,000자 | 7,980 | 0.93초 | 초당 128.6토큰 |
| 100,000자 | 48,610 | 7.53초 | 초당 119.5토큰 |
약 4만 9천 토큰(한국어 10만 자)을 넣어도 7.5초 만에 요약을 쓰기 시작했습니다. 입력을 읽는 속도로 따지면 초당 약 6,500토큰입니다. 입력이 길어질수록 생성 속도는 조금씩 떨어졌지만, 가장 긴 경우에도 초당 119토큰을 유지했습니다.
테스트 5. 없는 소설을 물어보면
실제로는 없는 작품인 "한국 소설가 윤서하가 2018년에 발표한 『푸른 등대의 겨울』의 줄거리"를 물었습니다. 작은 모델은 이런 질문에 그럴듯한 줄거리를 지어내는 경우가 많습니다.

줄거리를 지어내지 않고 "확인할 수 없다"고 답한 뒤, 제목이나 작가 이름을 다시 확인해 달라고 했습니다.
Gemma 4 12B는 줄거리를 지어내지 않고, 해당 작품을 확인할 수 없다고 답했습니다. 다만 답변 안의 작품 제목 부분에 굵은 글씨 기호(**)가 그대로 보이는 등, 서식이 조금 어긋나는 부분은 있었습니다.
테스트 6. 이미지 넣기
이 모델은 이미지를 읽을 수 있습니다. 블로그 글에 쓰려고 만들어 둔 모래시계 사진을 넣고 무엇이 보이는지 설명하게 했습니다.

모래시계 두 개와, 오른쪽 모래시계 안의 컴퓨터 부품까지 알아봤습니다.
나무 책상 위의 모래시계 두 개, 오른쪽 모래시계 안에 컴퓨터 부품이 들어 있는 점, 어두운 조명까지 정확히 설명했습니다. 생성 속도는 초당 140.72토큰이었고, 첫 토큰까지는 8.84초가 걸렸습니다. 글자만 넣을 때(1초 안쪽)보다 오래 걸리므로, 이미지를 넣을 때는 몇 초 기다린다고 생각하면 됩니다.
정리
- 속도: RTX 5090에서 기본 설정 기준 초당 약 145토큰. 대화용으로는 충분히 빠릅니다.
- VRAM: 기본 컨텍스트에서 약 9GB, 최대 컨텍스트(262K)에서도 약 13.1GB. 32GB 카드에서는 여유가 많이 남습니다.
- 생각 기능: 켜 두는 것이 맞습니다. 끄면 빨라지지만 간단한 산수를 5번 모두 틀렸습니다.
- 한국어: 글쓰기와 요약은 자연스러웠고, 없는 작품을 물었을 때 지어내지 않았습니다.
RTX 5090의 VRAM에 비하면 12B 모델은 작은 편입니다. 더 큰 모델이 궁금하다면 Qwen3.8-27B 소개 글을, RTX 5090 자체의 사양은 RTX 5090 블랙웰 아키텍처 글을 참고하세요. 로컬 모델과 API 요금을 비교한 내용은 9월 AI API 가격 비교에 있습니다.
자주 묻는 질문
Gemma 4 12B QAT는 VRAM을 얼마나 쓰나요?
LM Studio 기본 설정(컨텍스트 8,192)에서 약 9GB를 썼습니다. 컨텍스트를 최대인 262,144로 늘리면 약 13.1GB였습니다. RTX 5090(32GB)에서 잰 값입니다.
RTX 5090에서 Gemma 4 12B는 초당 몇 토큰인가요?
기본 설정에서 초당 143~145토큰, 생각 기능을 끄면 초당 146~148토큰이었습니다. 약 8천 토큰 길이의 글을 넣었을 때는 초당 128.6토큰, 약 4만 9천 토큰일 때는 초당 119.5토큰이었습니다.
생각(thinking) 기능은 켜는 게 좋나요?
계산이나 논리가 필요한 질문이라면 켜는 것이 좋습니다. 같은 산수 문제를 5번씩 물었을 때 생각을 켜면 5번 모두 맞혔고, 끄면 5번 모두 틀렸습니다. 대신 켜면 답이 나오기까지 2초 정도 더 걸렸습니다.
LM Studio에서 설정을 바꿔야 하나요?
RTX 5090에서는 기본값 그대로도 모든 층이 GPU에 올라가고 Flash Attention도 켜져 있어 따로 바꿀 필요가 없었습니다. 긴 문서를 다룬다면 컨텍스트 길이만 늘리면 됩니다.
댓글 0개