구글의 Gemma 4 26B A4B QAT 모델(Q4_0, 파일 15.63GB)을 RTX 5060 Ti 16GB PC의 LM Studio에서 기본 설정 그대로 돌려 봤습니다. 결론부터 말하면 모델은 로드됐고 답도 잘 했습니다. 다만 파일이 16GB VRAM에 다 들어가지 않아, LM Studio가 모델 일부를 시스템 램(RAM)에 두었습니다. 그래서 답을 만드는 동안 CPU는 96%까지 바빴고, GPU 사용률은 절반도 안 됐습니다. 생성 속도는 약 21t/s(초당 토큰)로, 같은 PC에서 잰 Gemma 4 12B(약 44t/s)의 절반 정도였습니다.
테스트 PC 사양
| 부품 | 사양 |
|---|---|
| GPU | NVIDIA GeForce RTX 5060 Ti (VRAM 16GB, 전력 제한 180W) |
| GPU 연결 | PCIe 3.0 x8 (메인보드가 PCIe 3.0까지 지원) |
| GPU 드라이버 | 616.92 (CUDA 13.4) |
| CPU | Intel Core i5-9400F (6코어 6스레드) |
| 메인보드 | MSI H310M PRO-VD PLUS |
| 시스템 램 | DDR4 32GB (16GB × 2, 2666MT/s) |
| 저장장치 | Crucial MX500 1TB SATA SSD (모델 파일 위치) |
| 운영체제 | Windows 11 Pro 25H2 (빌드 26200) |
| LM Studio | 0.4.25 |
| 런타임 | llama.cpp CUDA 12 런타임 2.46.0 (LM Studio 기본 선택) |
Gemma 4 12B 테스트와 같은 PC입니다. GPU는 최신이지만 CPU와 램은 몇 년 된 부품입니다. 이번 테스트에서는 이 차이가 결과에 크게 드러났습니다.
테스트한 모델: Gemma 4 26B A4B QAT
Gemma 4 26B A4B는 구글이 공개한 Gemma 4 제품군의 모델입니다. 이름의 A4B는 활성 파라미터가 약 4B(40억 개)라는 뜻입니다. 전체 파라미터는 25.2B(252억 개)지만, 토큰 하나를 만들 때는 그중 3.8B만 계산합니다.
이런 구조를 MoE(Mixture of Experts)라고 부릅니다. 모델 안에 익스퍼트가 128개 있고, 토큰마다 그중 8개와 공용 익스퍼트 1개만 골라 씁니다. 그래서 계산량은 작은 모델 수준이지만, 모델 파일 전체는 메모리에 올려 둬야 합니다. 이번 테스트의 핵심이 바로 이 부분입니다.
| 항목 | 내용 |
|---|---|
| 파라미터 | 전체 25.2B, 활성 3.8B |
| 구조 | MoE, 익스퍼트 128개 중 8개 + 공용 1개 사용, 30레이어 |
| 파일 | Q4_0(4비트 양자화), LM Studio 표시 15.63GB |
| 최대 컨텍스트 | 262,144토큰 |
| 기능 | 이미지 입력, 도구 호출, 생각(Thinking) 켬·끔 |
| 라이선스 | Apache 2.0 |
QAT(Quantization-Aware Training)는 처음부터 4비트로 양자화할 것을 전제로 학습시킨 모델입니다. 원본과 비슷한 품질을 유지하면서 메모리를 줄였다고 모델 카드에 적혀 있습니다(모델 카드).
모델 카드의 벤치마크 점수는 아래와 같습니다. 제작사 측정이고, 양자화하기 전 원본 모델 기준입니다.
| 벤치마크 | Gemma 4 26B A4B | Gemma 4 12B |
|---|---|---|
| MMLU Pro (지식) | 82.6% | 77.2% |
| AIME 2026 (수학, 도구 없이) | 88.3% | 77.5% |
| LiveCodeBench v6 (코딩) | 77.1% | 72.0% |
| GPQA Diamond (과학) | 82.3% | 78.8% |
| MMMU Pro (이미지 이해) | 73.8% | 69.1% |
모든 항목에서 12B보다 점수가 높습니다. 이 모델을 16GB GPU에서 어느 정도 속도로 쓸 수 있는지가 이번 테스트의 질문입니다.

My Models 화면. 파라미터 26B-A4B, Q4_0, 파일 크기 15.63GB로 표시됩니다.
LM Studio 기본 설정값
설정은 바꾸지 않고, LM Studio가 이 PC에서 이 모델에 잡아 주는 기본값으로 테스트했습니다. 컨텍스트(모델이 한 번에 기억하는 글의 길이)를 바꿔 보는 테스트만 예외입니다.

Load 탭 기본값. 컨텍스트 8,192, GPU 오프로드 30(전체 레이어)입니다.

아래로 내리면 MoE 모델에만 있는 "전문가 수"(익스퍼트 수) 8과 "Number of layers 0"이 보입니다. Flash Attention은 켜져 있습니다.
| 설정 | 기본값 | 뜻 |
|---|---|---|
| 컨텍스트 길이 | 8,192 | 한 번에 기억하는 토큰 수. 최대 262,144 |
| GPU 오프로드 | 30 (전체) | 30개 레이어를 모두 GPU에 올리라는 설정. 실제로는 아래 VRAM 절처럼 다 올라가지 않았습니다 |
| 전문가 수 (익스퍼트 수) | 8 | 토큰마다 쓰는 익스퍼트 수 |
| Number of layers | 0 | 익스퍼트를 CPU로 보낼 레이어 수. 0이면 쓰지 않음 |
| Flash Attention | 켬 | 긴 입력에서 메모리와 시간을 아끼는 계산 방식 |
| Speculative Decoding | 끔 | 작은 모델로 다음 토큰을 미리 짐작해 속도를 올리는 기능 |
| CPU 스레드 | 2 | CPU가 계산에 쓰는 스레드 수 |
| 평가 배치 / 물리 배치 | 2048 / 512 | 프롬프트를 한 번에 몇 토큰씩 처리할지 |
| 모델을 메모리에 유지 / mmap | 켬 / 켬 | 모델 파일을 시스템 램에도 올려 둠 |

"Number of layers" 설명. VRAM을 아끼고, 레이어 일부만 GPU에 올리는 것보다 빠를 수 있지만, VRAM에 다 들어가는 모델에는 권하지 않는다고 적혀 있습니다.

모델 로드 창의 예상 메모리는 GPU 15.90GB였습니다. LM Studio가 이 GPU의 VRAM으로 인식한 값(15.90GB)과 같습니다.
추론(Inference) 설정

Inference 탭. 생각(Enable Thinking)이 기본으로 켜져 있고 온도는 1입니다.

샘플링 기본값. Top K 64, 반복 패널티 1, Top P 0.95, Min P 0.05로 Gemma 4 12B와 같습니다.
VRAM과 시스템 램: 16GB에 다 들어가지 않았다
모델을 로드하기 전과 후의 VRAM과 시스템 램 사용량을 비교했습니다. 로드 전에는 VRAM 약 0.9GB, 시스템 램 약 11.1GB를 쓰고 있었습니다.
| 컨텍스트 | VRAM 증가 | 시스템 램 증가 | LM Studio 예상 | 로드 시간 |
|---|---|---|---|---|
| 8,192 (기본값) | 12.4GB | 14.1GB | 14.56GiB | 45.8초 (처음) |
| 32,768 | 13.0GB | 14.3GB | 17.59GiB | 13.7초 |
| 65,536 | 13.4GB | 14.4GB | 20.18GiB | 13.6초 |
| 131,072 | 14.5GB | 15.0GB | 25.35GiB | 13.8초 |
| 262,144 (최대) | 14.7GB | 16.6GB | 35.71GiB | 15.7초 |
이 표에서 알 수 있는 것은 두 가지입니다.
- VRAM이 남는데도 모델이 GPU에 다 올라가지 않았습니다. 기본 컨텍스트에서 모델이 쓴 VRAM은 12.4GB로, 약 2.6GB가 남았습니다. 그런데 모델 파일은 14.56GiB입니다. 계산해 보면 모델의 최소 2GB 정도는 GPU가 아니라 시스템 램에서 CPU로 돌고 있다는 뜻입니다(추정).
- 최대 컨텍스트 262,144도 로드됐습니다. 같은 PC에서 Gemma 4 12B는 이 컨텍스트에서 LM Studio가 로드를 거부했습니다. 이번에는 VRAM 14.7GB, 시스템 램 16.6GB를 쓰며 올라갔습니다.
시스템 램이 14GB 넘게 늘어난 것은 "모델을 메모리에 유지" 설정 때문에 파일 전체가 램에도 올라가기 때문으로 보입니다. 이 숫자만으로는 몇 개 레이어가 CPU에서 돌았는지 알 수 없습니다. LM Studio 로그에도 레이어 수는 나오지 않았습니다.

LM Studio Hardware 화면. "Limit Model Offload to Dedicated GPU Memory"가 켜져 있어, 모델 가중치를 GPU 전용 메모리와 램에만 둡니다. 아래 Resource Monitor에는 RAM + VRAM 13.90GB로 표시됩니다.

이 PC의 모델 로딩 가드레일은 "완화됨"입니다. 예상 35.71GiB인 262,144 컨텍스트도 막지 않았습니다.
처음 로드할 때 45.8초가 걸린 것은 15.6GB 파일을 SATA SSD에서 처음 읽었기 때문입니다. 파일이 캐시에 들어간 뒤에는 13~16초였습니다.
테스트 1. 800자 글 쓰기 속도
"집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점을 800자 정도로 써 주세요"를 물었습니다. API로 생각 켬·끔 각각 3번 재고, 채팅 화면에서도 한 번 물었습니다.

생각 과정을 펼친 화면. 영어로 글의 구성을 먼저 짭니다.

1분 1초 동안 생각한 뒤 쓴 글. 굵은 글씨 기호(**)가 그대로 보이는 곳이 있습니다.

답변 아래 통계. 16.61t/s, 1,604토큰, 첫 토큰까지 1.15초입니다.
| 회차 | 생각 | 생성 속도 | 생성 토큰 (그중 생각) | 답이 끝날 때까지 |
|---|---|---|---|---|
| 채팅 화면 | 켬 | 16.61t/s | 1,604 | - |
| API 1 | 켬 | 16.4t/s | 1,858 (1,352) | 114.6초 |
| API 2 | 켬 | 19.2t/s | 1,368 (916) | 71.5초 |
| API 3 | 켬 | 18.7t/s | 1,665 (1,189) | 89.1초 |
| API 1 | 끔 | 21.3t/s | 563 (0) | 27.0초 |
| API 2 | 끔 | 21.2t/s | 582 (0) | 27.7초 |
| API 3 | 끔 | 20.9t/s | 613 (0) | 29.5초 |
생각을 끄면 약 21t/s, 켜면 16~19t/s였습니다. 생각을 켜면 본문을 쓰기 전에 900~1,350토큰의 생각을 먼저 만들기 때문에, 글 한 편을 받는 데 1~2분이 걸렸습니다. 끄면 약 30초였습니다.
같은 PC에서 Gemma 4 12B는 약 44t/s였습니다. 26B A4B는 토큰마다 계산하는 양(활성 파라미터 3.8B)이 12B보다 적은데도 속도는 절반이었습니다. 이유는 다음 절에서 봅니다.
테스트 2. 전력과 온도: GPU는 기다리고 CPU가 바빴다
800자 글을 쓰는 동안(생각 끔) 0.5초마다 GPU 전력·온도·사용률을 기록했습니다.
| 항목 | 1회 | 2회 |
|---|---|---|
| 대기 전력 | 14.9W | 14.8W |
| 글 쓰는 동안 평균 전력 | 29.6W | 35.5W |
| 최고 전력 | 35.0W | 35.8W |
| 최고 온도 | 48°C | 48°C |
| 평균 GPU 사용률 | 48.0% | 31.7% |
| 토큰당 에너지 (GPU만) | 1.42J | 1.73J |
이 GPU의 전력 제한은 180W인데, 글을 쓰는 동안 36W를 넘지 않았습니다. GPU 사용률도 절반이 안 됐습니다. 같은 시각 작업 표시줄 모니터에는 CPU 96%, GPU 29%가 찍혔습니다.

채팅에서 글을 쓰는 동안의 작업 표시줄 모니터. CPU는 96%, GPU는 29%입니다.
시스템 램으로 오프로드된 부분은 CPU가 계산합니다. 이 PC의 CPU(6코어)와 DDR4 램이 그 부분을 처리하는 동안 GPU는 기다리게 됩니다(추정). 모델이 VRAM에 다 들어갔던 12B가 더 빨랐던 이유로 보입니다.
토큰당 에너지는 GPU 전력만 잰 값입니다. 이번에는 CPU가 많이 일했기 때문에 PC 전체 전력은 이보다 큽니다. CPU 전력은 재지 않았습니다.
테스트 3. 산수: 생각을 끄면 5번 모두 같은 오답
"사과 한 상자에 24개가 들어 있습니다. 3상자를 사서 19개를 먹고, 남은 것을 5명이 똑같이 나누면 한 사람당 몇 개이고 몇 개가 남나요?"를 물었습니다. 정답은 한 사람당 10개, 3개 남음입니다.

생각 켬. 15.54초 동안 24×3=72, 72−19=53, 53÷5=10 나머지 3을 차례로 계산했습니다.

생각 끔. 곧바로 "한 사람당 10개, 남는 것 1개"라는 틀린 답을 냈습니다.
| 설정 | 정답 횟수 | 나온 답 | 평균 응답 시간 | 참고: 같은 PC의 12B |
|---|---|---|---|---|
| 생각 켬 (기본값) | 5번 중 5번 | 5번 모두 "10개, 3개 남음" | 12.8초 | 5번 중 5번, 6.7초 |
| 생각 끔 | 5번 중 0번 | 5번 모두 "11개, 1개 남음" | 0.9초 | 5번 중 0번, 0.5초 |
생각을 끄면 API에서는 5번 모두 같은 오답("11개, 1개")을 냈고, 채팅 화면에서는 다른 오답("10개, 1개")이 나왔습니다. 모델이 커져도 계산 문제는 생각을 켜야 맞힌다는 점은 12B와 같았습니다.
테스트 4. 긴 글 요약
이 블로그의 업데이트 기록을 3,000자, 15,000자, 100,000자로 잘라 넣고 세 문장으로 요약하게 했습니다(생각 끔). 앞의 둘은 컨텍스트 32,768, 마지막은 131,072로 로드했습니다.

3,000자 요약. 첫 토큰까지 3.41초, 약 13.9t/s였습니다.
| 입력 | 입력 토큰 | 첫 토큰까지 | 생성 속도 | 참고: 같은 PC의 12B 첫 토큰까지 |
|---|---|---|---|---|
| 3,000자 | 1,607 | 3.09초 | 15.3t/s | 1.04초 |
| 15,000자 | 7,980 | 9.96초 | 11.0t/s | 3.60초 |
| 100,000자 | 48,610 | 77.79초 | 5.0t/s | 35.14초 |
10만 자를 넣으면 요약이 시작될 때까지 1분 18초를 기다렸고, 생성 속도도 5t/s로 떨어졌습니다. 프롬프트 처리 속도(PP, 입력을 읽는 속도)는 520~800t/s로, 12B(1,400~2,200t/s)의 3분의 1 정도입니다.
요약 내용은 정확했습니다. 10만 자 요약에 나온 "KISA 기준 보안 점검", "IP 마스킹", "한알한알 게임"은 모두 원문에 있는 내용입니다.
테스트 5. 대화가 길어지면
앞선 대화가 약 1천, 8천, 2만 3천 토큰 쌓인 상태를 만들고, 이어서 다섯 문장을 쓰게 했습니다(생각 끔, 컨텍스트 32,768).
| 앞 대화 길이 | 첫 토큰까지 | 생성 속도 |
|---|---|---|
| 1,115토큰 | 2.1초 | 17.5t/s |
| 8,510토큰 | 11.3초 | 10.9t/s |
| 23,433토큰 | 23.3초 | 8.2t/s |
대화가 길어질수록 첫 토큰이 늦게 나오고, 생성 속도도 절반 이하로 떨어졌습니다. 다만 같은 채팅에서 이어서 물으면, LM Studio가 앞에서 처리한 부분을 캐시로 다시 쓰기 때문에 첫 토큰은 빨리 나옵니다.

약 1만 토큰짜리 글을 넣은 채팅에서 이어서 물은 답. 첫 토큰까지는 2.40초였지만 생성 속도는 8.74t/s로 느렸습니다.
테스트 6. 긴 문서에서 정보 찾기
약 1만 토큰(2만 자) 글의 10·30·50·70·90% 위치에 "블로그 관리자가 키우는 고양이 이름은 보리차, 2019년생"이라는 문장을 하나 숨기고 찾게 했습니다. 이 문장이 없는 글에도 같은 질문을 해서, 없는 정보를 지어내는지 확인했습니다.
| 숨긴 위치 | 결과 | 첫 토큰까지 |
|---|---|---|
| 10% | 찾음 | 16.0초 |
| 30% | 찾음 | 15.7초 |
| 50% | 찾음 | 15.7초 |
| 70% | 찾음 | 15.4초 |
| 90% | 찾음 | 5.2초 |
| 숨기지 않음 | "없음"이라고 답함 (정답) | 2.9초 |
다섯 곳 모두 정확히 찾았고, 문장이 없는 글에서는 지어내지 않고 "없음"이라고 답했습니다. 90%와 '숨기지 않음'이 빨랐던 것은 글 앞부분이 바로 전 질문과 같아서 LM Studio가 캐시를 다시 썼기 때문으로 보입니다(추정).

약 2만 자 글의 가운데(50%)에 숨긴 정보를 찾은 화면. 첫 토큰까지 18.66초였습니다.
한국어 품질
받은 한국어 답 전부에서 한자·일본어·러시아어 같은 외국 문자가 섞였는지 찾아봤습니다. 한 글자도 없었습니다. 문장도 자연스러웠습니다.
눈에 띈 점은 두 가지입니다. 채팅 화면에서 굵은 글씨 기호(**)가 그대로 보이는 곳이 있었습니다(12B와 같은 문제). 800자 글 안에는 "NVIDIA 그래픽카드를 선택하는 것이 정신 건강에 이롭습니다" 같은 가벼운 표현이 한 번 나왔습니다.
테스트 7. 없는 소설과 이미지
실제로는 없는 작품인 "윤서하 작가의 2018년 소설 『푸른 등대의 겨울』의 줄거리"를 물었습니다.

1분 18초 동안 생각한 뒤, 줄거리를 지어내지 않고 "확인되지 않는 작품"이라고 답했습니다.
생각을 켰을 때와 껐을 때 모두 줄거리를 지어내지 않았습니다. 다만 두 답 모두 "교보문고·YES24 같은 데이터베이스에서 확인되지 않는다"처럼, 실제로 검색해 본 것 같은 말투였습니다. 이 모델은 인터넷을 검색하지 않으므로 이 부분은 사실과 다릅니다.
이미지 테스트는 모래시계 사진을 넣고 한국어 세 문장으로 설명하게 했습니다.

모래시계 두 개, 오른쪽 모래시계 안의 컴퓨터 부품, 뒤쪽의 음향 장비까지 알아봤습니다. 1분 3초 생각, 15.57t/s.
| 설정 | 답이 끝날 때까지 | 설명 |
|---|---|---|
| 생각 켬 | 44.8초 (API) | 정확함. 생각 토큰 693개 |
| 생각 끔 | 7.5초 (API) | 정확함 |
사진 설명은 생각을 꺼도 정확했습니다. 사진 설명만 필요하다면 생각을 끄는 편이 6배 빨랐습니다.
정리
같은 PC(RTX 5060 Ti 16GB)에서 같은 방법으로 잰 Gemma 4 12B와 비교하면 다음과 같습니다.
| 항목 | Gemma 4 26B A4B | Gemma 4 12B |
|---|---|---|
| 파일 크기 | 15.63GB | 7.15GB |
| VRAM (기본 컨텍스트) | 12.4GB (일부는 시스템 램으로) | 8.6GB (전부 GPU) |
| 생성 속도 (생각 끔) | 21.1t/s | 44.4t/s |
| 생성 속도 (생각 켬) | 18.1t/s | 43.6t/s |
| 산수 (생각 켬 / 끔) | 5/5 / 0/5 | 5/5 / 0/5 |
| 10만 자 요약, 첫 토큰까지 | 77.8초 | 35.1초 |
| 최대 컨텍스트 262,144 | 로드됨 | LM Studio가 거부 |
| 제작사 벤치마크 (MMLU Pro) | 82.6% | 77.2% |
- 16GB GPU에서 돌아가기는 합니다. 기본 설정 그대로 로드됐고, 최대 컨텍스트까지 올라갔습니다.
- 하지만 모델이 VRAM에 다 들어가지 않아 CPU가 일부를 계산합니다. 그래서 GPU는 30~36W만 쓰며 기다렸고, 생성 속도는 12B의 절반이었습니다.
- 답의 품질은 좋았습니다. 외국 문자가 섞이지 않았고, 긴 문서에서 정보를 5번 모두 찾았고, 없는 소설과 없는 정보를 지어내지 않았습니다.
- 생각 기능은 켜 두는 것이 맞습니다. 끄면 산수를 5번 모두 틀렸습니다. 대신 이 PC에서는 글 한 편에 1~2분이 걸립니다.
빠른 대화가 중요하다면 같은 PC에서는 Gemma 4 12B가 낫습니다. 조금 느려도 벤치마크 점수가 더 높은 모델을 쓰고 싶다면 26B A4B도 쓸 만합니다. VRAM이 넉넉한 GPU에서의 결과는 RTX 5090에서 잰 Muse Glimmer 테스트와 RTX 5090의 Gemma 4 12B 테스트를 참고하세요. 여러 모델의 속도는 GPU 체험에서 한눈에 비교할 수 있습니다.
자주 묻는 질문
RTX 5060 Ti 16GB로 Gemma 4 26B A4B QAT를 돌릴 수 있나요?
네, LM Studio 기본 설정 그대로 로드됐습니다. 다만 모델이 VRAM에 다 들어가지 않아 일부를 시스템 램에 두고 돌립니다. 이 PC에서는 VRAM 12.4GB와 시스템 램 약 14GB를 함께 썼습니다.
RTX 5060 Ti에서 Gemma 4 26B는 몇 t/s인가요?
생각을 끄면 약 21t/s, 켜면 16~19t/s였습니다. 같은 PC의 Gemma 4 12B(약 44t/s)의 절반 정도입니다.
VRAM이 남는데 왜 느린가요?
LM Studio는 기본으로 모델 가중치를 GPU 전용 메모리와 시스템 램에 나눠 두는데, 이 모델은 일부를 시스템 램에 두었습니다. 그 부분을 CPU가 계산하는 동안 GPU가 기다립니다. 글을 쓰는 동안 CPU는 96%, GPU는 29%였습니다.
시스템 램은 얼마나 있어야 하나요?
이 PC(32GB)에서는 모델을 로드하자 시스템 램 사용량이 14~17GB 늘었습니다. 다른 프로그램을 함께 쓴다면 32GB는 있어야 여유가 있습니다.
생각 기능은 켜는 게 좋나요?
계산이 필요한 질문이라면 켜야 합니다. 같은 산수를 5번씩 물었을 때 켜면 5번 모두 맞혔고, 끄면 5번 모두 틀렸습니다. 사진 설명처럼 계산이 없는 일은 꺼도 정확했고 6배 빨랐습니다.
댓글 0개