AI 테스트 RTX-5060TI 16GB

16GB 그래픽카드로 Gemma 4 12B 돌려도 될까, 7GB가 남았다 (RTX 5060 Ti 16GB 실측)

EVUELA 2026년 09월 28일 265회 1일 전
16GB 그래픽카드로 Gemma 4 12B 돌려도 될까, 7GB가 남았다 (RTX 5060 Ti 16GB 실측)

구글의 Gemma 4 12B QAT 모델(Q4_0, 7.15GB)을 RTX 5060 Ti 16GB PC의 LM Studio에서 직접 돌려 봤습니다. RTX 5090에서 같은 모델을 테스트한 글과 똑같은 질문과 방법을 썼고, 설정도 LM Studio 기본값 그대로 뒀습니다. 결과부터 말하면 기본 설정에서 초당 약 44토큰이 나왔고, VRAM은 약 8.6GB를 썼습니다. 속도는 RTX 5090의 3분의 1 정도지만, 16GB 카드에서도 모델 전체가 GPU에 올라가 무리 없이 돌아갔습니다.

테스트 PC 사양

부품 사양
GPU NVIDIA GeForce RTX 5060 Ti (VRAM 16GB, 전력 제한 180W)
GPU 연결 PCIe 3.0 x8 (메인보드가 PCIe 3.0까지 지원)
GPU 드라이버 616.92 (CUDA 13.4)
CPU Intel Core i5-9400F (6코어 6스레드)
메인보드 MSI H310M PRO-VD PLUS
메모리 DDR4 32GB (16GB × 2, 2666MT/s)
저장장치 Crucial MX500 1TB SATA SSD (모델 파일 위치)
운영체제 Windows 11 Pro 25H2 (빌드 26200)
LM Studio 0.4.25
추론 엔진 llama.cpp CUDA 12 런타임 2.46.0 (LM Studio 기본 선택)

그래픽카드만 요즘 것이고 나머지는 몇 년 된 부품입니다. 모델을 올리기 전 GPU 메모리 사용량은 994MiB였습니다. 윈도우 화면과 다른 프로그램이 쓰는 양이라, 아래 VRAM 수치에서는 불러오기 직전 값을 뺀 만큼을 모델이 쓴 양으로 봤습니다.

테스트한 모델: Gemma 4 12B QAT

Gemma 4는 구글 딥마인드가 공개한 모델 제품군이고, 12B는 파라미터가 120억 개인 중간 크기 모델입니다. 이번에 쓴 파일은 LM Studio 모델 페이지의 google/gemma-4-12b-qat로, 4비트(Q4_0)로 줄인 GGUF 파일입니다.

이름의 QAT는 양자화 인식 학습(Quantization-Aware Training)의 줄임말입니다. 다 학습한 모델을 나중에 4비트로 줄이는 대신, 처음부터 4비트로 줄일 것을 전제로 학습시킨 모델입니다. 구글 모델 카드는 이 방식이 bfloat16 원본과 비슷한 품질을 유지하면서 필요한 메모리를 크게 줄인다고 설명합니다 (Gemma 4 12B QAT 모델 카드).

항목 내용
파일 gemma-4-12B-it-QAT-Q4_0.gguf, 7.15GB
양자화 Q4_0 (4비트)
최대 컨텍스트 262,144토큰
기능 이미지 입력(비전), 도구 호출, 생각(thinking)
라이선스 Apache 2.0

LM Studio My Models 화면의 Gemma 4 12B QAT 모델 정보

LM Studio의 My Models 화면. 오른쪽 모델 정보에 Q4_0, 7.15GB와 비전·도구·생각 기능 표시가 보입니다.

LM Studio 기본 설정값

설정은 하나도 바꾸지 않고, LM Studio가 이 PC에서 이 모델에 잡아 주는 기본값으로 테스트했습니다. 컨텍스트 길이 테스트만 예외입니다.

불러오기(Load) 설정

LM Studio Load 탭의 Gemma 4 12B 기본 설정

Load 탭의 기본값. 컨텍스트 8,192, GPU 오프로드 48(전체 층)입니다. 16GB 카드에서도 모든 층을 GPU에 올리도록 잡혔습니다.

LM Studio Load 탭 고급 설정과 Flash Attention

아래로 내리면 Flash Attention이 기본으로 켜져 있고, KV 캐시 양자화는 꺼져 있습니다.

설정 기본값 뜻
컨텍스트 길이 8,192 한 번에 기억하는 토큰 수. 모델은 최대 262,144까지 지원합니다
GPU 오프로드 48 (전체) 모델의 48개 층을 모두 GPU에 올립니다
Flash Attention 켬 긴 입력에서 메모리와 시간을 아끼는 계산 방식
KV 캐시를 GPU에 저장 켬 대화 내용 캐시를 GPU 메모리에 둡니다
CPU 스레드 2 CPU가 거드는 작업에 쓰는 스레드 수. RTX 5090 PC(24스레드 CPU)에서는 9였습니다
평가 배치 / 물리 배치 2048 / 512 입력을 한 번에 몇 토큰씩 처리할지
최대 동시 예측 4 동시에 받을 수 있는 요청 수(실험 기능)
KV 캐시 양자화 끔 켜면 메모리를 아끼지만 품질이 떨어질 수 있습니다

RTX 5090 PC와 달랐던 기본값은 CPU 스레드 수 하나뿐이었습니다. 나머지는 모두 같습니다.

LM Studio 모델 불러오기 창의 예상 메모리 8.20GB

불러오기 창에서 LM Studio가 계산한 예상 메모리는 GPU 8.20GB였습니다. RTX 5090에서 본 값과 같습니다.

추론(Inference) 설정

LM Studio Inference 탭의 생각 기능과 온도 기본값

Inference 탭. 생각(Enable Thinking)이 기본으로 켜져 있고, 온도는 1입니다.

LM Studio 샘플링 기본값 Top K Top P Min P

샘플링 기본값. Top K 64, 반복 패널티 1, Top P 0.95, Min P 0.05입니다.

추론 설정은 RTX 5090 PC와 똑같았습니다. 생각 기능이 기본으로 켜져 있어서, 모델이 답하기 전에 먼저 풀이 과정을 만든 뒤 답을 씁니다.

테스트 1. 불러오는 시간과 VRAM

이 PC에서 모델을 처음 불러올 때는 21.6초가 걸렸습니다. SATA SSD에서 파일을 처음 읽은 경우입니다. 파일이 메모리 캐시에 들어간 뒤에는 7.9~8.0초였습니다. 컨텍스트 길이만 바꿔 다시 불러오며 VRAM을 잰 결과는 다음과 같습니다.

컨텍스트 길이 불러온 뒤 GPU 메모리 모델이 쓴 양 LM Studio 예상 불러오는 시간 참고: RTX 5090 모델이 쓴 양
8,192 (기본값) 9,819MiB 약 8.6GB 8.11GiB 7.9초 약 9.0GB
32,768 10,207MiB 약 9.0GB 11.84GiB 8.0초 약 9.3GB
131,072 11,849MiB 약 10.6GB 26.76GiB 8.0초 약 11.0GB
262,144 (최대) LM Studio가 불러오기를 거부 46.66GiB - 약 13.1GB

기본값인 8,192에서는 약 8.6GB를 써서, 16GB 카드에 7GB 넘게 여유가 남았습니다. 131,072까지 늘려도 약 10.6GB였습니다.

눈여겨볼 점은 LM Studio의 예상치와 실제 사용량의 차이입니다. 기본 컨텍스트에서는 예상(8.11GiB)과 실제(약 8.6GB)가 거의 맞았지만, 컨텍스트를 늘릴수록 예상치가 실제보다 훨씬 크게 나왔습니다. 131,072에서는 26.76GiB를 예상했는데 실제로는 약 10.6GB만 썼습니다.

최대인 262,144에서는 LM Studio가 예상 메모리를 46.66GiB로 계산했고, 실제로 불러오려 하자 약 44.87GB가 필요하다며 시스템이 멈출 수 있다고 불러오기 자체를 거부했습니다. LM Studio 기본 설정에 들어 있는 "모델 불러오기 안전장치(guardrails)" 때문입니다. 설정을 바꾸지 않는 것이 이번 테스트의 원칙이라 안전장치는 그대로 뒀습니다. 같은 모델이 RTX 5090에서 262,144 컨텍스트로 약 13.1GB를 쓴 것을 보면 16GB 카드에도 들어갈 가능성이 있어 보이지만, 이 PC에서 직접 확인한 것은 아닙니다(추정).

테스트 2. 생성 속도

"집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점을 800자 정도로 써 주세요"를 물었습니다. LM Studio 채팅 화면에서 한 번, 같은 조건의 API 요청으로 생각 켬·끔 각각 3번씩 잰 기록입니다.

LM Studio 채팅에서 Gemma 4 12B가 한국어 글을 쓰는 화면

채팅 화면. 답하기 전에 23.05초 동안 생각한 뒤 글을 썼습니다.

LM Studio 답변 아래 초당 42.67토큰 표시

답변 아래 통계. 초당 42.67토큰, 1,569토큰 생성, 첫 토큰까지 0.24초입니다.

회차 생각 초당 토큰 생성 토큰 (그중 생각) 첫 토큰까지 답이 끝날 때까지
채팅 화면 켬 42.67 1,569 0.24초 -
API 1 켬 43.6 1,552 (970) 0.12초 35.8초
API 2 켬 43.8 1,308 (773) 0.08초 30.1초
API 3 켬 43.6 1,710 (1,089) 0.08초 39.5초
API 1 끔 44.5 638 (0) 0.10초 14.6초
API 2 끔 44.6 684 (0) 0.07초 15.5초
API 3 끔 44.3 628 (0) 0.08초 14.4초

같은 방법으로 잰 RTX 5090 결과와 나란히 놓으면 다음과 같습니다.

항목 RTX 5060 Ti 16GB 참고: RTX 5090
초당 토큰 (생각 켬, API 3회 평균) 43.6 144.3
초당 토큰 (생각 끔, API 3회 평균) 44.4 147.1
800자 글 받는 시간 (생각 켬) 30~40초 9~14초
800자 글 받는 시간 (생각 끔) 14~16초 4~5초

RTX 5060 Ti는 RTX 5090의 약 30% 속도였습니다. 이런 모델의 글자 생성 속도는 주로 GPU 메모리 대역폭에 달려 있는데, 공식 사양으로 RTX 5060 Ti 16GB는 448GB/s, RTX 5090은 1,792GB/s입니다. 대역폭 차이가 4배이니 속도 차이도 대부분 여기서 나왔다고 보고 있습니다(추정).

초당 44토큰이면 화면에 글이 올라오는 속도 자체는 읽기에 답답하지 않았습니다. 체감상 기다린다는 느낌이 드는 부분은 생각하는 시간입니다. 생각을 켜면 본문이 나오기 전에 700~1,100토큰의 풀이를 먼저 만들기 때문에, 채팅 화면에서는 23초 동안 "생각 중"만 보다가 글이 시작됐습니다.

테스트 3. 생각 기능을 끄면 산수를 틀린다

"사과 한 상자에 24개가 들어 있습니다. 3상자를 사서 19개를 먹고, 남은 것을 5명이 똑같이 나누면 한 사람당 몇 개이고 몇 개가 남나요?"를 물었습니다. 정답은 24 × 3 = 72개에서 19개를 빼 53개, 53 ÷ 5 = 한 사람당 10개, 3개 남음입니다.

생각 기능을 켠 Gemma 4 12B의 산수 풀이 과정

생각을 켠 기본 설정. 6.97초 동안 단계별로 계산한 뒤 정답을 냈습니다.

생각 기능을 끈 Gemma 4 12B의 틀린 산수 답

생각을 끈 경우. 곧바로 "한 사람당 10개, 남는 것 0개"라는 틀린 답을 냈습니다.

한 번의 결과로 판단하지 않으려고 같은 질문을 API로 5번씩 더 물었습니다.

설정 정답 횟수 나온 답 평균 응답 시간 평균 생각 토큰 참고: RTX 5090
생각 켬 (기본값) 5번 중 5번 5번 모두 "10개, 3개 남음" 6.7초 271 5번 중 5번, 2.1초
생각 끔 5번 중 0번 13개·1개, 9개·3개, 11개·4개, 11개·4개, 10개·4개 0.5초 0 5번 중 0번, 0.2초

결과는 RTX 5090과 똑같았습니다. 생각을 끄면 0.5초 만에 답하지만 5번 모두 틀렸고, 틀린 답도 매번 달랐습니다. 생각을 켜면 5번 모두 맞혔습니다. 정답률은 그래픽카드가 아니라 모델과 설정이 정한다는 것을 확인한 셈입니다. 다만 5060 Ti에서는 생각하는 데 드는 시간이 2초에서 7초 정도로 늘어납니다.

테스트 4. 긴 글을 넣었을 때

RTX 5090 테스트와 같은 글(이 블로그의 업데이트 기록)을 3,000자, 15,000자, 100,000자로 잘라 넣고 세 문장으로 요약하게 했습니다. 입력이 컨텍스트에 들어가도록 앞의 두 개는 컨텍스트 32,768, 마지막은 131,072로 불러왔고, 요약 시간만 보려고 생각은 껐습니다.

입력 입력 토큰 첫 글자까지 생성 속도 참고: RTX 5090 첫 글자까지
3,000자 1,607 1.04초 초당 42.1토큰 0.49초
15,000자 7,980 3.60초 초당 37.5토큰 0.93초
100,000자 48,610 35.14초 초당 34.5토큰 7.53초

한국어 10만 자(약 4만 9천 토큰)를 넣으면 요약을 쓰기 시작할 때까지 35초가 걸렸습니다. 입력을 읽는 속도로 따지면 초당 약 1,400토큰으로, RTX 5090(초당 약 6,500토큰)의 5분의 1 정도입니다. 긴 문서를 자주 넣는다면 생성 속도보다 이 대기 시간이 더 크게 느껴질 것입니다. 요약 내용은 세 경우 모두 글의 주요 변경 사항을 제대로 짚었습니다.

테스트 5. 없는 소설을 물어보면

실제로는 없는 작품인 "한국 소설가 윤서하가 2018년에 발표한 『푸른 등대의 겨울』의 줄거리"를 물었습니다. 작은 모델은 이런 질문에 그럴듯한 줄거리를 지어내는 경우가 많습니다.

없는 소설 질문에 확인되지 않는다고 답한 Gemma 4 12B

27.36초 동안 생각한 뒤, 줄거리를 지어내지 않고 "확인되지 않는다"고 답했습니다.

RTX 5090에서와 마찬가지로 줄거리를 지어내지 않았습니다. 작가 이름이나 제목의 오타, 웹소설 같은 다른 매체일 가능성을 짚고, 기억나는 내용을 알려 달라고 했습니다. 작품 제목 앞뒤에 굵은 글씨 기호(**)가 그대로 보이는 서식 문제도 5090 때와 같았습니다.

테스트 6. 이미지 넣기

RTX 5090 테스트와 같은 모래시계 사진을 넣고 무엇이 보이는지 한국어 세 문장으로 설명하게 했습니다.

모래시계 사진을 설명하는 Gemma 4 12B 비전 기능

모래시계 두 개와, 오른쪽 모래시계 안의 컴퓨터 부품, 흐릿한 배경의 전자 장비까지 알아봤습니다.

나무 탁자 위의 모래시계 두 개, 오른쪽 모래시계 안에 컴퓨터 부품이 들어 있는 점, 어두운 조명까지 정확히 설명했고, 요청대로 세 문장으로 답했습니다. 17.45초 동안 생각했고, 생성 속도는 초당 42.81토큰, 첫 토큰까지는 8.32초였습니다. 이미지를 넣었을 때 첫 토큰까지 걸린 시간은 RTX 5090(8.84초)과 비슷했습니다.

정리

  • 속도: RTX 5060 Ti 16GB에서 기본 설정 기준 초당 약 44토큰. RTX 5090의 약 30%지만 대화용으로는 충분합니다.
  • VRAM: 기본 컨텍스트에서 약 8.6GB, 131,072에서도 약 10.6GB. 16GB 카드에 모델 전체가 여유 있게 올라갑니다.
  • 최대 컨텍스트: 262,144는 LM Studio 기본 안전장치가 불러오기를 거부했습니다. 예상치가 실제보다 크게 계산되는 경향이 있습니다.
  • 생각 기능: 켜 두는 것이 맞습니다. 끄면 간단한 산수를 5번 모두 틀렸습니다. 대신 5060 Ti에서는 답을 받기까지 몇 초에서 수십 초를 더 기다려야 합니다.
  • 긴 문서: 약 4만 9천 토큰을 넣으면 첫 글자까지 35초. 긴 입력에서 5090과의 차이가 가장 크게 벌어졌습니다.

같은 모델을 RTX 5090에서 잰 기록은 Gemma 4 12B RTX 5090 실측 글에, 27B 모델을 3.8GB로 줄인 Bonsai 테스트는 Bonsai 27B RTX 5090 실측 글에 있습니다. 로컬 모델과 API 요금을 비교한 내용은 9월 AI API 가격 비교를 참고하세요.

자주 묻는 질문

RTX 5060 Ti 16GB로 Gemma 4 12B QAT를 돌릴 수 있나요?

네. LM Studio 기본 설정에서 모델의 48개 층이 모두 GPU에 올라갔고, VRAM은 약 8.6GB를 썼습니다. 컨텍스트를 131,072로 늘려도 약 10.6GB였습니다.

RTX 5060 Ti에서 Gemma 4 12B는 초당 몇 토큰인가요?

기본 설정(생각 켬)에서 초당 43.6~43.8토큰, 생각을 끄면 초당 44.3~44.6토큰이었습니다. 같은 방법으로 잰 RTX 5090은 초당 143~148토큰이었습니다.

262,144 컨텍스트도 쓸 수 있나요?

LM Studio 기본 설정에서는 안 됩니다. LM Studio가 46.66GiB(불러오기 거부 메시지에는 약 44.87GB)가 필요하다고 계산해 불러오기를 거부했습니다. 실제 사용량은 예상보다 훨씬 적은 경향이 있지만, 16GB 카드에 실제로 들어가는지는 이번에 확인하지 않았습니다.

생각(thinking) 기능은 켜는 게 좋나요?

계산이나 논리가 필요한 질문이라면 켜는 것이 좋습니다. 같은 산수 문제를 5번씩 물었을 때 생각을 켜면 5번 모두 맞혔고, 끄면 5번 모두 틀렸습니다. RTX 5060 Ti에서는 켜면 답이 나오기까지 평균 6.7초, 끄면 0.5초였습니다.

RTX 5090과 비교하면 얼마나 느린가요?

글을 만드는 속도는 약 30%, 긴 글을 읽어 들이는 속도는 약 20% 수준이었습니다. 산수 정답률, 없는 소설에 대한 답, 이미지 설명처럼 답의 내용은 두 PC에서 같은 경향을 보였습니다.

댓글 0개