AI를 직접 돌려보고
빛나는 숫자로 남겨요

로컬 AI를 직접 돌려 잰 속도와 메모리, 출처를 확인한 IT·AI 소식, 프로그래밍 이야기를 적습니다.

같은 질문, 두 그래픽카드

측정 때 답변을 잰 속도 그대로 재생합니다
모델
Gemma 4 12B QAT · Q4_0 (4비트) · LM Studio 기본 설정
질문
다음 주제로 800자 정도의 글을 써 주세요: 집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점
RTX 5090147.0 tok/s
RTX 5060 Ti 16GB10.07
[RTX 5060 Ti 16GB] 로컬 AI 코딩 모델 Qwen3-Coder 30B A3B, 16GB에서 얼마나 빠를까, 기본값 145t/s인데 컨텍스트를 늘리자 절반이 됐다 Qwen3-Coder 30B A3B () · UD-Q3_K_XL (3비트, unsloth)
144.6 tok/s VRAM 13.7GB / 16GB
RTX 509010.06
[RTX 5090 32GB] 로컬 AI Gemma 4 12B, Unsloth 기본값이면 충분할까, 32GB는 초당 233토큰인데 16GB는 52토큰이었다 Gemma 4 12B QAT () · UD-Q4_K_XL (4비트)
231.7 tok/s VRAM -GB / 32GB
RTX 5060 Ti 16GB10.05
[RTX 5060 Ti 16GB] 16GB 그래픽카드로 Qwen3.6 35B 돌아갈까, 3비트 파일이 VRAM 13.2GB에 초당 90토큰이었다 Qwen3.6 35B A3B () · UD-IQ3_XXS (3비트, unsloth)
115.0 tok/s VRAM -GB / 16GB
GPU 체험

16GB로
어디까지 돌아갈까?

직접 잰 메모리 사용량으로 그래픽카드 크기별로 판정합니다.

GPU 체험 열기
Gemma 4 12B QAT · 8,1928.6GB
원활 RTX 5060 Ti에서 돌려 봄
Bonsai 27B · 131,07213.8GB
주의 1.2GB 남음
Bonsai 27B · 262,14421.9GB
부적합 약 6.9GB 부족

최근 게시글

총 47개의 글
[RTX 5090 32GB] 로컬 AI 임베딩 모델 EmbeddingGemma 2 한국어 검색, 다르게 물으면 낱말 검색의 두 배를 찾았고 VRAM은 0.5GB였다 RTX-5090

[RTX 5090 32GB] 로컬 AI 임베딩 모델 EmbeddingGemma 2 한국어 검색, 다르게 물으면 낱말 검색의 두 배를 찾았고 VRAM은 0.5GB였다

구글 EmbeddingGemma 2로 이 블로그 글 227조각을 한국어 질문 63개로 검색했습니다. 다른 낱말로 바꿔 물은 질문은 17개를 1위로 찾아 낱말 검색(9개)의 약 두 배였고, 영어로 물어도 34개를 찾았습니다. 227조각을 벡터로 바꾸는 데 1.06초, VRAM은 0.5GB였습니다.

2026.10.07 7