AI를 직접 돌려보고
빛나는 숫자로 남겨요

로컬 AI를 직접 돌려 잰 속도와 메모리, 출처를 확인한 IT·AI 소식, 프로그래밍 이야기를 적습니다.

같은 질문, 두 그래픽카드

측정 때 답변을 잰 속도 그대로 재생합니다
모델
Gemma 4 12B QAT · Q4_0 (4비트) · LM Studio 기본 설정
질문
다음 주제로 800자 정도의 글을 써 주세요: 집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점
RTX 5090147.0 tok/s
RTX 5060 Ti 16GB10.10
[RTX 5060 Ti 16GB] 로컬 AI Gemma 4 E2B, 가장 작은 모델은 얼마나 쓸 만할까, VRAM 3.6GB에 초당 197토큰이었다 Gemma 4 E2B (UD-Q4_K_XL) · QAT UD-Q4_K_XL (4비트, unsloth)
204.8 tok/s VRAM -GB / 16GB
RTX 5060 Ti 16GB10.07
[RTX 5060 Ti 16GB] 로컬 AI 코딩 모델 Qwen3-Coder 30B A3B, 16GB에서 얼마나 빠를까, 기본값 145t/s인데 컨텍스트를 늘리자 절반이 됐다 Qwen3-Coder 30B A3B () · UD-Q3_K_XL (3비트, unsloth)
144.6 tok/s VRAM 13.7GB / 16GB
RTX 509010.06
[RTX 5090 32GB] 로컬 AI Gemma 4 12B, Unsloth 기본값이면 충분할까, 32GB는 초당 233토큰인데 16GB는 52토큰이었다 Gemma 4 12B QAT () · UD-Q4_K_XL (4비트)
231.7 tok/s VRAM -GB / 32GB
GPU 체험

16GB로
어디까지 돌아갈까?

직접 잰 메모리 사용량으로 그래픽카드 크기별로 판정합니다.

GPU 체험 열기
Gemma 4 12B QAT · 8,1928.6GB
원활 RTX 5060 Ti에서 돌려 봄
Bonsai 27B · 131,07213.8GB
주의 1.2GB 남음
Bonsai 27B · 262,14421.9GB
부적합 약 6.9GB 부족

최근 게시글

총 57개의 글
로컬 AI 시작하기 6편, 로컬 AI가 느리거나 답이 안 나올 때 무엇을 볼까, Qwen3.8 27B는 설정 세 가지로 1.9토큰이 28.7토큰이 됐다 로컬 AI 시작하기

로컬 AI 시작하기 6편, 로컬 AI가 느리거나 답이 안 나올 때 무엇을 볼까, Qwen3.8 27B는 설정 세 가지로 1.9토큰이 28.7토큰이 됐다

로컬 AI가 느리거나 답이 안 나올 때 볼 것을 증상별로 정리했습니다. 같은 3비트 파일이 레이어를 모두 그래픽카드에 올리자 초당 1.9토큰에서 28.7토큰이 됐고, 답이 멈출 때는 컨텍스트를 늘리거나 생각 단계를 낮추면 풀렸습니다.

2026.10.09 7