AI를 직접 돌려보고
빛나는 숫자로 남겨요

로컬 AI를 직접 돌려 잰 속도와 메모리, 출처를 확인한 IT·AI 소식, 프로그래밍 이야기를 적습니다.

같은 질문, 두 그래픽카드

측정 때 답변을 잰 속도 그대로 재생합니다
모델
Gemma 4 12B QAT · Q4_0 (4비트) · LM Studio 기본 설정
질문
다음 주제로 800자 정도의 글을 써 주세요: 집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점
RTX 5090147.0 tok/s
RTX 5060 Ti 16GB10.10
[RTX 5060 Ti 16GB] OpenAI의 gpt-oss 20B를 16GB에서 돌리면, 컨텍스트 10만에서도 초당 120토큰이 나왔다 gpt-oss 20B () · UD-Q4_K_XL (4비트, unsloth)
123.4 tok/s VRAM -GB / 16GB
RTX 5060 Ti 16GB10.10
[RTX 5060 Ti 16GB] 로컬 AI Gemma 4 E4B, E2B보다 얼마나 나을까, 27% 느린 대신 코딩 문제를 두 개 더 풀었다 Gemma 4 E4B (UD-Q4_K_XL) · QAT UD-Q4_K_XL (4비트, unsloth)
144.2 tok/s VRAM -GB / 16GB
RTX 5060 Ti 16GB10.10
[RTX 5060 Ti 16GB] 로컬 AI Gemma 4 E2B, 가장 작은 모델은 얼마나 쓸 만할까, VRAM 3.6GB에 초당 197토큰이었다 Gemma 4 E2B (UD-Q4_K_XL) · QAT UD-Q4_K_XL (4비트, unsloth)
204.8 tok/s VRAM -GB / 16GB
GPU 체험

16GB로
어디까지 돌아갈까?

직접 잰 메모리 사용량으로 그래픽카드 크기별로 판정합니다.

GPU 체험 열기
Gemma 4 12B QAT · 8,1928.6GB
원활 RTX 5060 Ti에서 돌려 봄
Bonsai 27B · 131,07213.8GB
주의 1.2GB 남음
Bonsai 27B · 262,14421.9GB
부적합 약 6.9GB 부족

최근 게시글

총 61개의 글
[RTX 5090 32GB] 로컬 AI 그림 모델 Qwen-Image-2.1-Turbo는 정말 더 빠를까, 8단계 3.6초와 40단계 4.3초였고 기본 설정으로는 일반판이 돌았다 RTX-5090

[RTX 5090 32GB] 로컬 AI 그림 모델 Qwen-Image-2.1-Turbo는 정말 더 빠를까, 8단계 3.6초와 40단계 4.3초였고 기본 설정으로는 일반판이 돌았다

Qwen-Image-2.1-Turbo를 RTX 5090의 Unsloth Studio에서 일반판과 비교했습니다. 1024×1024 한 장에 Turbo 8단계 3.6초, 일반판 40단계 4.3초였고 VRAM은 13.9GB와 21.3GB였습니다. 기본 설정으로 올리면 일반판 가중치로 그려지는 문제와 해결 방법도 적었습니다.

2026.10.10 53
로컬 AI 시작하기 6편, 로컬 AI가 느리거나 답이 안 나올 때 무엇을 볼까, Qwen3.8 27B는 설정 세 가지로 1.9토큰이 28.7토큰이 됐다 로컬 AI 시작하기

로컬 AI 시작하기 6편, 로컬 AI가 느리거나 답이 안 나올 때 무엇을 볼까, Qwen3.8 27B는 설정 세 가지로 1.9토큰이 28.7토큰이 됐다

로컬 AI가 느리거나 답이 안 나올 때 볼 것을 증상별로 정리했습니다. 같은 3비트 파일이 레이어를 모두 그래픽카드에 올리자 초당 1.9토큰에서 28.7토큰이 됐고, 답이 멈출 때는 컨텍스트를 늘리거나 생각 단계를 낮추면 풀렸습니다.

2026.10.09 8