AI를 직접 돌려보고
빛나는 숫자로 남겨요

로컬 AI를 직접 돌려 잰 속도와 메모리, 출처를 확인한 IT·AI 소식, 프로그래밍 이야기를 적습니다.

같은 질문, 두 그래픽카드

측정 때 답변을 잰 속도 그대로 재생합니다
모델
Gemma 4 12B QAT · Q4_0 (4비트) · LM Studio 기본 설정
질문
다음 주제로 800자 정도의 글을 써 주세요: 집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점
RTX 5090147.0 tok/s
RTX 5060 Ti 16GB10.03
[RTX 5060 Ti 16GB] Ternary Bonsai 2 27B는 16GB에서 돌아갈까, VRAM 9.3GB에 초당 48토큰이었다 Ternary Bonsai 2 27B · PQ2_0 (터너리, 2비트 칸에 저장)
45.7 tok/s VRAM 7.8GB / 16GB
RTX 5060 Ti 16GB10.02
[RTX 5060 Ti 16GB] Qwen3.8 27B GSQ-RCO는 왜 2t/s밖에 안 나올까, 설정 세 가지를 바꾸자 29t/s가 됐다 Qwen3.8 27B GSQ-RCO · IQ3_S (3비트, GSQ-RCO)
2.3 tok/s VRAM 13.5GB / 16GB · 일부는 시스템 램
RTX 5060 Ti 16GB10.02
[RTX 5060 Ti 16GB] 16GB 그래픽카드로 Qwen3.5 9B 돌려도 될까, 10만 자를 넣어도 19초 만에 답이 시작됐다 Qwen3.5 9B · UD-Q6_K_XL (6비트, unsloth)
45.9 tok/s VRAM 9.7GB / 16GB
RTX 5060 Ti 16GB10.02
[RTX 5060 Ti 16GB] Ornith 1.5 9B는 가장 큰 Q8로 받아도 될까, VRAM 10.6GB에 50t/s가 나왔다 Ornith 1.5 9B · Q8_0 (8비트)
58.8 tok/s VRAM 10.6GB / 16GB
RTX 5060 Ti 16GB09.30
[RTX 5060 Ti 16GB] 16GB 그래픽카드로 Qwen3.8 27B 돌아갈까, 2비트로 줄이자 15배 빨라졌다 Qwen3.8 27B · Q4_K_M (4비트)
2.1 tok/s VRAM 12.6GB / 16GB · 일부는 시스템 램
RTX 5060 Ti 16GB09.30
[RTX 5060 Ti 16GB] 16GB 그래픽카드로 Qwen3.8 27B 돌아갈까, 2비트로 줄이자 15배 빨라졌다 Qwen3.8 27B · IQ2_S (2비트, unsloth)
35.1 tok/s VRAM 9.9GB / 16GB
RTX 5060 Ti 16GB09.29
[RTX 5060 Ti 16GB] 16GB 그래픽카드로 Gemma 4 26B 돌아갈까, 돌아가긴 했지만 GPU는 절반도 일하지 않았다 Gemma 4 26B A4B QAT · Q4_0 (4비트)
18.7 tok/s VRAM 12.4GB / 16GB · 일부는 시스템 램
RTX 509009.29
[RTX 5090 32GB] 24GB 그래픽카드로 Meta Muse Glimmer 돌아갈까, 최대 컨텍스트에서도 19.2GB였다 Muse Glimmer · Q4_K_M (4비트)
74.3 tok/s VRAM 17.5GB / 32GB
RTX 509009.29
[RTX 5090 32GB] 1세대는 외국어가 섞였는데, Ternary Bonsai 2 27B는 한국어 답 33개 중 30개가 깨끗했다 Ternary Bonsai 2 27B · PTQ1_0 (터너리 약 1.7비트)
115.4 tok/s VRAM 7.1GB / 32GB
RTX 509009.29
[RTX 5090 32GB] Qwen3.8 27B는 왜 답을 안 할까, 생각 단계 하나 낮추자 12초 만에 나왔다 Qwen3.8 27B · Q4_K_M (4비트)
99.3 tok/s VRAM 19.7GB / 32GB
RTX 5060 Ti 16GB09.28
[RTX 5060 Ti 16GB] 16GB 그래픽카드로 Gemma 4 12B 돌려도 될까, 7GB가 남았다 Gemma 4 12B QAT · Q4_0 (4비트)
43.6 tok/s VRAM 8.6GB / 16GB
RTX 509009.28
[RTX 5090 32GB] 27B를 3.8GB로 줄인 Bonsai, 한국어로 물었더니 외국어 5개가 섞여 나왔다 Bonsai 27B · Q1_0 (1비트)
140.3 tok/s VRAM 6.0GB / 32GB
RTX 509009.28
[RTX 5090 32GB] Gemma 4 12B, '생각' 버튼 하나로 정답률 0%와 100%가 갈렸다 Gemma 4 12B QAT · Q4_0 (4비트)
144.8 tok/s VRAM 9.0GB / 32GB
GPU 체험

16GB로
어디까지 돌아갈까?

직접 잰 메모리 사용량으로 그래픽카드 크기별로 판정합니다.

GPU 체험 열기
Gemma 4 12B QAT · 8,1928.6GB
원활 RTX 5060 Ti에서 돌려 봄
Bonsai 27B · 131,07213.8GB
주의 1.2GB 남음
Bonsai 27B · 262,14421.9GB
부적합 약 6.9GB 부족

최근 게시글

총 35개의 글
[RTX 5060 Ti 16GB] Qwen3.8 27B GSQ-RCO는 왜 2t/s밖에 안 나올까, 설정 세 가지를 바꾸자 29t/s가 됐다 RTX-5060TI 16GB

[RTX 5060 Ti 16GB] Qwen3.8 27B GSQ-RCO는 왜 2t/s밖에 안 나올까, 설정 세 가지를 바꾸자 29t/s가 됐다

RTX 5060 Ti 16GB PC의 LM Studio에서 Qwen3.8 27B GSQ-RCO(IQ3_S, 12.12GB)를 재 봤습니다. 기본 설정에서는 65개 레이어 중 56~58개만 GPU에 올라가 약 1.9t/s였고, Limit Model Offload 끄기·GPU 오프로드 최대·MTP 끄기 세 가지를 바꾸자 약 29t/s가 됐습니다. VRAM은 13.1GB, 컨텍스트는 32,768까지 맞았습니다.

2026.10.02 13
ComfyUI 워크플로를 그대로 API로 배포하는 Comfy API 출시, 원래 있던 ComfyUI API와 무엇이 다를까 AI 뉴스

ComfyUI 워크플로를 그대로 API로 배포하는 Comfy API 출시, 원래 있던 ComfyUI API와 무엇이 다를까

Comfy가 ComfyUI 워크플로를 커스텀 노드, 모델, LoRA까지 통째로 묶어 클라우드 GPU에 올리는 Comfy API를 열었습니다. 유료 요금제(월 20달러부터)가 필요하고 GPU는 초 단위로 냅니다(RTX PRO 6000 96GB가 1시간 4.54달러). Build·Release·Deployment가 무엇인지, 원래 있던 내 PC의 ComfyUI API와 무엇이 다른지, 실제로 얼마가 나오는지 계산과 함께 정리했습니다.

2026.10.02 12
구글 Gemini 4 Argon은 왜 아직 쓸 수 없을까, 출력 100만 토큰 모델을 보안 담당자에게 먼저 준 이유 AI 뉴스

구글 Gemini 4 Argon은 왜 아직 쓸 수 없을까, 출력 100만 토큰 모델을 보안 담당자에게 먼저 준 이유

구글이 새 최고 모델 Gemini 4 Argon을 발표했습니다. 출력 한도가 6만 4천 토큰에서 100만 토큰으로 늘었고, 도입 가격은 100만 토큰당 입력 2달러, 출력 10달러입니다. 하지만 지금은 정부·병원·통신사 같은 보안 담당 기관 650여 곳만 쓸 수 있습니다. 공식 발표문으로 출력 100만 토큰이 한글로 얼마나 되는지, 왜 순서를 나눠 공개하는지, 구글이 밝힌 시험 점수와 가격을 정리했습니다.

2026.10.02 14