AI를 직접 돌려보고
빛나는 숫자로 남겨요

로컬 AI를 직접 돌려 잰 속도와 메모리, 출처를 확인한 IT·AI 소식, 프로그래밍 이야기를 적습니다.

같은 질문, 두 그래픽카드

측정 때 답변을 잰 속도 그대로 재생합니다
모델
Gemma 4 12B QAT · Q4_0 (4비트) · LM Studio 기본 설정
질문
다음 주제로 800자 정도의 글을 써 주세요: 집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점
RTX 5090147.0 tok/s
RTX 5060 Ti 16GB09.30
[RTX 5060 Ti 16GB] 16GB 그래픽카드로 Qwen3.8 27B 돌아갈까, 2비트로 줄이자 15배 빨라졌다 Qwen3.8 27B · Q4_K_M (4비트)
2.1 tok/s VRAM 12.6GB / 16GB · 일부는 시스템 램
RTX 5060 Ti 16GB09.30
[RTX 5060 Ti 16GB] 16GB 그래픽카드로 Qwen3.8 27B 돌아갈까, 2비트로 줄이자 15배 빨라졌다 Qwen3.8 27B · IQ2_S (2비트, unsloth)
35.1 tok/s VRAM 9.9GB / 16GB
RTX 5060 Ti 16GB09.29
[RTX 5060 Ti 16GB] 16GB 그래픽카드로 Gemma 4 26B 돌아갈까, 돌아가긴 했지만 GPU는 절반도 일하지 않았다 Gemma 4 26B A4B QAT · Q4_0 (4비트)
18.7 tok/s VRAM 12.4GB / 16GB · 일부는 시스템 램
RTX 509009.29
[RTX 5090 32GB] 24GB 그래픽카드로 Meta Muse Glimmer 돌아갈까, 최대 컨텍스트에서도 19.2GB였다 Muse Glimmer · Q4_K_M (4비트)
74.3 tok/s VRAM 17.5GB / 32GB
RTX 509009.29
[RTX 5090 32GB] 1세대는 외국어가 섞였는데, Ternary Bonsai 2 27B는 한국어 답 33개 중 30개가 깨끗했다 Ternary Bonsai 2 27B · PTQ1_0 (터너리 약 1.7비트)
115.4 tok/s VRAM 7.1GB / 32GB
RTX 509009.29
[RTX 5090 32GB] Qwen3.8 27B는 왜 답을 안 할까, 생각 단계 하나 낮추자 12초 만에 나왔다 Qwen3.8 27B · Q4_K_M (4비트)
99.3 tok/s VRAM 19.7GB / 32GB
RTX 5060 Ti 16GB09.28
[RTX 5060 Ti 16GB] 16GB 그래픽카드로 Gemma 4 12B 돌려도 될까, 7GB가 남았다 Gemma 4 12B QAT · Q4_0 (4비트)
43.6 tok/s VRAM 8.6GB / 16GB
RTX 509009.28
[RTX 5090 32GB] 27B를 3.8GB로 줄인 Bonsai, 한국어로 물었더니 외국어 5개가 섞여 나왔다 Bonsai 27B · Q1_0 (1비트)
140.3 tok/s VRAM 6.0GB / 32GB
RTX 509009.28
[RTX 5090 32GB] Gemma 4 12B, '생각' 버튼 하나로 정답률 0%와 100%가 갈렸다 Gemma 4 12B QAT · Q4_0 (4비트)
144.8 tok/s VRAM 9.0GB / 32GB
GPU 체험

16GB로
어디까지 돌아갈까?

직접 잰 메모리 사용량으로 그래픽카드 크기별로 판정합니다.

GPU 체험 열기
Gemma 4 12B QAT · 8,1928.6GB
원활 RTX 5060 Ti에서 돌려 봄
Bonsai 27B · 131,07213.8GB
주의 1.2GB 남음
Bonsai 27B · 262,14421.9GB
부적합 약 6.9GB 부족

최근 게시글

총 23개의 글
[RTX 5090 32GB] 같은 Q4_K_M인데 뭐가 다를까, unsloth·lmstudio-community·ggml-org의 Qwen3.8 27B는 정답률이 같고 속도만 달랐다 RTX-5090

[RTX 5090 32GB] 같은 Q4_K_M인데 뭐가 다를까, unsloth·lmstudio-community·ggml-org의 Qwen3.8 27B는 정답률이 같고 속도만 달랐다

Qwen3.8 27B Q4_K_M 파일을 lmstudio-community, unsloth, ggml-org 세 곳에서 받아 RTX 5090과 LM Studio로 비교했습니다. 채점 질문 250번 중 171~180번을 맞혀 정답률은 거의 같았고, 생성 속도는 초당 63.8~86.2토큰으로 달랐습니다. 차이는 파일 안에 MTP 레이어가 있느냐에서 나왔습니다. 파일 속 양자화 구성, VRAM, MCP 도구 호출 결과와 LM Studio 캡처를 함께 정리했습니다.

2026.10.01 25
OpenAI dots는 일반 ChatGPT와 뭐가 다를까, 목표만 주면 대화가 끝나도 혼자 일한다 (DevDay 2026) AI 뉴스

OpenAI dots는 일반 ChatGPT와 뭐가 다를까, 목표만 주면 대화가 끝나도 혼자 일한다 (DevDay 2026)

OpenAI가 DevDay 2026에서 발표한 dots와 GPT-6.1 Sol을 공식 발표문으로 정리했습니다. dots는 목표를 주면 자기 클라우드 컴퓨터에서 혼자 일하고, 밖으로 나가는 행동은 규칙에 따라 승인을 받습니다. 한국 Pro 사용자도 대상이며, GPT-6.1 Sol은 Astra에 가까운 성능을 5분의 1 가격에 제공합니다. 권한 규칙, 요금제별 가격, 비용 계산 예시를 함께 담았습니다.

2026.10.01 12
[RTX 5090 32GB] 로컬 AI에 MCP 도구를 붙이면 달라질까, Qwen3.8·Gemma 4 정답률이 1%에서 99%가 됐다 Tools

[RTX 5090 32GB] 로컬 AI에 MCP 도구를 붙이면 달라질까, Qwen3.8·Gemma 4 정답률이 1%에서 99%가 됐다

로컬 AI 모델 4개(Qwen3.8 27B, Gemma 4 26B A4B, Gemma 4 31B, Muse Glimmer)에 MCP 도구 3개(웹 페이지 읽기, 현재 시간, 파일 읽기)를 붙이고 같은 질문 30개를 물었습니다. 최신 정보와 파일 질문에서 240번 중 3번이던 정답이 237번이 됐고, 도구가 없을 때는 문서를 읽은 척 틀린 답을 하기도 했습니다. LM Studio 설정 방법과 캡처, 모델별 결과를 정리했습니다.

2026.10.01 25