RTX 5090 · RTX 5060 Ti 16GB 실측

내 그래픽카드로 로컬 AI 돌아갈까?

저희 PC 두 대에서 LM Studio로 직접 잰 값입니다.
그래픽카드 메모리에 모델이 들어가는지 보고, 실제 글 쓰는 속도를 그대로 재생해 볼 수 있습니다.

1 그래픽카드 메모리 고르기

윈도우 화면 등이 쓰는 약 1GB를 빼고 판단합니다. 저희 카드와 같은 크기를 고르면 실제로 불러와 본 결과를 보여 줍니다.

Gemma 4 12B QAT

Google · Q4_0 (4비트) · 파일 7.15GB
8,192 기본
9.0GB
32,768 토큰
9.3GB
131,072 토큰
11.0GB
262,144 최대
13.1GB

RTX 5060 Ti 16GB: LM Studio 기본 안전장치가 예상 메모리(46.66GiB)를 보고 불러오기를 거부했습니다

Bonsai 27B

PrismML · Q1_0 (1비트) · 파일 3.80GB
8,192 기본
6.0GB
32,768 토큰
7.7GB
131,072 토큰
13.8GB
262,144 최대
21.9GB

컨텍스트는 모델이 한 번에 기억하는 글의 길이입니다. 길게 잡을수록 메모리를 더 씁니다. 막대는 고른 메모리 중 얼마를 쓰는지 보여 줍니다.

2 실제 속도로 재생해 보기

질문

다음 주제로 800자 정도의 글을 써 주세요: 집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점

생각 기능을 켜면 답을 쓰기 전에 먼저 생각하는 시간이 붙습니다.

측정 때 모델이 쓴 답변을 고치지 않고, 잰 속도 그대로 다시 보여 줍니다. 이 화면에서 모델이 실제로 돌지는 않습니다. 3번 잰 것 중 가운데 속도의 답변입니다.

측정 결과 한눈에 보기

모델 · 그래픽카드 초당 토큰
생각 끔 / 켬
메모리
기본 / 최대 컨텍스트
Gemma 4 12B QAT RTX 5090 147.0 / 144.8 9.0GB / 13.1GB
Gemma 4 12B QAT RTX 5060 Ti 16GB 44.5 / 43.6 8.6GB / 불러오기 거부
Bonsai 27B RTX 5090 145.3 / 140.3 6.0GB / 21.9GB

어떻게 쟀나요

  • LM Studio 0.4.25에서 모델마다 LM Studio가 잡아 주는 기본 설정을 그대로 썼습니다. 컨텍스트 길이만 바꿔 가며 다시 불러왔습니다.
  • 메모리는 모델을 불러오기 전과 후의 그래픽카드 사용량 차이입니다(nvidia-smi).
  • 속도는 같은 질문을 3번씩 보내 LM Studio가 알려 준 초당 토큰 수입니다.
  • 다른 그래픽카드의 판정은 저희가 잰 메모리 사용량으로 계산한 것입니다. 속도는 저희 두 카드에서만 쟀습니다.
  • 마지막 측정일: 2026-09-28. 새 모델을 테스트하면 이 페이지에 추가합니다.