Developer Lab Tools

로컬 AI 시작하기 1편, 내 PC로도 될까, 16GB 그래픽카드에서 Gemma 4 12B는 VRAM 8.6GB였다

2026년 10월 09일 9회 1시간 전
로컬 AI 시작하기 1편, 내 PC로도 될까, 16GB 그래픽카드에서 Gemma 4 12B는 VRAM 8.6GB였다

로컬 AI는 AI 모델 파일을 내려받아 내 PC의 그래픽카드에서 직접 돌리는 것입니다. 될지 안 될지는 그래픽카드 메모리(VRAM)가 정합니다. 직접 재 보니 VRAM 16GB 그래픽카드에서 Gemma 4 12B는 VRAM 8.6GB를 쓰고 초당 약 44토큰으로 돌았고, 더 큰 Gemma 4 26B도 초당 94토큰이 나왔습니다. 이 글은 로컬 AI를 처음 해 보는 사람을 위한 가이드 일곱 편 가운데 첫 편입니다.

  • 로컬 AI란: 모델이 회사 서버가 아니라 내 PC에서 돌아갑니다. 질문이 밖으로 나가지 않고, 드는 돈은 전기요금입니다.
  • 필요한 것 세 가지: 그래픽카드, 프로그램(Unsloth Studio), 모델 파일(GGUF). 프로그램과 모델 파일은 무료입니다.
  • 가장 중요한 숫자는 VRAM: 모델이 VRAM에 다 들어가면 빠르고, 다 들어가지 않으면 크게 느려집니다. 같은 모델이 초당 2.2토큰과 33.5토큰으로 갈렸습니다.
  • 16GB에서 잰 것: 9B와 12B 모델은 VRAM 8.6~10.6GB로 다 들어갔고, 작게 줄인 30B와 35B 파일도 13GB대로 들어갔습니다.
  • 글만 쓰는 것이 아닙니다: 코딩, 그림, 영상, 음성, 검색도 내 PC에서 됩니다.

이 글의 속도와 VRAM 숫자는 모두 테스트에 쓰는 PC 두 대(RTX 5060 Ti 16GB, RTX 5090 32GB)에서 직접 잰 값입니다. 숫자마다 그 값을 잰 글을 링크했습니다. 8GB나 12GB 그래픽카드에서는 아직 재지 못했습니다.

이 글의 내용을 20초로 요약한 영상입니다(소리 없음).

로컬 AI는 무엇인가

ChatGPT, Claude, Gemini 같은 서비스에 질문을 하면 그 질문은 인터넷을 타고 회사 서버로 갑니다. 모델은 그 서버에서 돌아가고, 답만 돌아옵니다. 로컬 AI는 이 모델을 내 PC로 가져와서 돌리는 방식입니다. '로컬'은 '내 컴퓨터 안'이라는 뜻입니다.

인터넷 AI 서비스와 로컬 AI의 차이를 나란히 적은 그림. 인터넷 AI 서비스는 질문이 회사 서버로 가고, 모델이 회사 서버에서 돌고, 많이 쓰면 요금을 내고, 인터넷이 끊기면 못 쓰고, 가장 큰 모델을 쓸 수 있다. 로컬 AI는 질문이 내 PC 밖으로 나가지 않고, 모델이 내 그래픽카드에서 돌고, 드는 돈은 전기요금이고, 인터넷 없이 쓰고, 그래픽카드 메모리에 들어가는 모델만 쓴다

모델이 어디에서 돌아가는지가 다릅니다.

항목인터넷 AI 서비스로컬 AI
모델이 돌아가는 곳회사 서버내 PC의 그래픽카드
내가 쓴 질문과 파일회사 서버로 전송PC 밖으로 나가지 않음
드는 돈구독료 또는 쓴 만큼의 요금그래픽카드 값과 전기요금
인터넷꼭 필요모델을 받을 때만 필요
쓸 수 있는 모델회사가 내놓은 가장 큰 모델VRAM에 들어가는 공개 모델
사용 횟수 제한요금제에 따라 있음없음

이 표가 뜻하는 것: 로컬 AI가 더 똑똑한 것은 아닙니다. 가장 큰 모델은 인터넷 서비스 쪽에 있습니다. 로컬 AI를 쓰는 까닭은 자료가 밖으로 나가지 않는다는 점과, 횟수 제한 없이 마음대로 쓸 수 있다는 점입니다.

값만 보면 차이가 예전보다 작아졌습니다. 2026년 10월에 나온 Claude Haiku 5.5는 글 100만 토큰을 만드는 요금이 약 700원이고, 16GB 그래픽카드로 같은 양을 만들 때의 그래픽카드 전기요금은 모델 두 개 기준으로 25~94원으로 계산됐습니다. 계산 과정은 Claude Haiku 5.5 가격 글에 있습니다.

필요한 것 세 가지

로컬 AI에 필요한 세 가지를 적은 그림. 첫째 그래픽카드의 VRAM, 모델 파일이 올라가는 메모리. 둘째 프로그램 Unsloth Studio, 모델을 받고 올리고 대화하는 프로그램. 셋째 모델 파일 GGUF, 모델을 한 파일에 담은 형식

그래픽카드, 프로그램, 모델 파일이 있으면 됩니다.

① 그래픽카드

AI 모델은 계산을 아주 많이 합니다. 이 계산을 그래픽카드(GPU)가 맡습니다. 그래픽카드에는 자기만 쓰는 메모리가 달려 있는데, 이것이 VRAM입니다. 모델 파일이 통째로 VRAM에 올라가야 빠르게 돕니다. 그래서 로컬 AI에서는 그래픽카드의 계산 속도보다 VRAM이 몇 GB인지를 먼저 봅니다.

② 프로그램

모델 파일만으로는 대화할 수 없습니다. 모델을 받아서 그래픽카드에 올리고, 채팅 화면을 띄워 주는 프로그램이 필요합니다. 이 블로그는 2026년 10월부터 Unsloth Studio로 테스트합니다. 그 전에는 LM Studio를 썼고, 바꾼 이유는 LM Studio에서 Unsloth Studio로 바꾼 이유에 적었습니다. 설치하는 방법은 2편에서 다룹니다.

③ 모델 파일

공개된 AI 모델은 Hugging Face라는 사이트에 올라옵니다. 내 PC에서 돌릴 때는 보통 GGUF라는 형식의 파일을 받습니다. 모델 하나가 파일 하나에 들어 있어서 다루기 쉽습니다. Unsloth Studio 안에서 검색해서 바로 받을 수 있습니다.

같은 모델도 파일이 여러 개 있습니다. 모델의 숫자를 덜 정밀하게 저장해 크기를 줄인 것으로, 이것을 양자화라고 합니다. 예를 들어 Qwen3.8 27B는 4비트로 줄인 파일이 16.81GB, 2비트로 줄인 파일이 9.3GB입니다. 더 줄일수록 작은 그래픽카드에 들어가지만 답의 품질은 조금씩 떨어집니다. 파일 이름 읽는 법은 3편에서 다룹니다.

내 그래픽카드의 VRAM은 몇 GB인가

윈도우에서는 작업 관리자로 볼 수 있습니다. Ctrl + Shift + Esc를 누르고, 성능 탭에서 GPU를 고르면 아래쪽에 전용 GPU 메모리가 나옵니다. 이 값이 VRAM입니다. 그 옆의 '공유 GPU 메모리'는 시스템 램(RAM)을 빌려 쓰는 것이어서 VRAM이 아닙니다.

NVIDIA 그래픽카드는 명령 프롬프트에서 아래 명령으로도 볼 수 있습니다.

nvidia-smi --query-gpu=name,memory.total --format=csv

VRAM을 확인하는 두 가지 방법을 적은 그림. 방법 1 작업 관리자: Ctrl Shift Esc로 열고, 성능 탭에서 GPU를 고르고, 전용 GPU 메모리 값을 본다. 방법 2 명령어: nvidia-smi 명령을 넣으면 NVIDIA GeForce RTX 5090, 32607 MiB라고 나온다

오른쪽은 테스트 PC에서 실제로 나온 출력입니다. 32607MiB는 약 32GB입니다.

그래픽카드 이름에 VRAM이 적혀 있는 경우도 많습니다. 'RTX 5060 Ti 16GB'는 VRAM이 16GB라는 뜻입니다. 같은 이름에 8GB와 16GB 두 종류가 있는 제품도 있으니, 직접 확인하는 편이 확실합니다.

16GB 그래픽카드로는 어디까지 되나

RTX 5060 Ti 16GB에서 지금까지 잰 결과입니다. 모두 프로그램을 설치한 그대로의 기본 설정에서, 같은 질문(한글 800자 글 쓰기)으로 쟀습니다. 속도 단위 t/s는 1초에 만드는 토큰 수입니다. 토큰은 모델이 글을 세는 단위입니다. 이 측정에서 Gemma 4 12B가 쓴 한글 글 하나가 1,274자, 638토큰이었습니다.

RTX 5060 Ti 16GB에서 잰 모델별 생성 속도 막대 그래프. Gemma 4 12B QAT 44.5 t/s(VRAM 8.6GB), Qwen3.5 9B 46.4 t/s(9.7GB), Qwen3.8 27B IQ2_S 33.5 t/s(9.9GB), Ornith 1.5 9B 49.7 t/s(10.6GB), Qwen3-Coder 30B A3B 140.5 t/s(13.7GB), Gemma 4 26B A4B QAT 94 t/s(14.1GB, 일부는 시스템 램), Qwen3.6 35B A3B 90.8 t/s(13.2GB), Qwen3.8 27B Q4_K_M 2.2 t/s(일부는 시스템 램)

16GB 그래픽카드에서 잰 속도입니다. 빨간 막대 하나만 초당 10토큰 아래입니다.

모델파일VRAMVRAM에 다 들어갔나속도프로그램잰 글
Gemma 4 12B QAT (Q4_0)7.15GB8.6GB예44.5 t/sLM Studio82번
Qwen3.5 9B (UD-Q6_K_XL)8.76GB9.7GB예46.4 t/sLM Studio98번
Qwen3.8 27B (IQ2_S, 2비트)9.3GB9.9GB예33.5 t/sLM Studio88번
Ornith 1.5 9B (Q8_0)9.79GB10.6GB예49.7 t/sLM Studio97번
Qwen3-Coder 30B A3B (UD-Q3_K_XL)12.86GB13.7GB예140.5 t/sUnsloth Studio115번
Qwen3.6 35B A3B (UD-IQ3_XXS)14.07GB13.2GB예90.8 t/sUnsloth Studio110번
Gemma 4 26B A4B QAT (UD-Q4_K_XL)13.27GB14.1GB일부는 시스템 램94 t/sUnsloth Studio109번
Qwen3.8 27B (Q4_K_M, 4비트)16.81GB12.6GB일부는 시스템 램2.2 t/sLM Studio88번

이 표가 뜻하는 것: 16GB 그래픽카드에서는 9B와 12B 모델이 VRAM을 8.6~10.6GB만 써서 5GB 넘게 남습니다. 30B 안팎의 큰 모델도 3비트로 줄인 파일은 13GB대로 들어갔습니다. 파일이 16GB를 넘는 것만 크게 느렸습니다.

표를 볼 때 조심할 점이 두 가지 있습니다.

  • 프로그램이 다른 줄끼리는 속도를 그대로 견주면 안 됩니다. 위쪽 넷은 LM Studio로, 아래쪽 셋은 Unsloth Studio로 쟀습니다. Unsloth Studio는 모델에 따라 MTP(토큰 여러 개를 한꺼번에 예측해 속도를 올리는 기능)를 자동으로 켭니다. 같은 Gemma 4 12B도 16GB에서 Unsloth Studio 기본값은 초당 52토큰이었고, 컨텍스트를 지정하자 94토큰이 됐습니다(111번 글).
  • 이름에 A3B, A4B가 붙은 모델은 크기에 비해 빠릅니다. 전체는 30B지만 한 번에 3B만 쓰는 구조(MoE)여서 그렇습니다. 3편에서 설명합니다.

속도가 어느 정도인지 감이 안 온다면 GPU 체험에서 볼 수 있습니다. 잰 속도 그대로 글자가 나오는 모습을 재생해 줍니다.

32GB 그래픽카드에서는

RTX 5090 32GB에서 잰 모델별 생성 속도 막대 그래프. Gemma 4 12B QAT UD-Q4_K_XL 233.5 t/s(Unsloth Studio, VRAM 10.0GB), Gemma 4 12B QAT Q4_0 147 t/s(LM Studio, 9.0GB), Qwen3.8 27B Q4_K_M 72.6 t/s(19.7GB), Muse Glimmer Q4_K_M 74.5 t/s(17.5GB). 모두 VRAM에 다 들어감

32GB에서는 네 모델 모두 VRAM에 다 들어갔습니다.

모델파일VRAM속도프로그램잰 글
Gemma 4 12B QAT (UD-Q4_K_XL)6.72GB10.0GB233.5 t/sUnsloth Studio111번
Gemma 4 12B QAT (Q4_0)7.15GB9.0GB147 t/sLM Studio80번
Qwen3.8 27B (Q4_K_M, 4비트)16.81GB19.7GB72.6 t/sLM Studio83번
Muse Glimmer (Q4_K_M)18.16GB17.5GB74.5 t/sLM Studio86번

이 표가 뜻하는 것: 32GB에서는 16GB에 다 들어가지 않던 27B 4비트 파일이 VRAM 19.7GB로 들어갑니다. 큰 그래픽카드의 장점은 속도보다 더 큰 파일을 덜 줄인 채로 올릴 수 있다는 점입니다.

VRAM이 모자라면 어떻게 되나

모델이 VRAM에 다 들어가지 않아도 프로그램은 대개 모델을 올려 줍니다. 넘치는 부분을 시스템 램에 두고 CPU로 계산하는 것입니다. 돌아가기는 하지만 많이 느려집니다. 같은 모델 Qwen3.8 27B로 잰 값입니다.

같은 모델 Qwen3.8 27B의 속도 비교 막대 그래프. 16GB에서 4비트 파일 16.81GB는 VRAM에 다 안 들어가 2.2 t/s, 16GB에서 2비트 파일 9.3GB는 다 들어가 33.5 t/s, 32GB에서 4비트 파일은 다 들어가 72.6 t/s

같은 모델이라도 VRAM에 다 들어가는지에 따라 속도가 크게 달랐습니다.

그래픽카드파일VRAM에 다 들어갔나속도
RTX 5060 Ti 16GB4비트, 16.81GB일부는 시스템 램2.2 t/s
RTX 5060 Ti 16GB2비트, 9.3GB예33.5 t/s
RTX 5090 32GB4비트, 16.81GB예72.6 t/s

이 표가 뜻하는 것: 16GB 그래픽카드에 16.81GB 파일을 올리면 초당 2.2토큰입니다. 이 측정에서 글 하나(682토큰)를 쓰는 데 약 5분 10초가 걸렸습니다. 같은 모델을 9.3GB 파일로 바꾸자 15배 빨라졌습니다. 다만 2비트 파일은 생각(Thinking) 기능을 켜야 정확했습니다(88번 글).

그래서 모델을 고를 때는 파일 크기가 내 VRAM보다 작은지를 먼저 봅니다. 위의 측정에서 VRAM 사용량은 대체로 파일 크기와 비슷하거나 1~3GB 더 많았습니다. 대화가 길어지면 VRAM을 더 쓰기 때문에, 파일 크기에 2~3GB를 더해도 VRAM이 남는 파일을 고르면 무난합니다. 자세한 고르는 방법은 4편에서 다룹니다.

로컬 AI로 무엇을 할 수 있나

글을 쓰고 질문에 답하는 것만이 아닙니다. 이 블로그에서 직접 돌려 본 것을 종류별로 하나씩 적었습니다.

로컬 AI로 할 수 있는 일 여섯 가지와 대표 측정값. 글 쓰기와 질문 94 t/s(Gemma 4 26B, 16GB), 코딩 145 t/s(Qwen3-Coder 30B, 16GB), 그림 만들기 7.6초(Qwen-Image-2.1, 1024×1024 한 장, 32GB), 영상 만들기 20초(LTX-2.5, 소리가 든 5초 영상, 32GB), 음성 만들기 11초(VoiceStudio, 50초 길이 한국어 음성, 16GB), 내 글에서 검색 1.06초(EmbeddingGemma 2, 글 227조각)

종류마다 직접 잰 값 하나씩입니다.

할 수 있는 일직접 잰 값그래픽카드글
글 쓰기, 질문과 답Gemma 4 26B가 초당 94토큰16GB109번
코딩Qwen3-Coder 30B가 기본값에서 초당 약 145토큰16GB115번
도구 붙이기(MCP)웹 읽기와 파일 읽기를 붙이자 240번 중 3번이던 정답이 237번으로32GB89번
그림 만들기Qwen-Image-2.1로 1024×1024 한 장에 7.6초, VRAM 21.0GB32GB106번
영상 만들기LTX-2.5로 소리가 든 5초 영상에 약 20초, VRAM 31.2GB32GB107번
음성 만들기VoiceStudio로 50초 길이 한국어 음성에 약 11초, VRAM 3.5GB 안쪽16GB102번
내 글에서 검색EmbeddingGemma 2로 글 227조각을 1.06초에 검색용으로 변환, VRAM 0.5GB32GB114번

이 표가 뜻하는 것: 글, 코딩, 음성, 검색은 16GB나 그보다 작은 VRAM으로도 됩니다. 그림과 영상은 VRAM을 21GB, 31GB까지 써서 이 측정에서는 32GB 그래픽카드가 필요했습니다. 만든 그림과 영상은 갤러리에서 볼 수 있습니다.

처음이라면 무엇부터 하면 되나

  1. VRAM을 확인합니다. 위에서 본 작업 관리자나 명령어로 봅니다.
  2. Unsloth Studio를 설치합니다. 2편에서 화면과 함께 설명합니다.
  3. 작은 모델 하나로 시작합니다. 처음에는 Gemma 4 12B를 권합니다. 파일이 약 7GB이고, 16GB 그래픽카드에서 VRAM 8.6GB로 돌았습니다. 다만 생각(Thinking) 기능을 끄면 산수 문제를 틀렸으니, 계산이 필요한 질문에는 생각을 켭니다(82번 글).
  4. 익숙해지면 더 큰 모델로 갑니다. VRAM이 남는 만큼 큰 파일을 고르는 방법은 4편에서 다룹니다.

가이드 차례

로컬 AI 시작하기 가이드의 차례. 1편 로컬 AI가 무엇이고 내 PC로 되는가, 2편 Unsloth Studio를 설치하고 첫 대화까지, 3편 모델 이름은 어떻게 읽는가, 4편 내 그래픽카드에는 어떤 모델이 맞는가, 5편 꼭 알아야 할 설정 세 가지, 6편 느리거나 답이 안 나올 때, 7편 그다음에 해 볼 것

모두 일곱 편이고, 차례대로 올립니다.

편내용
1편로컬 AI가 무엇이고, 내 PC로 되는가 (이 글)
2편Unsloth Studio를 설치하고 첫 대화까지
3편모델 이름은 어떻게 읽는가 (27B, Q4_K_M, GGUF, A3B, QAT)
4편내 그래픽카드에는 어떤 모델이 맞는가
5편꼭 알아야 할 설정 세 가지 (컨텍스트, 생각, 온도)
6편느리거나 답이 안 나올 때 무엇을 보는가
7편그다음에 해 볼 것 (코딩, 그림, 영상, 음성, 검색)

이 표가 뜻하는 것: 일곱 편이 모두 올라와 있습니다. 차례로 읽어도 되고, 필요한 편만 읽어도 됩니다.

정리

  • 로컬 AI는 모델을 내 PC에서 돌리는 것입니다. 자료가 밖으로 나가지 않고 횟수 제한이 없습니다.
  • VRAM부터 확인합니다. 모델이 VRAM에 다 들어가는지가 속도를 가릅니다.
  • 16GB면 시작하기에 충분했습니다. 9B와 12B는 VRAM이 5GB 넘게 남았고, 작게 줄인 30B와 35B 파일도 들어갔습니다.
  • VRAM보다 큰 파일은 피합니다. 같은 모델이 초당 2.2토큰과 33.5토큰으로 갈렸습니다.
  • 프로그램과 모델 파일은 무료입니다. 다음 편에서 설치부터 첫 대화까지 해 봅니다.

이 글의 한계

  • 그래픽카드 두 종류에서만 쟀습니다. RTX 5060 Ti 16GB와 RTX 5090 32GB입니다. 8GB, 12GB, 24GB 그래픽카드와 AMD 그래픽카드, 맥에서는 재지 못했습니다.
  • 측정한 프로그램이 섞여 있습니다. 2026년 10월 4일 전에 잰 것은 LM Studio, 그 뒤는 Unsloth Studio입니다. 표에 프로그램을 적었습니다.
  • 속도는 한 가지 질문으로 잰 값입니다. 한글 800자 글 쓰기이고, 생각 기능은 껐습니다. 질문의 길이와 설정에 따라 달라집니다.
  • VRAM 값은 컨텍스트가 가장 작을 때의 값입니다. 컨텍스트를 늘리면 더 씁니다. 각 글에 컨텍스트별 값이 있습니다.
  • 전기요금 비교는 그래픽카드 전기만 넣은 어림값입니다.
  • 2026년 10월 9일 기준으로 정리했습니다. 새 모델과 프로그램 판이 나오면 숫자가 달라질 수 있습니다.

자주 묻는 질문

그래픽카드가 없으면 로컬 AI를 못 쓰나요?

CPU와 시스템 램만으로도 모델은 돌아갑니다. 다만 많이 느립니다. 이 글의 측정에서 모델 일부가 시스템 램으로 넘어간 경우 초당 2.2토큰이었습니다. 그래픽카드 없이 잰 값은 이 블로그에 아직 없습니다.

VRAM이 8GB인데 될까요?

8GB 그래픽카드에서는 직접 재지 못했습니다. 16GB에서 Gemma 4 12B(파일 7.15GB)가 VRAM 8.6GB를 썼으니, 8GB에는 이보다 작은 파일이 맞을 것으로 보입니다(추정). 4편에서 파일 고르는 방법을 다룹니다.

로컬 AI는 ChatGPT만큼 똑똑한가요?

가장 큰 모델은 인터넷 서비스 쪽에 있습니다. 내 PC에서 돌리는 모델은 그보다 작습니다. 그래도 글 쓰기, 요약, 번역, 간단한 코딩에는 쓸 만했고, 웹 읽기 같은 도구를 붙이면 최신 정보 질문의 정답이 크게 늘었습니다.

돈이 드나요?

프로그램과 모델 파일은 무료로 받을 수 있습니다. 드는 돈은 그래픽카드 값과 전기요금입니다. 모델마다 사용 조건(라이선스)이 다르니, 일에 쓸 때는 모델 페이지의 조건을 확인해야 합니다.

인터넷이 없어도 되나요?

모델 파일을 받을 때만 인터넷이 필요합니다. 받은 뒤에는 인터넷 없이 대화할 수 있습니다.

출처

관련 게시글

댓글 0개