로컬 AI는 AI 모델 파일을 내려받아 내 PC의 그래픽카드에서 직접 돌리는 것입니다. 될지 안 될지는 그래픽카드 메모리(VRAM)가 정합니다. 직접 재 보니 VRAM 16GB 그래픽카드에서 Gemma 4 12B는 VRAM 8.6GB를 쓰고 초당 약 44토큰으로 돌았고, 더 큰 Gemma 4 26B도 초당 94토큰이 나왔습니다. 이 글은 로컬 AI를 처음 해 보는 사람을 위한 가이드 일곱 편 가운데 첫 편입니다.
- 로컬 AI란: 모델이 회사 서버가 아니라 내 PC에서 돌아갑니다. 질문이 밖으로 나가지 않고, 드는 돈은 전기요금입니다.
- 필요한 것 세 가지: 그래픽카드, 프로그램(Unsloth Studio), 모델 파일(GGUF). 프로그램과 모델 파일은 무료입니다.
- 가장 중요한 숫자는 VRAM: 모델이 VRAM에 다 들어가면 빠르고, 다 들어가지 않으면 크게 느려집니다. 같은 모델이 초당 2.2토큰과 33.5토큰으로 갈렸습니다.
- 16GB에서 잰 것: 9B와 12B 모델은 VRAM 8.6~10.6GB로 다 들어갔고, 작게 줄인 30B와 35B 파일도 13GB대로 들어갔습니다.
- 글만 쓰는 것이 아닙니다: 코딩, 그림, 영상, 음성, 검색도 내 PC에서 됩니다.
이 글의 속도와 VRAM 숫자는 모두 테스트에 쓰는 PC 두 대(RTX 5060 Ti 16GB, RTX 5090 32GB)에서 직접 잰 값입니다. 숫자마다 그 값을 잰 글을 링크했습니다. 8GB나 12GB 그래픽카드에서는 아직 재지 못했습니다.
이 글의 내용을 20초로 요약한 영상입니다(소리 없음).
로컬 AI는 무엇인가
ChatGPT, Claude, Gemini 같은 서비스에 질문을 하면 그 질문은 인터넷을 타고 회사 서버로 갑니다. 모델은 그 서버에서 돌아가고, 답만 돌아옵니다. 로컬 AI는 이 모델을 내 PC로 가져와서 돌리는 방식입니다. '로컬'은 '내 컴퓨터 안'이라는 뜻입니다.

모델이 어디에서 돌아가는지가 다릅니다.
| 항목 | 인터넷 AI 서비스 | 로컬 AI |
|---|---|---|
| 모델이 돌아가는 곳 | 회사 서버 | 내 PC의 그래픽카드 |
| 내가 쓴 질문과 파일 | 회사 서버로 전송 | PC 밖으로 나가지 않음 |
| 드는 돈 | 구독료 또는 쓴 만큼의 요금 | 그래픽카드 값과 전기요금 |
| 인터넷 | 꼭 필요 | 모델을 받을 때만 필요 |
| 쓸 수 있는 모델 | 회사가 내놓은 가장 큰 모델 | VRAM에 들어가는 공개 모델 |
| 사용 횟수 제한 | 요금제에 따라 있음 | 없음 |
이 표가 뜻하는 것: 로컬 AI가 더 똑똑한 것은 아닙니다. 가장 큰 모델은 인터넷 서비스 쪽에 있습니다. 로컬 AI를 쓰는 까닭은 자료가 밖으로 나가지 않는다는 점과, 횟수 제한 없이 마음대로 쓸 수 있다는 점입니다.
값만 보면 차이가 예전보다 작아졌습니다. 2026년 10월에 나온 Claude Haiku 5.5는 글 100만 토큰을 만드는 요금이 약 700원이고, 16GB 그래픽카드로 같은 양을 만들 때의 그래픽카드 전기요금은 모델 두 개 기준으로 25~94원으로 계산됐습니다. 계산 과정은 Claude Haiku 5.5 가격 글에 있습니다.
필요한 것 세 가지

그래픽카드, 프로그램, 모델 파일이 있으면 됩니다.
① 그래픽카드
AI 모델은 계산을 아주 많이 합니다. 이 계산을 그래픽카드(GPU)가 맡습니다. 그래픽카드에는 자기만 쓰는 메모리가 달려 있는데, 이것이 VRAM입니다. 모델 파일이 통째로 VRAM에 올라가야 빠르게 돕니다. 그래서 로컬 AI에서는 그래픽카드의 계산 속도보다 VRAM이 몇 GB인지를 먼저 봅니다.
② 프로그램
모델 파일만으로는 대화할 수 없습니다. 모델을 받아서 그래픽카드에 올리고, 채팅 화면을 띄워 주는 프로그램이 필요합니다. 이 블로그는 2026년 10월부터 Unsloth Studio로 테스트합니다. 그 전에는 LM Studio를 썼고, 바꾼 이유는 LM Studio에서 Unsloth Studio로 바꾼 이유에 적었습니다. 설치하는 방법은 2편에서 다룹니다.
③ 모델 파일
공개된 AI 모델은 Hugging Face라는 사이트에 올라옵니다. 내 PC에서 돌릴 때는 보통 GGUF라는 형식의 파일을 받습니다. 모델 하나가 파일 하나에 들어 있어서 다루기 쉽습니다. Unsloth Studio 안에서 검색해서 바로 받을 수 있습니다.
같은 모델도 파일이 여러 개 있습니다. 모델의 숫자를 덜 정밀하게 저장해 크기를 줄인 것으로, 이것을 양자화라고 합니다. 예를 들어 Qwen3.8 27B는 4비트로 줄인 파일이 16.81GB, 2비트로 줄인 파일이 9.3GB입니다. 더 줄일수록 작은 그래픽카드에 들어가지만 답의 품질은 조금씩 떨어집니다. 파일 이름 읽는 법은 3편에서 다룹니다.
내 그래픽카드의 VRAM은 몇 GB인가
윈도우에서는 작업 관리자로 볼 수 있습니다. Ctrl + Shift + Esc를 누르고, 성능 탭에서 GPU를 고르면 아래쪽에 전용 GPU 메모리가 나옵니다. 이 값이 VRAM입니다. 그 옆의 '공유 GPU 메모리'는 시스템 램(RAM)을 빌려 쓰는 것이어서 VRAM이 아닙니다.
NVIDIA 그래픽카드는 명령 프롬프트에서 아래 명령으로도 볼 수 있습니다.
nvidia-smi --query-gpu=name,memory.total --format=csv

오른쪽은 테스트 PC에서 실제로 나온 출력입니다. 32607MiB는 약 32GB입니다.
그래픽카드 이름에 VRAM이 적혀 있는 경우도 많습니다. 'RTX 5060 Ti 16GB'는 VRAM이 16GB라는 뜻입니다. 같은 이름에 8GB와 16GB 두 종류가 있는 제품도 있으니, 직접 확인하는 편이 확실합니다.
16GB 그래픽카드로는 어디까지 되나
RTX 5060 Ti 16GB에서 지금까지 잰 결과입니다. 모두 프로그램을 설치한 그대로의 기본 설정에서, 같은 질문(한글 800자 글 쓰기)으로 쟀습니다. 속도 단위 t/s는 1초에 만드는 토큰 수입니다. 토큰은 모델이 글을 세는 단위입니다. 이 측정에서 Gemma 4 12B가 쓴 한글 글 하나가 1,274자, 638토큰이었습니다.

16GB 그래픽카드에서 잰 속도입니다. 빨간 막대 하나만 초당 10토큰 아래입니다.
| 모델 | 파일 | VRAM | VRAM에 다 들어갔나 | 속도 | 프로그램 | 잰 글 |
|---|---|---|---|---|---|---|
| Gemma 4 12B QAT (Q4_0) | 7.15GB | 8.6GB | 예 | 44.5 t/s | LM Studio | 82번 |
| Qwen3.5 9B (UD-Q6_K_XL) | 8.76GB | 9.7GB | 예 | 46.4 t/s | LM Studio | 98번 |
| Qwen3.8 27B (IQ2_S, 2비트) | 9.3GB | 9.9GB | 예 | 33.5 t/s | LM Studio | 88번 |
| Ornith 1.5 9B (Q8_0) | 9.79GB | 10.6GB | 예 | 49.7 t/s | LM Studio | 97번 |
| Qwen3-Coder 30B A3B (UD-Q3_K_XL) | 12.86GB | 13.7GB | 예 | 140.5 t/s | Unsloth Studio | 115번 |
| Qwen3.6 35B A3B (UD-IQ3_XXS) | 14.07GB | 13.2GB | 예 | 90.8 t/s | Unsloth Studio | 110번 |
| Gemma 4 26B A4B QAT (UD-Q4_K_XL) | 13.27GB | 14.1GB | 일부는 시스템 램 | 94 t/s | Unsloth Studio | 109번 |
| Qwen3.8 27B (Q4_K_M, 4비트) | 16.81GB | 12.6GB | 일부는 시스템 램 | 2.2 t/s | LM Studio | 88번 |
이 표가 뜻하는 것: 16GB 그래픽카드에서는 9B와 12B 모델이 VRAM을 8.6~10.6GB만 써서 5GB 넘게 남습니다. 30B 안팎의 큰 모델도 3비트로 줄인 파일은 13GB대로 들어갔습니다. 파일이 16GB를 넘는 것만 크게 느렸습니다.
표를 볼 때 조심할 점이 두 가지 있습니다.
- 프로그램이 다른 줄끼리는 속도를 그대로 견주면 안 됩니다. 위쪽 넷은 LM Studio로, 아래쪽 셋은 Unsloth Studio로 쟀습니다. Unsloth Studio는 모델에 따라 MTP(토큰 여러 개를 한꺼번에 예측해 속도를 올리는 기능)를 자동으로 켭니다. 같은 Gemma 4 12B도 16GB에서 Unsloth Studio 기본값은 초당 52토큰이었고, 컨텍스트를 지정하자 94토큰이 됐습니다(111번 글).
- 이름에 A3B, A4B가 붙은 모델은 크기에 비해 빠릅니다. 전체는 30B지만 한 번에 3B만 쓰는 구조(MoE)여서 그렇습니다. 3편에서 설명합니다.
속도가 어느 정도인지 감이 안 온다면 GPU 체험에서 볼 수 있습니다. 잰 속도 그대로 글자가 나오는 모습을 재생해 줍니다.
32GB 그래픽카드에서는

32GB에서는 네 모델 모두 VRAM에 다 들어갔습니다.
| 모델 | 파일 | VRAM | 속도 | 프로그램 | 잰 글 |
|---|---|---|---|---|---|
| Gemma 4 12B QAT (UD-Q4_K_XL) | 6.72GB | 10.0GB | 233.5 t/s | Unsloth Studio | 111번 |
| Gemma 4 12B QAT (Q4_0) | 7.15GB | 9.0GB | 147 t/s | LM Studio | 80번 |
| Qwen3.8 27B (Q4_K_M, 4비트) | 16.81GB | 19.7GB | 72.6 t/s | LM Studio | 83번 |
| Muse Glimmer (Q4_K_M) | 18.16GB | 17.5GB | 74.5 t/s | LM Studio | 86번 |
이 표가 뜻하는 것: 32GB에서는 16GB에 다 들어가지 않던 27B 4비트 파일이 VRAM 19.7GB로 들어갑니다. 큰 그래픽카드의 장점은 속도보다 더 큰 파일을 덜 줄인 채로 올릴 수 있다는 점입니다.
VRAM이 모자라면 어떻게 되나
모델이 VRAM에 다 들어가지 않아도 프로그램은 대개 모델을 올려 줍니다. 넘치는 부분을 시스템 램에 두고 CPU로 계산하는 것입니다. 돌아가기는 하지만 많이 느려집니다. 같은 모델 Qwen3.8 27B로 잰 값입니다.

같은 모델이라도 VRAM에 다 들어가는지에 따라 속도가 크게 달랐습니다.
| 그래픽카드 | 파일 | VRAM에 다 들어갔나 | 속도 |
|---|---|---|---|
| RTX 5060 Ti 16GB | 4비트, 16.81GB | 일부는 시스템 램 | 2.2 t/s |
| RTX 5060 Ti 16GB | 2비트, 9.3GB | 예 | 33.5 t/s |
| RTX 5090 32GB | 4비트, 16.81GB | 예 | 72.6 t/s |
이 표가 뜻하는 것: 16GB 그래픽카드에 16.81GB 파일을 올리면 초당 2.2토큰입니다. 이 측정에서 글 하나(682토큰)를 쓰는 데 약 5분 10초가 걸렸습니다. 같은 모델을 9.3GB 파일로 바꾸자 15배 빨라졌습니다. 다만 2비트 파일은 생각(Thinking) 기능을 켜야 정확했습니다(88번 글).
그래서 모델을 고를 때는 파일 크기가 내 VRAM보다 작은지를 먼저 봅니다. 위의 측정에서 VRAM 사용량은 대체로 파일 크기와 비슷하거나 1~3GB 더 많았습니다. 대화가 길어지면 VRAM을 더 쓰기 때문에, 파일 크기에 2~3GB를 더해도 VRAM이 남는 파일을 고르면 무난합니다. 자세한 고르는 방법은 4편에서 다룹니다.
로컬 AI로 무엇을 할 수 있나
글을 쓰고 질문에 답하는 것만이 아닙니다. 이 블로그에서 직접 돌려 본 것을 종류별로 하나씩 적었습니다.

종류마다 직접 잰 값 하나씩입니다.
| 할 수 있는 일 | 직접 잰 값 | 그래픽카드 | 글 |
|---|---|---|---|
| 글 쓰기, 질문과 답 | Gemma 4 26B가 초당 94토큰 | 16GB | 109번 |
| 코딩 | Qwen3-Coder 30B가 기본값에서 초당 약 145토큰 | 16GB | 115번 |
| 도구 붙이기(MCP) | 웹 읽기와 파일 읽기를 붙이자 240번 중 3번이던 정답이 237번으로 | 32GB | 89번 |
| 그림 만들기 | Qwen-Image-2.1로 1024×1024 한 장에 7.6초, VRAM 21.0GB | 32GB | 106번 |
| 영상 만들기 | LTX-2.5로 소리가 든 5초 영상에 약 20초, VRAM 31.2GB | 32GB | 107번 |
| 음성 만들기 | VoiceStudio로 50초 길이 한국어 음성에 약 11초, VRAM 3.5GB 안쪽 | 16GB | 102번 |
| 내 글에서 검색 | EmbeddingGemma 2로 글 227조각을 1.06초에 검색용으로 변환, VRAM 0.5GB | 32GB | 114번 |
이 표가 뜻하는 것: 글, 코딩, 음성, 검색은 16GB나 그보다 작은 VRAM으로도 됩니다. 그림과 영상은 VRAM을 21GB, 31GB까지 써서 이 측정에서는 32GB 그래픽카드가 필요했습니다. 만든 그림과 영상은 갤러리에서 볼 수 있습니다.
처음이라면 무엇부터 하면 되나
- VRAM을 확인합니다. 위에서 본 작업 관리자나 명령어로 봅니다.
- Unsloth Studio를 설치합니다. 2편에서 화면과 함께 설명합니다.
- 작은 모델 하나로 시작합니다. 처음에는 Gemma 4 12B를 권합니다. 파일이 약 7GB이고, 16GB 그래픽카드에서 VRAM 8.6GB로 돌았습니다. 다만 생각(Thinking) 기능을 끄면 산수 문제를 틀렸으니, 계산이 필요한 질문에는 생각을 켭니다(82번 글).
- 익숙해지면 더 큰 모델로 갑니다. VRAM이 남는 만큼 큰 파일을 고르는 방법은 4편에서 다룹니다.
가이드 차례

모두 일곱 편이고, 차례대로 올립니다.
| 편 | 내용 |
|---|---|
| 1편 | 로컬 AI가 무엇이고, 내 PC로 되는가 (이 글) |
| 2편 | Unsloth Studio를 설치하고 첫 대화까지 |
| 3편 | 모델 이름은 어떻게 읽는가 (27B, Q4_K_M, GGUF, A3B, QAT) |
| 4편 | 내 그래픽카드에는 어떤 모델이 맞는가 |
| 5편 | 꼭 알아야 할 설정 세 가지 (컨텍스트, 생각, 온도) |
| 6편 | 느리거나 답이 안 나올 때 무엇을 보는가 |
| 7편 | 그다음에 해 볼 것 (코딩, 그림, 영상, 음성, 검색) |
이 표가 뜻하는 것: 일곱 편이 모두 올라와 있습니다. 차례로 읽어도 되고, 필요한 편만 읽어도 됩니다.
정리
- 로컬 AI는 모델을 내 PC에서 돌리는 것입니다. 자료가 밖으로 나가지 않고 횟수 제한이 없습니다.
- VRAM부터 확인합니다. 모델이 VRAM에 다 들어가는지가 속도를 가릅니다.
- 16GB면 시작하기에 충분했습니다. 9B와 12B는 VRAM이 5GB 넘게 남았고, 작게 줄인 30B와 35B 파일도 들어갔습니다.
- VRAM보다 큰 파일은 피합니다. 같은 모델이 초당 2.2토큰과 33.5토큰으로 갈렸습니다.
- 프로그램과 모델 파일은 무료입니다. 다음 편에서 설치부터 첫 대화까지 해 봅니다.
이 글의 한계
- 그래픽카드 두 종류에서만 쟀습니다. RTX 5060 Ti 16GB와 RTX 5090 32GB입니다. 8GB, 12GB, 24GB 그래픽카드와 AMD 그래픽카드, 맥에서는 재지 못했습니다.
- 측정한 프로그램이 섞여 있습니다. 2026년 10월 4일 전에 잰 것은 LM Studio, 그 뒤는 Unsloth Studio입니다. 표에 프로그램을 적었습니다.
- 속도는 한 가지 질문으로 잰 값입니다. 한글 800자 글 쓰기이고, 생각 기능은 껐습니다. 질문의 길이와 설정에 따라 달라집니다.
- VRAM 값은 컨텍스트가 가장 작을 때의 값입니다. 컨텍스트를 늘리면 더 씁니다. 각 글에 컨텍스트별 값이 있습니다.
- 전기요금 비교는 그래픽카드 전기만 넣은 어림값입니다.
- 2026년 10월 9일 기준으로 정리했습니다. 새 모델과 프로그램 판이 나오면 숫자가 달라질 수 있습니다.
자주 묻는 질문
그래픽카드가 없으면 로컬 AI를 못 쓰나요?
CPU와 시스템 램만으로도 모델은 돌아갑니다. 다만 많이 느립니다. 이 글의 측정에서 모델 일부가 시스템 램으로 넘어간 경우 초당 2.2토큰이었습니다. 그래픽카드 없이 잰 값은 이 블로그에 아직 없습니다.
VRAM이 8GB인데 될까요?
8GB 그래픽카드에서는 직접 재지 못했습니다. 16GB에서 Gemma 4 12B(파일 7.15GB)가 VRAM 8.6GB를 썼으니, 8GB에는 이보다 작은 파일이 맞을 것으로 보입니다(추정). 4편에서 파일 고르는 방법을 다룹니다.
로컬 AI는 ChatGPT만큼 똑똑한가요?
가장 큰 모델은 인터넷 서비스 쪽에 있습니다. 내 PC에서 돌리는 모델은 그보다 작습니다. 그래도 글 쓰기, 요약, 번역, 간단한 코딩에는 쓸 만했고, 웹 읽기 같은 도구를 붙이면 최신 정보 질문의 정답이 크게 늘었습니다.
돈이 드나요?
프로그램과 모델 파일은 무료로 받을 수 있습니다. 드는 돈은 그래픽카드 값과 전기요금입니다. 모델마다 사용 조건(라이선스)이 다르니, 일에 쓸 때는 모델 페이지의 조건을 확인해야 합니다.
인터넷이 없어도 되나요?
모델 파일을 받을 때만 인터넷이 필요합니다. 받은 뒤에는 인터넷 없이 대화할 수 있습니다.
출처
- 속도와 VRAM: 이 블로그의 각 테스트 글(표의 링크). 같은 값을 GPU 체험에서 볼 수 있습니다
- Unsloth Studio: unsloth.ai
- 모델 파일이 올라오는 곳: Hugging Face
- 요금 비교: 이 블로그의 Claude Haiku 5.5 가격 글
댓글 0개