로컬 AI 시작하기

로컬 AI 시작하기 2편, Unsloth Studio 설치부터 Gemma 4 12B 첫 대화까지, 16GB는 설정 하나로 52토큰이 94토큰이 됐다

2026년 10월 09일 8회 1일 전
로컬 AI 시작하기 2편, Unsloth Studio 설치부터 Gemma 4 12B 첫 대화까지, 16GB는 설정 하나로 52토큰이 94토큰이 됐다

Unsloth Studio는 AI 모델을 받아서 내 그래픽카드에 올리고 대화하는 무료 프로그램입니다. 설치하고 Gemma 4 12B(파일 약 6.7GB)를 받아 첫 질문을 하기까지는 네 단계입니다. 설치한 그대로의 기본값으로 올렸을 때 RTX 5090 32GB에서는 초당 약 233토큰, RTX 5060 Ti 16GB에서는 약 52토큰이 나왔습니다. 이 글은 로컬 AI 시작하기 가이드의 2편입니다.

  • 네 단계: 설치, 모델 받기, 모델 올리기, 첫 질문. 처음 한 번만 설치와 받기가 필요합니다.
  • 설치: 윈도우용 설치 파일을 받거나, PowerShell 명령 한 줄로 설치합니다.
  • 처음 받을 모델: Gemma 4 12B QAT의 UD-Q4_K_XL 파일. 16GB 그래픽카드에 다 들어갑니다.
  • 16GB라면: Context Length를 Auto 대신 숫자로 정하면 약 52토큰에서 약 94토큰으로 빨라졌습니다.
  • 계산이 필요한 질문: 생각(Thinking)을 켭니다. 끄면 산수를 틀렸습니다.

설치 과정은 Unsloth 공식 문서를 읽고 정리했습니다. 프로그램 화면은 이 블로그가 2026년 10월 초에 테스트하면서 찍은 캡처이고, 속도는 직접 잰 값입니다. 설치 화면 자체는 새로 찍지 못했습니다. 프로그램이 자주 바뀌어서 지금 화면과 조금 다를 수 있습니다.

이 글의 내용을 20초로 요약한 영상입니다(소리 없음).

설치부터 첫 대화까지 네 단계를 적은 그림. 1 설치: Unsloth Studio를 받아 설치하고 비밀번호를 만든다. 2 모델 받기: 모델 허브에서 Gemma 4 12B를 찾아 Download를 누른다. 3 모델 올리기: 위쪽의 모델 고르는 곳에서 받은 모델을 누른다. 4 첫 질문: 입력 칸에 한국어로 질문을 쓰고 보낸다

처음 한 번만 1번과 2번이 필요합니다.

시작하기 전에 확인할 것

항목내용
운영체제윈도우 10 또는 11(64비트). 맥과 리눅스용도 있습니다
그래픽카드NVIDIA 그래픽카드와 드라이버. VRAM은 1편의 방법으로 확인합니다
저장 공간모델 파일 하나가 약 6.7GB입니다. 모델을 여러 개 받으면 수십 GB가 필요합니다
인터넷프로그램과 모델을 받을 때만 필요합니다

이 표가 뜻하는 것: 공식 문서에는 필요한 VRAM이나 램의 최소값이 적혀 있지 않습니다. 이 블로그가 직접 돌려 본 것은 VRAM 16GB와 32GB이고, Gemma 4 12B는 16GB에서 VRAM 8.6GB를 썼습니다.

1단계. Unsloth Studio 설치

윈도우에서 설치하는 방법은 두 가지입니다.

Unsloth Studio 설치 방법 두 가지. 방법 1 설치 파일: unsloth.ai/download/windows에서 윈도우용 데스크톱 앱을 받고, 설치 파일을 실행하고, 처음 열 때 비밀번호를 만든다. 방법 2 PowerShell: unsloth.ai의 install.ps1을 받아 실행하는 명령 한 줄로 설치하고, unsloth studio -p 8888 명령으로 다시 켠다

공식 설치 안내를 정리한 그림입니다.

방법 1. 설치 파일

  1. unsloth.ai/download/windows에서 윈도우용 데스크톱 앱을 받습니다.
  2. 받은 설치 파일을 실행해 안내대로 설치합니다.
  3. 프로그램을 처음 열면 새 비밀번호를 만들라는 화면이 나옵니다. 이 비밀번호는 내 PC의 Unsloth Studio에 들어갈 때 쓰는 것입니다.

방법 2. PowerShell

시작 메뉴에서 PowerShell을 열고 아래 명령을 넣습니다.

irm https://unsloth.ai/install.ps1 | iex

설치가 끝나면 바로 실행할지 묻습니다. 나중에 다시 켤 때는 아래 명령을 쓰고, 브라우저에서 http://127.0.0.1:8888을 엽니다.

unsloth studio -p 8888

업데이트는 같은 설치 명령을 한 번 더 실행하면 됩니다. 처음이라면 방법 1이 쉽습니다.

설치하고 처음 보는 화면

Unsloth Studio의 첫 화면. 왼쪽에 새 채팅, 모델 허브, 라이브러리, 이미지, 학습, 더 보기 메뉴가 있고, 가운데에 Ask anything 입력 칸, 위쪽에 Select model, 오른쪽에 Run settings(Temperature 0.6, Top P 0.95, Top K 20 등)가 있다

모델을 아직 고르지 않은 첫 화면입니다. 위쪽에 Select model이라고 나옵니다.

위치무엇인가
왼쪽 메뉴새 채팅, 모델 허브(모델 받는 곳), 라이브러리, 이미지, 학습
위쪽 Select model받은 모델 가운데 쓸 것을 고르는 곳
가운데 입력 칸질문을 쓰는 곳
오른쪽 Run settings컨텍스트, 온도 같은 설정. 처음에는 건드리지 않아도 됩니다

이 표가 뜻하는 것: 처음에는 모델 허브와 Select model, 입력 칸 세 곳만 쓰면 됩니다. 설정은 5편에서 다룹니다.

2단계. 모델 받기

왼쪽 메뉴에서 모델 허브를 누릅니다. 검색 칸에 gemma-4-12B를 넣고 gemma-4-12B-it-qat-GGUF(올린 곳 unsloth)를 고릅니다. 파일 종류가 UD-Q4_K_XL인지 확인하고 Download를 누릅니다.

Unsloth Studio의 모델 허브 화면. 위쪽에 검색 칸과 32 GiB VRAM, 63 GiB RAM 표시가 있고, 왼쪽에 모델 목록, 오른쪽에 고른 모델 Qwen3.8-27B-GGUF의 설명과 UD-Q6_K_XL GGUF 26 GB 파일 선택, Download 버튼이 있다

모델 허브 화면입니다. 이 캡처에서는 Qwen3.8 27B를 고른 상태입니다. Gemma 4 12B도 같은 방법으로 찾아 Download를 누릅니다.

화면에서 볼 것은 세 가지입니다.

  • 오른쪽 위의 VRAM 표시: 프로그램이 읽은 내 그래픽카드의 VRAM입니다. 위 캡처는 32GB PC라서 32 GiB로 나옵니다.
  • 파일 종류와 크기: 모델 이름 아래에 UD-Q6_K_XL · 26 GB처럼 나옵니다. 누르면 다른 크기의 파일을 고를 수 있습니다. 내 VRAM보다 작은 파일을 고릅니다.
  • Download 버튼: 누르면 받기 시작합니다.

받은 파일은 %USERPROFILE%\.cache\huggingface\hub\ 폴더에 들어갑니다. 모델을 지우고 싶을 때 이 폴더를 보면 됩니다. 파일 이름의 Q4, UD 같은 글자가 무슨 뜻인지는 3편에서 다룹니다.

3단계. 모델 올리기

채팅 화면으로 돌아와 위쪽의 Select model을 누릅니다. On Device에 방금 받은 모델이 보입니다. 이름을 누르면 그래픽카드에 올라가기 시작하고, 끝나면 이름 옆에 Loaded가 붙습니다. 이 과정을 '로드'라고 합니다.

Unsloth Studio에서 모델을 고르는 창. On Device 목록에 gemma-4-12B-it-qat-GGUF가 있고 Loaded, UD-Q4_K_XL, 12B, 6.7 GB라고 표시된다. 아래에 Eject model 버튼이 있고, 위쪽에 - / 262.1k 컨텍스트 표시가 있다

Gemma 4 12B가 올라간 모습입니다. Loaded라고 나오면 준비가 끝난 것입니다.

  • Loaded: 모델이 그래픽카드에 올라가 있다는 표시입니다.
  • 6.7 GB: 파일 크기입니다.
  • Eject model: 모델을 그래픽카드에서 내립니다. 게임이나 다른 작업을 할 때 VRAM을 비우려면 누릅니다.
  • 오른쪽 위의 262.1k: 컨텍스트(모델이 한 번에 기억하는 글의 길이)입니다. 이 PC에서는 기본값이 모델의 최대값인 262,144토큰으로 잡혔습니다.

16GB 그래픽카드라면 컨텍스트를 숫자로 정합니다

오른쪽 Run settings를 열면 Context Length가 Auto로 되어 있습니다. 32GB에서는 Auto 그대로 써도 됐습니다. 16GB에서는 Auto로 올리면 속도 기능(MTP)이 꺼져서 느렸고, 숫자로 정하자 켜졌습니다.

Unsloth Studio의 Run settings 화면. Estimated Memory Usage GPU 13.96 GiB, Total 16.46 GiB, Context Length Auto, Advanced settings 아래 KV Cache Dtype f16, Speculative Decoding Auto가 보인다

오른쪽이 Run settings입니다. Context Length가 Auto이고, 위에 예상 메모리 사용량이 나옵니다.

그래픽카드Context Length속도
RTX 5090 32GBAuto (기본값)233.5 t/s
RTX 5060 Ti 16GBAuto (기본값)약 52 t/s
RTX 5060 Ti 16GB숫자로 지정약 94 t/s

이 표가 뜻하는 것: 16GB에서는 설정 하나로 속도가 1.8배가 됐습니다. 처음에는 Context Length에 32768을 넣어 보기를 권합니다. 이 값에서 VRAM은 9.6GB였습니다. 자세한 측정은 Gemma 4 12B 기본값 글에 있습니다.

Gemma 4 12B를 Unsloth Studio에 올렸을 때의 속도 막대 그래프. RTX 5090 32GB 기본값 233.5 t/s, RTX 5060 Ti 16GB 컨텍스트를 숫자로 지정 약 94 t/s, RTX 5060 Ti 16GB 기본값 약 52 t/s

같은 모델을 두 그래픽카드에서 잰 값입니다.

4단계. 첫 질문

입력 칸에 한국어로 질문을 쓰고 보냅니다. 답이 한 글자씩 나오기 시작합니다. 답이 끝나면 아래에 tok/s가 나옵니다. 1초에 만든 토큰 수, 곧 속도입니다.

Unsloth Studio에서 Gemma 4 12B가 한국어로 답한 화면. 집에서 AI 모델을 돌릴 때 알아야 할 점을 그래픽카드와 VRAM, 소프트웨어 환경, 전력과 발열로 나눠 설명하고, 답 아래에 226.3 tok/s, 위쪽에 1.9k / 262.1k 컨텍스트 표시가 있다

RTX 5090에서 Gemma 4 12B가 답한 화면입니다. 답 아래에 226.3 tok/s라고 나옵니다.

  • 답 아래의 tok/s: 이 답의 속도입니다. 위 캡처는 226.3이고, 같은 질문을 5번 쟀을 때는 230.9~234.2였습니다.
  • 오른쪽 위의 1.9k / 262.1k: 지금까지 쓴 컨텍스트와 전체 컨텍스트입니다. 대화가 길어지면 앞의 숫자가 늘어납니다.
  • 답 아래의 단추들: 복사, 다시 만들기, 지우기입니다.

첫 질문으로는 이런 것이 좋습니다. "집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점을 800자 정도로 써 줘." 이 블로그가 모든 모델에 똑같이 묻는 질문이라, GPU 체험에 있는 다른 그래픽카드의 답과 견줘 볼 수 있습니다.

생각(Thinking) 단추

입력 칸 오른쪽에 전구 모양의 Thinking 단추가 있습니다. 켜면 모델이 답하기 전에 먼저 풀이를 적어 봅니다. 답은 조금 늦게 시작하지만 계산과 추론이 정확해집니다.

Unsloth Studio 입력 칸의 Thinking 메뉴. None, Low, Medium, High, Extra High와 Preserve thinking 항목이 있고 Medium이 선택돼 있다

모델에 따라 생각 단계를 고를 수 있습니다. 이 캡처는 Qwen3.8 27B의 메뉴입니다.

Gemma 4 12B는 생각을 끄면 간단한 산수를 5번 모두 틀렸고, 켜면 5번 모두 맞았습니다(82번 글, 111번 글). 글 쓰기나 요약처럼 계산이 없는 일은 꺼도 됩니다. 자세한 것은 5편에서 다룹니다.

잘 안 될 때

증상먼저 볼 것
모델이 목록에 안 보임받기가 끝났는지, Select model의 On Device를 눌렀는지 확인합니다
답이 아주 느림Run settings의 예상 메모리가 VRAM을 넘는지 봅니다. 넘으면 더 작은 파일을 받습니다
16GB인데 생각보다 느림Context Length를 Auto 대신 32768로 정합니다
계산을 틀림Thinking을 켭니다

이 표가 뜻하는 것: 이 블로그가 테스트하면서 자주 겪은 문제 네 가지입니다. 더 자세한 점검 순서는 6편에서 다룹니다.

정리

  • 설치는 설치 파일 하나면 됩니다. 처음 열 때 비밀번호를 만듭니다.
  • 모델 허브에서 Gemma 4 12B(UD-Q4_K_XL)를 받습니다. 약 6.7GB입니다.
  • Select model에서 고르면 올라갑니다. Loaded가 나오면 질문할 수 있습니다.
  • 16GB라면 Context Length를 숫자로 정합니다. 약 52토큰이 약 94토큰이 됐습니다.
  • 계산이 필요하면 Thinking을 켭니다.

다음 편(3편)은 gemma-4-12B-it-qat-GGUF UD-Q4_K_XL 같은 모델 이름을 읽는 방법입니다. 가이드 전체 차례는 1편에 있습니다.

이 글의 한계

  • 설치 과정은 공식 문서를 읽고 정리했습니다. 설치 화면은 새로 찍지 못했습니다. 테스트 PC에는 이미 설치돼 있기 때문입니다.
  • 화면 캡처는 2026년 10월 초의 것입니다. Unsloth Studio는 아직 베타이고 자주 바뀝니다. 지금 판과 단추 위치가 다를 수 있습니다.
  • 모델 허브 캡처는 다른 모델(Qwen3.8 27B)을 고른 화면입니다. 받는 방법은 같습니다.
  • 윈도우와 NVIDIA 그래픽카드에서만 써 봤습니다. 맥, 리눅스, AMD 그래픽카드는 확인하지 못했습니다.
  • 속도는 한글 800자 글 쓰기 한 가지 질문으로 잰 값입니다.

자주 묻는 질문

Unsloth Studio는 무료인가요?

무료로 받아 쓸 수 있습니다. 모델 파일도 무료로 받습니다. 모델마다 사용 조건(라이선스)이 다르니 일에 쓸 때는 모델 페이지에서 확인해야 합니다.

비밀번호는 왜 만드나요?

Unsloth Studio는 내 PC에서 돌아가는 작은 서버입니다. 처음 열 때 이 서버에 들어갈 비밀번호를 만들게 합니다. 회사 사이트에 가입하는 것이 아닙니다.

LM Studio나 Ollama를 써도 되나요?

됩니다. 같은 GGUF 파일을 쓰는 프로그램들입니다. 이 블로그는 2026년 10월부터 Unsloth Studio로 테스트하고 있고, 바꾼 이유는 이 글에 적었습니다. 기본값끼리의 속도는 LM Studio와 거의 같았습니다. Ollama는 이 블로그에서 재 보지 않았습니다.

모델 파일은 어디에 저장되나요?

윈도우에서는 %USERPROFILE%\.cache\huggingface\hub\ 폴더입니다. 프로그램을 지워도 이 폴더의 모델 파일은 남으니, 필요 없으면 따로 지웁니다.

출처

관련 게시글

댓글 0개