AI 테스트 RTX-5090

[RTX 5090 32GB] Unsloth Studio로 Qwen3.8 27B를 돌리면 어떤 설정이 좋을까, 최대 컨텍스트에서도 초당 103토큰이 나왔다

EVUELA 2026년 10월 02일 8회 52분 전
[RTX 5090 32GB] Unsloth Studio로 Qwen3.8 27B를 돌리면 어떤 설정이 좋을까, 최대 컨텍스트에서도 초당 103토큰이 나왔다

로컬 AI를 돌리는 프로그램으로 LM Studio를 많이 쓰지만, 요즘은 Unsloth Studio 이야기도 자주 보입니다. 이번에는 Unsloth Studio를 RTX 5090에 설치하고, Qwen3.8 27B로 어떤 설정이 가장 나은지 하나씩 바꿔 가며 재 봤습니다.

결과를 먼저 적으면 이렇습니다.

  • 기본값(Auto)은 컨텍스트를 알아서 16만 8천 토큰으로 잡았습니다. 속도는 초당 72토큰이었습니다.
  • 속도 기능을 MTP로 바꾸자 초당 106토큰으로 48% 빨라졌습니다. 정답률은 그대로였습니다.
  • KV 캐시를 q8_0으로 줄이고 MTP를 켜면, 최대 컨텍스트(262,144)에서도 초당 103토큰이 나왔습니다. 같은 최대 컨텍스트를 기본 KV 캐시로 올리면 초당 20토큰으로 떨어졌습니다.
  • 생각(Thinking)은 Low만 켜도 정답률이 73%에서 99%로 올랐습니다.

Unsloth Studio에서 컨텍스트 262,144, KV 캐시 q8_0, MTP로 설정하고 800자 글을 쓰게 한 화면, 초당 119.9토큰

가장 결과가 좋았던 설정입니다. 오른쪽 위에 컨텍스트 262.1k가 보이고, 답 아래에 초당 119.9토큰이 표시됩니다.

Unsloth Studio는 무엇인가

Unsloth는 원래 AI 모델을 추가로 학습시키는(파인튜닝) 도구로 알려진 곳입니다. Hugging Face에서 모델을 받을 때 자주 보이는 "unsloth" 양자화 파일도 여기서 올립니다. Unsloth Studio는 이 팀이 만든 데스크톱 프로그램입니다. 공식 문서는 이렇게 소개합니다.

“free, open-source app for running and training AI models on your own local hardware”

Unsloth 공식 문서

풀어 쓰면, 내 PC에서 AI 모델을 돌리고 학습까지 시키는 무료 오픈소스 프로그램입니다. LM Studio가 모델을 받아서 대화하는 데 집중한다면, Unsloth Studio는 한 프로그램 안에 대화, 이미지 만들기, 모델 학습이 같이 들어 있습니다.

항목내용
만든 곳Unsloth (Daniel Han, Michael Han과 팀)
가격·라이선스무료, 오픈소스 (Apache 2.0과 AGPL-3.0)
지원 운영체제Windows, macOS, Linux
모델을 돌리는 엔진llama.cpp (LM Studio도 같은 엔진을 씁니다)
상태베타. 프로그램 왼쪽 위에 BETA라고 표시됩니다
GitHub 별약 7만 7천 개 (2026년 10월 1일 확인)

Unsloth Studio 첫 화면, 왼쪽 메뉴에 새 채팅·모델 허브·라이브러리·이미지·학습

첫 화면입니다. 왼쪽 메뉴에 새 채팅, 모델 허브, 라이브러리, 이미지, 학습이 있습니다.

화면 둘러보기

모델 허브에서는 모델을 찾아 내려받습니다. Qwen3.8 27B를 누르면 양자화 종류와 크기, 내려받기 수(630만), 라이선스(apache-2.0)가 나옵니다. 위쪽에는 내 PC 사양이 표시됩니다. 이 PC는 VRAM 32GB, 램 63GB로 나왔습니다.

Unsloth Studio 모델 허브에서 Qwen3.8-27B-GGUF를 선택한 화면

모델 허브입니다. 오른쪽 위에 내 PC의 VRAM과 램이 표시됩니다.

이미지 메뉴에는 만들기, 고치기, 늘리기, 키우기 같은 이미지 생성 기능이 있고, 학습 메뉴에서는 모델과 데이터를 골라 파인튜닝을 시작할 수 있습니다. 이번 글에서는 이 두 기능은 써 보지 않았고, 화면만 확인했습니다.

Unsloth Studio 이미지 만들기 화면

이미지 메뉴입니다. Create, Edit, Transform, Inpaint, Extend, Upscale, Reference가 있습니다.

Unsloth Studio 학습 화면, 모델·데이터셋·매개변수 설정

학습 메뉴입니다. 모델과 데이터셋을 고르면 오른쪽에 실행 미리보기가 나옵니다.

채팅 입력창의 + 버튼을 누르면 사진과 파일 첨부, 웹 검색, 코드 실행, 심층 조사(Deep research), 파일과 대화, MCP, 스킬이 나옵니다. "더 보기" 메뉴에는 동영상, 오디오, 내보내기, API가 있습니다.

Unsloth Studio 채팅 입력창의 + 메뉴: 사진·파일 첨부, 웹 검색, 코드, 심층 조사, MCP, 스킬

입력창의 + 메뉴입니다.

Unsloth Studio 왼쪽 메뉴와 더 보기 메뉴

"더 보기"를 누르면 프로젝트, 동영상, 오디오, 레시피, 내보내기, API가 나옵니다.

LM Studio에 받아 둔 모델을 그대로 쓴다

설치하고 가장 먼저 눈에 띈 점입니다. Unsloth Studio는 LM Studio 모델 폴더를 알아서 찾아 목록에 보여 줍니다. 같은 모델을 두 번 받을 필요가 없습니다. 모델 선택 창에 "LM STUDIO"라는 묶음이 따로 생기고, LM Studio에 받아 둔 Qwen3.8 27B가 그대로 나왔습니다.

Unsloth Studio의 내 PC 모델 목록, LM Studio에서 받은 모델이 LM Studio 표시와 함께 보임

내 PC에 있는 모델 목록입니다. 이름 아래에 "LM Studio"라고 표시된 것이 LM Studio에서 받아 둔 모델입니다.

LM Studio의 My Models 목록에 보이는 같은 Qwen3.8 27B 파일

LM Studio의 모델 목록입니다. 맨 아래 줄의 Qwen3.8 27B UD-Q4_K_XL이 위 화면과 같은 파일입니다.

한 가지 주의할 점이 있습니다. 화면에서 모델을 고르면 LM Studio 폴더의 파일을 그대로 쓰지만, API로 저장소 이름(unsloth/Qwen3.8-27B-GGUF)을 지정해 로드했더니 Hugging Face에서 같은 모델을 새로 받았습니다. 이번 측정은 이렇게 새로 받은 파일(지금 Hugging Face에 올라와 있는 17.56GB)로 통일해서 쟀습니다.

왜 Qwen3.8 27B인가

  • 지금 가장 많이 쓰는 로컬 모델입니다. 국내 로컬 AI 커뮤니티의 7월 이후 글 1,498개를 세어 보니, 제목에 Qwen이 들어간 글이 304개(약 20%)였고 그중 27B가 129개였습니다.
  • 많이 받습니다. Hugging Face에서 unsloth가 올린 Qwen3.8 27B 파일만 630만 번 넘게 받았습니다.
  • RTX 5090에 다 들어갑니다. 4비트 양자화 파일이 약 18GB라서, 32GB 카드에 올리고도 컨텍스트에 쓸 VRAM이 남습니다.
  • 라이선스가 자유롭습니다. Apache 2.0이라 상업적으로도 쓸 수 있습니다.

이 모델을 여러 곳의 양자화 파일로 비교한 결과는 같은 Q4_K_M인데 뭐가 다를까에, 16GB 그래픽카드에서 돌린 결과는 RTX 5060 Ti 16GB 테스트에 정리했습니다.

테스트 환경

항목내용
그래픽카드RTX 5090 (VRAM 32GB)
프로그램Unsloth Studio 데스크톱(베타), 백엔드 2026.9.12, llama.cpp b11160
모델Qwen3.8 27B, unsloth UD-Q4_K_XL (17.56GB)
측정 방법Unsloth Studio의 OpenAI 호환 API(127.0.0.1:8888)로 같은 질문을 반복해서 보냄. 속도는 첫 토큰이 나온 뒤부터 잰 생성 속도
샘플링Unsloth Studio 기본 프리셋 그대로 (temperature 0.6, top-p 0.95, top-k 20, presence penalty 1.5)
날짜2026년 10월 1~2일

화면에 표시되는 속도와 API로 잰 속도는 조금 다릅니다. 같은 설정에서 채팅 화면은 초당 116.6토큰, API 측정은 평균 106.3토큰이었습니다. 표의 숫자는 모두 API로 잰 값입니다.

기본값(Auto)으로 올리면

모델을 고르면 실행 설정 창이 뜹니다. 기본은 컨텍스트 길이가 Auto입니다.

Unsloth Studio 실행 설정 창, 예상 메모리와 Context Length Auto

실행 설정 창입니다. 예상 메모리가 37.49GiB로 VRAM을 넘는다고 빨갛게 표시되지만, Context Length를 Auto로 두면 VRAM에 맞게 컨텍스트를 줄여서 올립니다.

컨텍스트(context)는 모델이 한 번에 기억하는 글의 길이입니다. LM Studio는 이 값을 사용자가 직접 정합니다. 앞선 테스트에서 LM Studio는 이 모델을 컨텍스트 8,192로 올렸습니다. Unsloth Studio는 VRAM에 들어가는 만큼 최대한 크게 잡습니다. 실제로 실행된 옵션을 확인해 보니 이랬습니다.

항목Unsloth Studio가 정한 값
컨텍스트168,448 토큰
로드 뒤 전체 VRAM29.6GB (카드에서 쓸 수 있는 31.8GB의 약 93%)
GPU에 올린 레이어전부
속도 기능(Speculative Decoding)ngram 방식
동시에 처리하는 요청 수4
Flash Attention켬
VRAM 사용 한도97%

이 표가 뜻하는 것은, 아무것도 건드리지 않아도 16만 8천 토큰짜리 긴 컨텍스트로 올라간다는 점입니다. 책 한 권 분량을 넣고 대화할 수 있는 크기입니다. 대신 VRAM을 거의 다 씁니다. 게임이나 다른 AI 프로그램을 같이 돌리려면 컨텍스트를 줄여야 합니다.

Unsloth Studio 기본 설정에서 800자 글을 쓰게 한 화면, 초당 69.8토큰

기본 설정에서 800자 글을 쓰게 한 화면입니다. 오른쪽 위에 컨텍스트 168.2k, 답 아래에 초당 69.8토큰이 보입니다.

바꿀 수 있는 설정

실행 설정 창에서 "Advanced settings"를 켜면 항목이 늘어납니다.

Unsloth Studio 고급 설정: KV Cache Dtype, Speculative Decoding, Parallel Slots, Batch Size, Vision, Reasoning Budget, GPU Memory, VRAM Budget

고급 설정 위쪽입니다.

Unsloth Studio 고급 설정 아래쪽: Chat Template, Mmap/Mlock, Checkpoints, Cache RAM, Extra Arguments

고급 설정 아래쪽입니다. Extra Arguments에는 llama.cpp 실행 옵션을 직접 적을 수 있습니다.

설정쉽게 말하면기본값
Context Length모델이 한 번에 기억하는 글의 길이Auto (VRAM에 맞춰 자동)
KV Cache Dtype이미 읽은 글을 저장해 두는 공간(KV 캐시)을 몇 비트로 둘지. 줄이면 같은 VRAM에 더 긴 컨텍스트가 들어갑니다f16
Speculative Decoding다음 토큰을 미리 맞혀 두어 속도를 올리는 기능. Auto, MTP, DSpark, DFlash, Ngram, MTP+Ngram, OffAuto
Draft Tokens한 번에 미리 맞혀 볼 토큰 수 (MTP를 골랐을 때 나옵니다)auto (GPU에서는 2)
Parallel Slots동시에 처리할 요청 수auto (4)
Vision사진을 보는 기능켬
VRAM BudgetVRAM을 몇 %까지 쓸지97%

Speculative Decoding 메뉴: Auto, MTP, DSpark, DFlash, Ngram, MTP+Ngram, Off

속도 기능 메뉴입니다.

설정을 바꿔 가며 잰 결과

설정별 생성 속도와 컨텍스트 비교 그림

설정 8가지의 생성 속도와 컨텍스트입니다.

설정컨텍스트VRAM생성 속도채점 질문 (150번)
기본값 (Auto, ngram 방식)168,44829.6GB72.0 t/s109번
속도 기능 끔168,96029.5GB72.5 t/s재지 않음
MTP (토큰 2개)136,19229.8GB106.3 t/s110번
MTP (토큰 3개)127,23229.7GB104.2 t/s재지 않음
MTP (토큰 4개)119,04029.7GB95.5 t/s재지 않음
컨텍스트 32,768 + MTP32,76822.8GB108.1 t/s재지 않음
KV 캐시 q8_0 + MTP217,34429.7GB104.3 t/s111번
컨텍스트 최대 (기본 KV 캐시)262,14429.9GB20.3 t/s재지 않음
컨텍스트 최대 + KV 캐시 q8_0 + MTP262,14429.5GB102.8 t/s재지 않음

t/s는 초당 만드는 토큰 수이고, 800자 글을 쓰게 해서 생각을 끈 상태로 쟀습니다. 채점 질문을 재지 않은 설정은, 정답률에 영향을 줄 수 있는 설정(속도 기능, KV 캐시)을 대표로 골라 쟀기 때문입니다.

1. 속도는 MTP가 가장 크게 올렸다

기본값의 ngram 방식은 속도 기능을 끈 것과 차이가 없었습니다(72.0 대 72.5). ngram은 앞에 나온 글과 똑같은 구절이 다시 나올 때 빨라지는 방식이라, 새 글을 쓸 때는 효과가 없었습니다.

MTP로 바꾸면 초당 106.3토큰으로 48% 빨라졌습니다. MTP는 모델 파일 안에 들어 있는 작은 예측 레이어로 다음 토큰을 미리 맞혀 두는 기능입니다. 채점 질문 정답 수는 109번과 110번으로 같았습니다.

MTP로 바꾼 뒤 800자 글을 쓰게 한 화면, 초당 116.6토큰

MTP로 바꾸고 같은 질문을 한 화면입니다. 초당 69.8토큰에서 116.6토큰이 됐고, 컨텍스트는 136.2k로 줄었습니다.

그런데 왜 기본값이 MTP가 아닐까요. 설정 창에 이유가 적혀 있었습니다.

Unsloth Studio의 안내문: 모델은 VRAM에 들어가지만 MTP 부품은 들어가지 않아 Auto가 컨텍스트를 유지하고 MTP를 껐다는 내용

기본 설정으로 올린 뒤 나오는 안내문입니다.

풀어 쓰면, MTP는 VRAM을 더 쓰기 때문에 컨텍스트를 줄여야 켤 수 있고, Auto는 속도보다 긴 컨텍스트를 골랐다는 뜻입니다. 실제로 MTP를 켜자 컨텍스트가 168,448에서 136,192로 3만 2천 토큰쯤 줄었습니다.

한 번에 미리 맞히는 토큰 수는 2개가 가장 좋았습니다. 3개는 비슷했고(104.2), 4개는 오히려 느려졌습니다(95.5). 많이 맞혀 보려다 틀리면 그만큼 계산을 버리기 때문입니다. 숫자를 늘릴수록 컨텍스트도 줄었습니다.

2. KV 캐시를 q8_0으로 줄이면 컨텍스트가 크게 늘었다

KV 캐시는 모델이 이미 읽은 글을 다시 계산하지 않으려고 저장해 두는 공간입니다. 컨텍스트가 길수록 이 공간이 커집니다. 기본은 16비트(f16)인데, 8비트(q8_0)로 줄이면 같은 VRAM에 더 긴 컨텍스트가 들어갑니다.

KV Cache Dtype 메뉴: f16, bf16, q8_0, q4_0, q4_1, q5_0, q5_1, iq4_nl, f32

KV 캐시 종류 메뉴입니다.

MTP를 켠 상태에서 KV 캐시만 q8_0으로 바꾸자 컨텍스트가 136,192에서 217,344로 늘었습니다. 속도는 104.3 t/s로 거의 같았고, 채점 질문은 150번 중 111번으로 떨어지지 않았습니다. 2만 자 글 속에 숨긴 정보도 5곳 모두 찾았습니다.

3. 최대 컨텍스트: 그냥 올리면 20 t/s, 설정을 맞추면 103 t/s

이 모델의 최대 컨텍스트는 262,144 토큰입니다. 이 값을 직접 넣고 기본 KV 캐시로 올리면 로드는 되지만 초당 20.3토큰으로 떨어졌습니다. VRAM에 다 들어가지 않아서 프로그램이 모델의 일부를 시스템 램으로 내렸기 때문입니다.

KV 캐시를 q8_0으로 줄이고 MTP를 켜서 다시 올리면 모델 전체가 VRAM에 들어가고 초당 102.8토큰이 나왔습니다. 같은 최대 컨텍스트인데 5배 차이입니다.

컨텍스트 262144, KV Cache q8_0, Speculative Decoding MTP로 맞춘 설정 화면

최대 컨텍스트 설정입니다. 예상 메모리가 30.65GiB로 내려갔습니다. 컨텍스트 칸 아래에 예상 한도(168,960 토큰)를 넘는다는 안내가 나오지만, 실제로는 모델 전체가 VRAM에 올라갔습니다.

이 설정에는 값이 하나 따라옵니다. VRAM을 아끼려고 프로그램이 사진을 보는 부품을 그래픽카드가 아니라 CPU에서 돌립니다. 그래서 사진 한 장을 설명하는 데 46초가 걸렸습니다. 기본 설정에서는 2~4초였습니다. 동시에 처리하는 요청 수도 4에서 2로 줄었습니다. 사진을 자주 쓴다면 이 설정은 맞지 않습니다.

생각(Thinking) 단계는 어디에 둘까

Qwen3.8 27B는 답하기 전에 생각하는 단계를 고를 수 있습니다. Unsloth Studio에서는 입력창의 Thinking 버튼에서 None, Low, Medium, High, Extra High를 고릅니다. 화면 기본값은 Medium입니다.

Unsloth Studio 입력창의 Thinking 메뉴: None, Low, Medium, High, Extra High, Preserve thinking

입력창의 생각 단계 메뉴입니다.

생각 단계별 정답률과 걸린 시간 비교 그림

생각 단계별 채점 질문 정답률과 걸린 시간입니다.

생각 단계채점 질문 정답50문제 푸는 시간800자 글 한 편
끔 (None)150번 중 109번 (73%)18초약 9초
Low100번 중 99번 (99%)93초약 10초
Medium100번 중 100번94초약 15초
Extra High50번 중 50번100초1분 52초~3분 11초

이 표가 뜻하는 것은 두 가지입니다.

  • 생각을 끄면 암산에서 많이 틀립니다. 예를 들어 "48,000원에서 25%, 다시 10%를 할인하면 얼마인가" 같은 문제를 답만 쓰게 하면 틀리는 일이 잦았습니다. Low만 켜도 거의 다 맞혔습니다.
  • Extra High는 글쓰기에는 지나칩니다. 정답률은 Low, Medium과 같은데, 800자 글 한 편을 쓰려고 생각에만 9천~1만 5천 토큰을 썼습니다. 답을 받는 데 2~3분이 걸렸습니다. 어려운 문제를 풀 때만 켜는 편이 낫습니다.

Qwen3.8 27B의 생각 단계가 답 나오는 시간에 얼마나 영향을 주는지는 생각 단계 하나 낮추자 12초 만에 나왔다에서도 다뤘습니다.

긴 글, 사진, 없는 소설

테스트결과
긴 글 요약 (약 1만 5천 자, 7,402토큰)기본값: 첫 토큰까지 2.4초, 요약은 70.0 t/s. MTP: 2.5초, 117.3 t/s
2만 자 글 속 정보 찾기 (5곳)잰 다섯 설정 모두 5곳을 다 찾음. 숨기지 않은 글에는 "없음"이라고 답함
사진 설명 (모래시계 사진, 3번)3번 모두 모래시계 두 개와 뒤의 전자 부품을 맞게 설명. 기본 설정 2~4초, 최대 컨텍스트 설정 46초
없는 소설 줄거리 (6번)6번 모두 지어내지 않고 "확인되지 않는 작품"이라고 답함
한국어 글의 외국 문자800자 글에 한자나 일본 문자가 가끔 한두 낱말 섞임 (예: "显卡", "ロット"). 설정과 상관없이 나타남

API도 바로 쓸 수 있다

Unsloth Studio는 OpenAI 호환 API를 기본으로 켜 둡니다. 주소는 http://127.0.0.1:8888/v1이고, 프로그램에서 만든 API 키가 있어야 합니다. "더 보기 → API" 화면에서 들어온 요청, 걸린 시간, 속도를 볼 수 있습니다. 이번 측정도 이 API로 했습니다.

Unsloth Studio API 화면: Base URL, 요청 수, 평균 지연, 처리 속도, 요청 목록

API 화면입니다. 요청마다 걸린 시간과 속도가 기록됩니다.

API로 도구를 붙였을 때 로컬 모델이 얼마나 달라지는지는 로컬 AI에 MCP 도구를 붙인 테스트에 정리했습니다.

정리: 쓰임새별 추천 설정

쓰임새별 추천 설정 세 가지: 평소, 긴 문서, 다른 프로그램과 함께

RTX 5090 32GB에서 Qwen3.8 27B를 쓸 때의 추천 설정입니다.

  • 평소에는 Speculative Decoding을 MTP로 바꾸는 것 하나만 해도 됩니다. 속도가 48% 오르고 컨텍스트는 13만 6천 토큰입니다.
  • 긴 문서나 긴 대화에는 컨텍스트 262,144, KV 캐시 q8_0, MTP 조합이 맞습니다. 다만 사진 설명은 느려집니다.
  • 다른 프로그램과 VRAM을 나눠 쓸 때는 컨텍스트를 32,768로 고정합니다. VRAM이 22.8GB로 줄고 속도는 가장 빠릅니다.
  • 생각 단계는 Low를 권합니다. Medium과 정답률 차이가 거의 없고 답이 더 빨리 나옵니다.

이 글의 한계

  • RTX 5090 한 대, 모델 하나, 양자화 하나(UD-Q4_K_XL)로 잰 결과입니다. VRAM이 다른 카드에서는 Auto가 잡는 컨텍스트와 추천 설정이 달라집니다. 내 카드에서 어떤 모델이 돌아가는지는 GPU 체험에서 볼 수 있습니다.
  • Unsloth Studio는 베타라서 기본값과 화면이 바뀔 수 있습니다.
  • LM Studio와 같은 조건으로 나란히 잰 비교는 이 글에 없습니다. 두 프로그램 모두 llama.cpp를 쓰지만 엔진 버전과 기본값이 다릅니다. 같은 설정으로 맞춰 잰 비교는 다음 글에서 다룹니다.
  • 이미지 만들기와 학습 기능은 화면만 확인했고 직접 돌려 보지 않았습니다.

자주 묻는 질문

Unsloth Studio는 무료인가요?

네. 무료 오픈소스 프로그램입니다. Windows, macOS, Linux에서 쓸 수 있고, 지금은 베타 상태입니다.

LM Studio에 받아 둔 모델을 Unsloth Studio에서 쓸 수 있나요?

쓸 수 있었습니다. 설치하자 LM Studio 모델 폴더가 자동으로 등록됐고, 모델 선택 창에 "LM STUDIO" 묶음으로 나왔습니다. 화면에서 고르면 새로 받지 않고 바로 로드됩니다.

Auto로 두면 왜 MTP가 꺼지나요?

MTP가 VRAM을 더 쓰기 때문입니다. RTX 5090에서 Qwen3.8 27B를 올리면, Auto는 컨텍스트를 길게 잡는 쪽을 고르고 MTP를 끕니다. 설정에서 Speculative Decoding을 MTP로 직접 고르면 컨텍스트를 조금 줄이고 MTP를 켭니다.

KV 캐시를 q8_0으로 줄이면 답이 나빠지지 않나요?

이번 테스트에서는 차이가 보이지 않았습니다. 채점 질문 150번 중 111번을 맞혀 기본(f16)의 110번과 같았고, 2만 자 글 속 정보도 5곳 모두 찾았습니다. 다만 질문 수가 많지 않아서 작은 차이는 있을 수 있습니다.

컨텍스트를 최대로 올리면 왜 느려지나요?

기본 KV 캐시(f16)로는 최대 컨텍스트가 32GB VRAM에 다 들어가지 않습니다. 넘치는 만큼 모델의 일부가 시스템 램으로 내려가서 초당 20토큰으로 떨어졌습니다. KV 캐시를 q8_0으로 줄이면 전부 VRAM에 들어가서 초당 103토큰이 나왔습니다.

참고: Unsloth Desktop 공식 문서 · Unsloth Studio 공식 문서 · GitHub unslothai/unsloth (2026년 10월 1일 확인)

관련 게시글

댓글 0개